进阶练习 + 自评 + 毕业准则
L1/L2/L3a/L3b 都做完, 你已有~250 行手搓 harness + 2 个真实场景实战。这一节给你下一步该练什么 (8 题) + 怎么知道自己学透了 (8 道自评) + 整套章 0-6 的退出准则——能勾选 6/8 题, "agent 工程师"这个标签真正属于你。
Core Curriculum
Level 3 · 实操闭环
阅读时间 · 23 分钟
练习 · 必做
中波动
Last reviewed · 2026-04-22
你将学会什么
- 理解《进阶练习 + 自评 + 毕业准则》在 agent harness / coding agent 学习路径里的核心作用。
- 能用本页给出的判断法区分“概念、机制、边界、代价”。
- 知道这页内容之后会在哪一章被复用到源码阅读或动手实践里。
学习前提
建议先读《L3b / Mini Coding Agent / 用 真 smolagents + Docker sandbox》;如果你是跳读,至少先看本章索引与本页 TL;DR。
这页在课程中的位置
课程实操闭环,要求你把抽象真正写进代码与运行流程。
本页 1 句话结论
L1/L2/L3a/L3b 都做完, 你已有 ~250 行手搓 harness + 2 个真实场景实战 。这一节给你 下一步该练什么 (8 题) + 怎么知道自己学透了 (8 道自评) + 整套 章 0-6 的退出准则 ——能勾选 6/8 题, "agent 工程师"这个标签真正属于你。
带走的判断法
先判断任务类型,再决定手搓 harness 还是借框架。
Source Policy
课程实操:可运行案例 + 官方 SDK / 仓库。
这一节怎么用
- 不必都做。8 个进阶练习按你工作场景挑 2-3 个就够——选你工作真用得到的, 不是看着酷的。
- 自评必须做。8 道题花 20 分钟口头回答自己, 答不出来的就回到对应章重读。这是把"读过 + 跑过" 变成"真的懂了"的最后一关。
- 毕业准则给的是 cap。能给 5/8 题打勾就已经超过 80% 自称懂 agent 的人; 给 8/8 打勾就可以去开公开课了。
- 之后去哪: 末尾给一份持续追踪的资料口袋, 这领域 6 个月就要重新洗牌一次, 最后一节给你一个永久的入口。
8 个进阶练习 · 按场景挑
1
HITL 审批流 · 把 L2 middleware 升级成跨进程审批
MEDIUM
L2 你的 hitl_mw 用 input() 阻塞主线程——单 user 单进程能用, 真业务不行。改成: agent 在 worker 进程, HITL pending 写到 SQLite/Redis, 前端 UI 拉 pending 列表 + 提交决策, agent 用 LangGraph interrupt() 等价机制 resume。
为什么练 任何会花真钱 / 改真状态的 agent 都需要 HITL。这一题你才会真正理解为什么 LangGraph 的 interrupt() + checkpoint 是一对必须配套的特性——单独 interrupt 没意义, 必须能持久化。
📐 三轴: A↓1 B↓1(HITL 把控制权拉回人类, 缩小动作空间)
2
多 model provider 切换 · 同 agent 跨 OpenAI / Anthropic / 本地 model
EASY
把 L2 harness 的 OpenAI(...) 换成 LiteLLM 或 Vercel ai-sdk-style 的统一接口, 用环境变量切 openai/gpt-4o / anthropic/claude-3-5-sonnet / ollama/qwen2.5。同一个 agent 跑 3 个 model, 看 trace 差异——尤其是 tool_call 行为差异(GPT 偏并行, Claude 偏串行, qwen 经常忘 schema)。
为什么练 第一手感受"
同 agent 不同 model 行为差几条街", 这是
章 4 比较方法讲过的 model selection 真实痛点。也是发现"
哪些 model 给 agent 用是浪费钱"的最快方式。
📐 同一个三轴位置, 模型本身决定能在该位置跑多稳。
3
Custom backend · 把 VFS 接到 S3 / 你家对象存储
MEDIUM
L1/L2 没有真 VFS, agent 写文件就直接落本地 disk。给 L2 加一层抽象 backend: read_file/write_file/list_dir 是 protocol, 实现 InMemory / Disk / S3 三种。同一个 agent 启动时用环境变量切 backend。
为什么练 真生产部署时 agent 跑在 K8s pod 里, 文件不能落本地(pod 重启就没了)。这一题让你理解
章 3讲的"
backend abstraction"为啥是工业 agent 框架的核心抽象——比起算法, 它更像 stateless web service 的 storage 选型。
📐 与三轴正交, 是状态层的工程化。
4
Replay & Debug · 拿 L2 的 trace.jsonl 做步进式回放
HARD
基于 L2 的 trace + checkpoint, 写一个 CLI: python replay.py r1 --until-step 3 从 trace.jsonl 重建到第 3 步的 state, 然后 --fork 派一个新 thread r1-fork-1 从这步重跑——但用不同 model 或不同 system prompt。这是章 3-04 "time travel"特性的最小实现。
为什么练 调 prompt 时真痛点: 每次改 prompt 要从头跑 ~10 步 + 5 美金。replay/fork 让你从历史 step 派, 一次实验只花 1 步钱。这是 LangSmith / Weights&Biases agents 收费的核心价值——你自己实现一遍才会真懂为什么人家收钱。
📐 与三轴正交, 是开发体验的工程化。
Members only
解锁完整课时
订阅会员后可阅读本课全部内容,并访问课程内所有章节。