编程 Agent 五家深对比
Claude Code · Cursor · Codex CLI · Aider · Devin——五家代表了五种截然不同的设计哲学。看完这一页,你应该能用一句话概括每家的"灵魂决定"。
Reference / Market Watch
Level 2 · 横评附录
阅读时间 · 24 分钟
练习 · 选做
高波动
Last reviewed · 2026-04-22
你将学会什么
- 理解《编程 Agent 五家深对比》在 agent harness / coding agent 学习路径里的核心作用。
- 能用本页给出的判断法区分“概念、机制、边界、代价”。
- 知道这页内容之后会在哪一章被复用到源码阅读或动手实践里。
学习前提
建议先读《怎么做一次 有用的 横评》;如果你是跳读,至少先看本章索引与本页 TL;DR。
这页在课程中的位置
附录 A · 市场横评,只负责给课程主线提供带日期的现实快照。
本页 1 句话结论
Claude Code · Cursor · Codex CLI · Aider · Devin——五家代表了五种 截然不同的设计哲学 。看完这一页,你应该能用一句话概括每家的"灵魂决定"。
带走的判断法
先看比较维度,再看结论;先确认事实来源,再读作者判断。
Source Policy
附录横评:Primary / Secondary / Community 分层引用。
快照与证据边界
本页保留
稳定的设计取向、运行形态、sandbox/HITL 差异、适用场景。
本页弱化
星数、增长曲线、热度叙事、营销式“谁最强”。这些都不该成为课程主结论。
阅读方法
先把产品当成五种不同的“编程工作面”看,再看谁更适合你的组织边界与任务形状。
证据分层
Primary 官方 docs、官方博客、官方 repo,用来支撑本页主结论。
Secondary 高质量源码阅读或技术拆解,只补实现细节,不单独定调。
一句话灵魂
- Claude Code——"Less scaffolding, more model"。一个
while(tool_call) 循环 + 8 工具,把所有"聪明"留给模型做[1]。
- Cursor——"Agent fleet, not single agent"。从 2.0 起把"开多个 worktree 跑多个 agent"做成产品默认形态[2]。
- Codex CLI——"Sandbox first, capabilities second"。先把 OS-level 沙箱(Seatbelt / Landlock / Bubblewrap / Windows job objects)做透,能力是其次[3]。
- Aider——"Repo map + edit format = everything"。两个老问题("模型不知道整个 repo"、"模型生成的 diff 难以应用")做到极致,其他都不重要[4]。
- Devin——"Plan-first, then VM-bound execute"。每个会话先做交互式 planning,执行在 cloud VM 中,并能 spawn parallel managed Devins[5]。
架构卡(点击切换)
Claude Code
Cursor
Codex CLI
Aider
Devin
Claude Code
Anthropic · CLI/IDE bridge
截至 2026/04 · v2.1.x
L1 模型
Claude (Opus / Sonnet / Haiku),
不是新模型——只是"orchestration layer connecting Claude to your terminal"
[1]
L2 协议
原生 tool calling + MCP(既是 client 又能当 server)
[1]
L3 Loop
while(tool_call) 一行——
无 DAG / 无 classifier / 无 RAG / 无 router。模型自己决定调谁、何时停
[1]
L4 Harness
8 核心工具:
Bash ·
Read ·
Edit ·
Write ·
Grep ·
Glob ·
Agent(原 Task) ·
TodoWrite[1]
L5 产品
CLI 主体 + IDE bridge(VS Code 扩展,双向通信)
[6]
关键签名设计:
- Subagent 深度=1,仅返回 summary:杜绝"agent-ception",每个 subagent 用完即弃,main 只看到摘要[1]。
- 长上下文会被主动压缩:Claude Code 会在长会话里把部分历史外化成摘要或记忆文件;教学上更重要的是理解"它依赖模型自己整理状态",而不是记某个阈值[6]。
- Hooks (Pre/PostToolUse):用退出码控制流程——非零阻断执行。这是 Unix 哲学在 agent 上的复用[6]。
- Native sandbox v2.1.0+:用 OS-level primitives 做进程级隔离,不依赖 Docker[6]。
- Permission modes:
default / plan / bypassPermissions / auto(实验性 ML 分类器)[6]。
- 实验性团队协作能力:公开实现与社区代码阅读都显示 Claude Code 留有更复杂协作模式的接口,但这不是默认教学路径,我们在本页只把它当作次级观察,不当作主判断依据[7]。
A 控制流:纯 LLM 自由
B 动作空间:Bash 一打开就近乎无限
C 终止:LLM 不再 tool_call 即停
HITL:每工具粒度(permission prompt)
我们的判断: Claude Code 是"模型够强就什么都不用做"哲学的极致。它的所有"不存在"(无 DAG / 无 RAG / 无 classifier)都是设计,不是缺失。换个稍弱的模型就跑不起来。
Cursor
Anysphere · IDE-native
截至 2026/04 · v3.0
L1 模型
自家
Composer 模型(声称比同等智能模型快 4×)+ 第三方(Claude / GPT / Gemini)
[2]
L2 协议
原生 tool calling + MCP + .cursorrules(项目级)+ AGENTS.md / Memories
[8]
L3 Loop
Agent / Ask / Plan / Debug 四模式(Shift+Tab 切换);每个 mode 独立 context
[8]
L4 Harness
codebase-wide semantic search · sandboxed terminals (macOS GA in 2.0) · in-editor browser tool · subagents 池
[2]
L5 产品
VS Code fork +
Agents Window(3.0 起独立大窗口) + Cloud Agents (远端机器)
[9]
关键签名设计:
- Multi-agent in worktrees:2.0 起最多 8 个并行 agent,每个跑在独立 git worktree 或远端机器,避免文件冲突[2]。
- Best-of-N(3.0):同一个 prompt 同时跑 N 个模型,挑最好的 commit。算法/架构题特别适用[9]。
- Agents Window(3.0/2026-04-02):把"agent 编排"从 Composer pane 升级成独立全屏 workspace——产品形态明显从"代码编辑器+AI"转向"AI fleet+代码"[9]。
- Design Mode:在 Agents Window 中直接对 UI 元素标注/点击,agent 改 UI 代码——把 visual feedback loop 缩到一步[9]。
- Plan Mode:先用一个模型出 plan,再用另一个模型执行;可前后台并行多 plan[2]。
A 控制流:LLM 自由(mode 决定 default)
B 动作空间:开放(含 sandboxed terminal + browser)
C 终止:LLM 终止 + 用户 Stop
HITL:diff 级别 review;queue 消息
我们的判断: Cursor 在 2.0/3.0 之后正在做一件大胆的事——把"agent fleet"做成产品默认形态