选型决策矩阵 + 引用清单
把前 4 节的维度收口到 14 个典型场景——每个场景给出 Top 3 候选 + 选择理由。其中 13 / 14 专门覆盖 chat-resident runtime(OpenClaw / Hermes Agent)。文末按 Primary / Secondary / Community 分层列出引用,方便你独立验证。
Reference / Market Watch
Level 2 · 横评附录
阅读时间 · 24 分钟
练习 · 选做
高波动
Last reviewed · 2026-04-22
你将学会什么
- 理解《选型决策矩阵 + 引用清单》在 agent harness / coding agent 学习路径里的核心作用。
- 能用本页给出的判断法区分“概念、机制、边界、代价”。
- 知道这页内容之后会在哪一章被复用到源码阅读或动手实践里。
学习前提
建议先读《三轴雷达 / 十家评分》;如果你是跳读,至少先看本章索引与本页 TL;DR。
这页在课程中的位置
附录 A · 市场横评,只负责给课程主线提供带日期的现实快照。
本页 1 句话结论
把前 4 节的维度收口到 14 个典型场景,为每个场景给出 Top 3 候选与理由。其中 13 / 14 专门覆盖 chat-resident runtime(OpenClaw / Hermes Agent)。文末按证据层级整理引用,方便你独立验证。
带走的判断法
先看比较维度,再看结论;先确认事实来源,再读作者判断。
Source Policy
附录横评:Primary / Secondary / Community 分层引用。
怎么使用这张矩阵
它是什么
一张教学用“预筛矩阵”,帮助你缩小候选范围。
它不是什么
不是采购清单,不是最终拍板,更不是未来半年都不会变的排名。
正确动作
先选 1–2 个最像的场景,再拿真实任务复测,而不是整页照抄。
证据分层
Primary 支撑主推荐理由。
Secondary 只补理解,不单独决定结论。
怎么用这页
- 找最像你场景的那张卡——14 个场景覆盖了大部分企业 + 个人开发常见情况。
- 看推荐 Top 3 + 理由——理由都基于04 章雷达分和前 3 节的事实。
- 不要直接照搬——这是 2026/04 的快照。半年后请自己重测。
- 本章所有引用源放在文末——并按 Primary / Secondary / Community 分层,方便你做尽职调查。
本章快照日期: 2026/04/20
下一次复核建议: 2026/10
14 个典型场景 × Top-3 推荐
① 个人开发者 · 日常 vibe coding
每天开 IDE 写小项目,要"补全 + 重构 + 改 bug",想要随手就能用、不要为开会议室再装个东西。
Top 1Cursor
IDE 原生体验最丝滑;Plan/Agent/Ask 4 模式覆盖日常 90% 任务。
Top 2Claude Code
偏 CLI 派的最佳替代;模型够强时体感比 Cursor 还稳。
Top 3Aider
极简 + 任意 LLM;适合喜欢"手动驾驶"的人。
② 大型企业 · 内部代码合规 + 多租户
代码不能发出公司、要审计每条命令、有 SOC 2/ISO 合规要求。
Top 1Codex CLI
4 平台 OS-native sandbox + protected paths + 可测沙箱命令;安全边界做得最细。
Top 2Claude Code
v2.1+ native sandbox + Hooks + Bridge 给 IDE 做权限代理;企业控制相对完整。
Top 3Devin Enterprise VPC
cloud VM 强隔离, 但需信任 Cognition 的部署模型。
③ 大型 PR · 跨多 service 的端到端 feature
"加一个支付 flow"——涉及前端 + 后端 + DB migration + 测试 + CI 调整。任务跑数小时。
Top 1Devin
Plan-first + manage Devins + 异步执行(overnight);最像 PR-level 协作。
Top 2Cursor (3.0 Cloud Agents + Best-of-N)
Agents Window 给"fleet 视角"; cloud agents 处理长任务。
Top 3Claude Code (subagent + TodoWrite)
需要更多人工切片,但模型质量很顶。
④ 自部署 / 数据不出门 / 用本地模型
用本地 ollama / vLLM / 自托管 DeepSeek。不能用任何 SaaS。
Top 1Aider
最佳——任意 LLM,不依赖 function calling,开源 Apache 2.0。
Top 2AutoGen 0.4 / AG2
本地 model client + 自部署 actor runtime;适合需要复杂多 agent 的内部场景。
Top 3Continue.dev / OpenHands
未在本章详细对比,但同属"开源 + 本地优先"路线。
⑤ 客服 / Support · 多分支专家路由
用户输入分类 → 不同专家处理 → 工具集合不同 → 失败可降级。
Top 1OpenAI Agents SDK
handoff + guardrails 是为这场景设计的;内置 tracing 排查问题极快。
Top 2LangGraph + create_agent
graph 显式建模分流 + interrupts 支持人工接管。
Top 3AutoGen 0.4 (Selector GroupChat)
分布式场景 + 多语言团队需要时合适。
⑥ 通用 autonomous agent · 网页 + 文档 + 编程混合任务
"帮我研究 X 行业的 5 家竞品,写报告"——要浏览、要调 API、要写文件、要做图。
Top 1Manus
cloud Ubuntu sandbox + CodeAct + 多模型 swarm 是为这种 open-ended 任务设计的。
Top 2Devin
Plan-first + VM 内执行,质量稳定但偏编程任务。
Top 3OpenAI Agents SDK + computer use
自己 DIY 的话最灵活;要写更多代码。
⑦ 长程任务 · 跨天 / 跨进程恢复
任务可能跑 48h,机器可能重启 / 进程可能 crash,要从断点继续。
Top 1LangGraph + Postgres checkpointer
per-step checkpoint + idempotent resume 是核心卖点;本章 03-04 详细解释过。
Top 2Inngest / Temporal + 自建 agent
专业 durable execution 引擎;需要自己写 agent 层。
Top 3Devin (cloud VM) / Cursor Cloud Agents
VM 级别恢复,对用户透明,但不是 graph-level checkpoint。
⑧ 研究原型 · 想试新协作模式
学术 / blog 实验:想测"3 个 agent 辩论是否更准"、"Reflexion 多次试错是否有用"等。
Members only
解锁完整课时
订阅会员后可阅读本课全部内容,并访问课程内所有章节。