三轴雷达 · 十家评分
用三轴框架 + 4 个工程化补充轴,给 10 家产品画出 0–5 分的架构形状(含 OpenClaw / Hermes Agent 这类 chat-resident runtime)。分高 ≠ 更好——分数只是解释层,最大用途是先看你需要什么形状,再去选最匹配的图。
Reference / Market Watch
Level 2 · 横评附录
阅读时间 · 24 分钟
练习 · 选做
高波动
Last reviewed · 2026-04-22
你将学会什么
- 理解《三轴雷达 / 十家评分》在 agent harness / coding agent 学习路径里的核心作用。
- 能用本页给出的判断法区分“概念、机制、边界、代价”。
- 知道这页内容之后会在哪一章被复用到源码阅读或动手实践里。
学习前提
建议先读《多 Agent 系统对比》;如果你是跳读,至少先看本章索引与本页 TL;DR。
这页在课程中的位置
附录 A · 市场横评,只负责给课程主线提供带日期的现实快照。
本页 1 句话结论
用三轴框架 + 4 个工程化补充轴,给 10 家产品画出 0–5 分的架构形状。 分高 ≠ 更好 ——分数只是解释层,最大用途是先看你需要什么形状,再去选最匹配的图。
带走的判断法
先看比较维度,再看结论;先确认事实来源,再读作者判断。
Source Policy
附录横评:Primary / Secondary / Community 分层引用。
评分说明
评分日期
2026-04-22。它是带日期的解释快照,不是长期有效的排行榜。
事实来源
优先使用官方 docs / 官方 repo / 官方博客;高波动产品事实不再混进主叙事。
正确读法
先理解每个轴,再读分数背后的证据摘要;不要把 4 分和 5 分当成绝对优劣。
事实 / 解释 / 作者判断
事实 来自官方文档里的能力边界、运行模式、接口与隔离方式。
解释 是把这些事实映射到 7 个轴上的过程,因此难免有建模取舍。
本节怎么读
- 第 1 步——理解 7 个轴的含义(前 3 个是章 0 的三轴,后 4 个是工程化补充)。
- 第 2 步——用上面 widget 选 1–4 个产品叠加看雷达。形状匹配你的需求就是好选择。
- 第 3 步——读评分总表,理解每个具体分数的依据(每个分数都有"为什么这个分"的小注)。
- 诚实声明:评分基于公开文档 + 我们在前 3 节整理的事实;个别项有主观成分(已在小注里标 "判断")。这不是 benchmark,是定性辅助。
七个轴的含义
A 控制流自由度:分数越高,LLM 决策权越大,代码编排越少。0 = 全代码 DAG(如 Airflow),5 = 纯 LLM 自由(如 Claude Code)。
B 动作空间开放度:分数越高,动作越开放。0 = 固定 N 个枚举,5 = shell + cloud VM 几近无限。
C 终止自治度:分数越高,LLM 自己说"完了"的权重越大。0 = 结构强终止,5 = 全 LLM 决定。
D 沙箱强度:动作越开放越需要沙箱兜底。0 = 无(直接在 host 跑),5 = 独立 cloud VM + 网络隔离。
E 多 agent 拓扑:0 = 单 agent,1 = subagent 池(隔离 context),3 = handoff/群聊,5 = actor 模型/coordinator+VMs。
F 持久化/可恢复:0 = 无 checkpoint,5 = 每步 checkpoint + idempotent resume + 跨进程恢复(如 LangGraph)。
G HITL 粒度:0 = 无人参与,5 = 每工具/每步可中断 + edit-and-resume。
H 生态/可观测:0 = 无 tracing,5 = 内置 tracing + dashboard + 第三方接入广泛。
交互雷达图
选 1–4 个产品叠加看雷达。形状匹配你的需求就是好选择:
选要叠加的产品(可多选)
Claude Code
Cursor
Codex CLI
Aider
Devin
OpenAI Agents SDK
AutoGen 0.4
Manus
OpenClaw 🦞
Hermes Agent ☤
完整评分总表(含小注)
每个分都基于章 02和章 03整理的事实。点击分数 hover 可看到"为什么是这个分"。
| 产品 |
A 控制流 |
B 动作 |
C 终止 |
D 沙箱 |
E 多 agent |
F 持久化 |
G HITL |
H 生态/观测 |
基于这张雷达图的 6 个作者判断
- 没有"全 5 分"的产品——每个 shape 都在用别的维度换取优势,所以雷达越大并不自动代表越值得买。
- Aider 雷达最小但形状独特——低自治、低动作空间并不一定是缺点;对很多想保留主导权的工程师,这恰恰是价值。
- Codex CLI 在 D(沙箱)上更突出——如果你的主要约束来自企业边界、目录权限、网络策略,这个维度会比“模型多强”更重要。
- OpenAI Agents SDK 与 AutoGen 0.4 的雷达可能看起来相似——但一个更偏 handoff / observability,另一个更偏 actor / distributed runtime;相似形状不代表相同实现哲学。
- OpenClaw 与 Hermes Agent 形状接近,但强调点不同——前者更像多入口、常驻、消息面 runtime;后者更强调隔离 worker 与长期学习。选型时不要只看“都能常驻聊天面”。
- chat-resident 派与编程派在 D(沙箱)上的差异最值得追问——这里反映的不是谁先进,而是“你到底是在守护开发机,还是在守护长期在线的消息面 runtime”。
常见误读与提醒
把雷达分当 benchmark 是错的
这套分是架构定性,不是性能 benchmark。一个 A=5 的 agent 不一定"更聪明",只意味着"更多决策让 LLM 做"——LLM 弱时反而更容易翻车。同理 D=5(最强沙箱)≠ 最安全:你可能根本不需要那么强的沙箱,反而徒增 friction。
正确读法:先想清楚"我的场景需要什么形状"——例如生产服务客服分流,需要 G 高 + H 高 + E 中 + 其他都不重要。然后挑形状最匹配的 1–2 家深入评估。
常见误解
常见误解:把横评分数当产品排行榜。这里更适合读“形状匹配”和“证据等级”,而不是读输赢。
最小练习 / 思考题
最小练习:只根据本页维度,不看结论,先自己写出两个候选方案的优缺点,再回头对照作者判断。
学完自检
展开 3 个针对本页的检查点
- 能解释雷达图每条轴衡量什么,以及刻意忽略了什么。
- 能用证据挑战一个分数,而不是只说“感觉不对”。
- 能把雷达图当成讨论入口,而不是最终排名。
下一页为什么值得学
下一页会把这页结论推进到《选型决策矩阵 + 引用清单》,帮助你把知识链条接起来。
章节定位:04 · Comparative Architectures。
Members only
解锁完整课时
订阅会员后可阅读本课全部内容,并访问课程内所有章节。