怎么做一次有用的横评
大多数"agent 横评"读完只剩一种感觉:好像每家都不错。这不是因为评测者不努力,而是方法本身错了。
Reference / Market Watch
Level 2 · 横评附录
阅读时间 · 13 分钟
练习 · 选做
高波动
Last reviewed · 2026-04-22
你将学会什么
- 理解《怎么做一次 有用的 横评》在 agent harness / coding agent 学习路径里的核心作用。
- 能用本页给出的判断法区分“概念、机制、边界、代价”。
- 知道这页内容之后会在哪一章被复用到源码阅读或动手实践里。
学习前提
建议先读《本章索引》;如果你是跳读,至少先看本章索引与本页 TL;DR。
这页在课程中的位置
附录 A · 市场横评,只负责给课程主线提供带日期的现实快照。
本页 1 句话结论
大多数"agent 横评"读完只剩一种感觉:好像每家都不错。这不是因为评测者不努力,而是 方法本身错了 。
带走的判断法
先看比较维度,再看结论;先确认事实来源,再读作者判断。
Source Policy
附录横评:Primary / Secondary / Community 分层引用。
本节解决的元问题
- 诊断:先列三种典型"失败横评"的样子——堆 feature、混淆层级、忽略时间——和它们为什么没用。
- 方法:然后给一套四步法——选维度 → 同任务 → 区分事实/判断 → 标时间戳。
- 工具:给一个"维度选择器" widget——你可以勾选关心的维度,立即看到该用什么字段对比,避免被供应商的"差异化卖点"带偏。
1. 三种"失败横评"的样子
先看三个真实存在的反模式(不点名,但每个 agent 圈都见过):
反模式 A · feature 大表
"有 vs 没有"的勾叉表。Cursor 有 MCP,Claude Code 也有 MCP——勾。但实现深度差一个量级:Claude Code 把 MCP 列进 8 工具的并列位,Cursor 是配置面板的一项。同一个勾,体感天差地别。
反模式 B · 层级串味
把 LangGraph (runtime)、AutoGen 0.4 (framework)、Claude Code (product) 放一张表对比"易用性"。这就像把 PostgreSQL、Django、GitHub 放一起比"上手难度"——它们解决的
不是同一个问题。横评必须先对齐
三层模型。
反模式 C · 不带时间戳
"AutoGen 是基于 GroupChat 的多 agent 框架"——这句话在 2024/06 完全正确,在 2025/01 之后错了一半(v0.4 改成 actor model)。agent 圈半年迭代一次架构是常态。任何不写"截至 YYYY/MM"的横评都不可信。
真正有用的横评,往往不是一篇文章,而是一份维度尺
读者拿走尺子之后,无论遇到 Devin、Manus、还是明天发布的 X,都能自己量。这才是横评的最大价值。本章接下来 4 个子页都围绕这个目标展开:先固定尺子,再依次量。
2. 四步法:怎么做一次有用的横评
Step 1 · 选维度(不要超过 8 个)
维度越多越"全面"——这是直觉,也是陷阱。超过 8 个维度,读者会失焦。我们建议从下面 12 个候选里挑 4–8 个,按你的真实决策需要选:
| 维度 |
问的是什么 |
什么场景该选 |
| A 控制流 |
谁决定下一步:代码还是 LLM? |
所有场景必选——决定了"调试"和"可预测性" |
B 动作空Members only 解锁完整课时订阅会员后可阅读本课全部内容,并访问课程内所有章节。 |