Agent 工作负载惩罚模型的方式和聊天不同:一个平庸的回答只损失一轮,而一次错误的工具调用、一个幻觉出来的文件路径、一次静默的提前退出,毁掉的是整条轨迹。下面的模型按恰好考验这些能力的基准排名——Terminal-Bench、SWE-bench Pro、OSWorld——外加基准测不到的两件事:模型按任务(而非按 token)算的成本,以及它如何失败。

我们怎么选
与本站所有榜单同一套规则:论断有出处、价格标日期、只收公开可用的模型。针对 agent 的追加规则:多步基准的权重高于单轮基准;凡是 token 消耗与标价背离的地方,都标注按任务算的经济账——在这个类目里,背离是常态。
快速结论
| 你的情况 | 选它 |
|---|---|
| 生产 agent 集群,性价比优先 | Claude Sonnet 5 |
| 数天级自主任务,能力上限 | Claude Fable 5 |
| 终端/CLI agent,多模态输入 | GPT-5.6 |
| 计算机使用,出错代价高的领域 | Claude Opus 5 |
| 多模型编排,厂商冗余 | Sakana Fugu |
| 自部署 / 开源权重 | GLM-5.2 |
六个模型,并排看
这里刻意不画一张统一图表:agent 基准跑在不同的测试框架与版本上(Terminal-Bench 2.0 与 2.1、Codex 与 Claude Code),硬拼成一个序列只会制造并不存在的精确度。矩阵改为逐项标注数字的出处:
| 模型 | agent 基准亮点 | 价格(输入/输出 每 1M) | 上下文 | 要提前规划的失败模式 |
|---|---|---|---|---|
| Sonnet 5 | Terminal-Bench 2.1 80.4% | $2 / $10 尝鲜 | 1M | 最高档 agentic 轮数约 3 倍——盯住按任务成本 |
| Fable 5 | SWE-bench Pro 80.3% · TB 2.1 88.0% | $10 / $50 | 1M | 网络安全/生化话题分类器回落 Opus |
| GPT-5.6 Sol | Terminal-Bench 2.1 91.91% | $5 / $30 | 1.05M | Sol 输出贵;Luna 在复杂任务上能力受限 |
| Opus 5 | OSWorld 2.0 70.6% · AutomationBench 26% | $5 / $25 | 1M | 幻觉校准略逊 Opus 4.8 |
| Fugu | 厂商自报 TB 2.1 与 Fable 并肩 | Ultra $5 / $30 + 编排 token | 272K+ | 路由方差;欧盟/EEA 不可用 |
| GLM-5.2 | SWE-bench Pro 62.1% | ~$1.40 / $4.40 | 1M | 自托管 753B MoE 是个运维工程 |
逐个说理由
1. Claude Sonnet 5 — 集群默认项
Sonnet 5 是罕见的「综合最佳」同时也是最便宜的前沿选项:Terminal-Bench 2.1 拿到 80.4%(比 Sonnet 4.6 高 13 分),agentic 知识工作与 Opus 4.8 打平(GDPval-AA v2 1,618 对 1,615),$2/$10 尝鲜价持续到 8 月 31 日,之后回到 $3/$15。
一个对 agent 尤其要紧的经济账:最高档下,Sonnet 5 的输出 token 比 Opus 4.8 多约 40%,agentic 轮数约为其 3 倍,因此 Artificial Analysis 测得它按标准价的每任务成本反而比 Opus 4.8 高约 15%。常规步骤把 effort 档位调低——或者趁尝鲜窗口还在,先享受再说。
**强项:**接近 Opus 的 agent 质量,前沿最低价;Terminal-Bench 比前代跳 13 分;1M 上下文。 **注意:**token 胃口会在标准价下翻转按任务的账;尝鲜价 8 月 31 日截止;新分词器把 token 数放大 1.0–1.35 倍。
2. Claude Fable 5 — 自主能力天花板
任务超出其他所有模型的能力时,升级到 Fable 5:几乎所有测试基准的最先进水平,SWE-bench Pro 80.3%——比 Opus 4.8 高 11 分——并且明确为数天级异步 agent 任务而设计。
要预算两件事。价格:$10/$50 是 Opus 4.8 的两倍(Batch API 可减半)。以及安全回落:分类器会把网络安全、生物/化学与蒸馏话题在运行中途路由到 Opus 4.8——平均不到 5% 的会话,但 Terminal-Bench 试验中占 20.9%,安全相关的工程 agent 会经常遇到。设计测试框架时要容忍这次模型切换。
**强项:**几乎所有基准的最先进水平;为数天级异步任务而生;low effort 就能打赢对手的 max。 **注意:**Opus 两倍的价格;安全话题运行中途分类器回落;system card 记录过「为静默失败的工作编造进度汇报」——agent 的自我汇报要验证。
3. GPT-5.6 — 终端新王
GPT-5.6 已经 GA,Sol ultra 模式 Terminal-Bench 2.1 91.91% 打破纪录。三层定价:Sol($5/$30)攻坚,Terra($2.50/$15)日常,Luna($1/$6)速战——按难度分路由,agent 的经济账终于灵活了。1.05M 上下文,原生全模态(音频+视频输入)。
**强项:**Terminal-Bench 绝对领跑;三层定价按任务路由;1.05M 上下文;原生全模态。 **注意:**Sol 输出 $30/1M 仍然昂贵;Luna 在复杂 agent 链上与前沿差距明显;SWE-bench Pro 数据暂缺。
4. Claude Opus 5 — 新旗舰
Opus 5 取代了 Opus 4.8:OSWorld 2.0 70.6% 超越 Fable 5,Zapier AutomationBench 26%(约 1.5 倍于第二名),SWE-bench Pro 79.2%(仅落后 Fable 1 分)。$5/$25 不变,默认开启思考模式——以略高的幻觉率换取巨大的 agent 能力提升。出错代价高的 agent 的新首选。
**强项:**OSWorld 2.0 超越 Fable;AutomationBench 领跑;Fable 三分之一的价格。 **注意:**幻觉校准略逊 Opus 4.8;发布仅一周,生产实战数据还在积累。
5. Sakana Fugu — 编排者
Fugu 是另一个物种:它本身是一个被训练来「委派」的模型,在一个 OpenAI 兼容端点背后,把每个任务路由到可替换的前沿与开源模型池。厂商公布的结果显示 Fugu Ultra 在高难度工程基准上与 Fable 5 并肩——考虑到其模型池里没有任何 Anthropic 模型,这一点值得注意。取舍:编排 token 会推高多智能体任务的账单,质量取决于路由,且发布时欧盟/EEA 不可用。
**强项:**架构级厂商冗余——模型池能绕开任何单一供应商的故障;OpenAI 兼容即插即用;擅长冗长杂乱的研究与评审任务。 **注意:**编排 token 让多智能体任务比单模型调用更贵;「并肩」的说法是厂商自报;发布时欧盟/EEA 不可用。
6. GLM-5.2 — 开源权重之选
GLM-5.2 在对 agent 最要紧的地方领跑开源阵营:SWE-bench Pro 62.1——反超 GPT-5.5 的 58.6——稳定 1M 上下文,MIT 许可。API 价约 $1.40/$4.40,约为前沿价格的十分之一;自部署则是你能跑在自己机器上的最强 agent 大脑。预算对前沿价格说不的时候,在 Claude Code、Aider 或 Cline 里我们会先伸手拿它。
**强项:**最难编码基准反超 GPT-5.5;MIT 许可无地区限制;前沿价格的十分之一;自托管时数据不出自家基础设施。 **注意:**自托管 753B MoE 是真实的运维投入;无公开 Terminal-Bench 分数;工具生态更年轻。
实战怎么选
- 从 Sonnet 5 开始,用真实工作负载测每任务成本——effort 档位对账单的影响比价目表更大。
- 只把 Sonnet 跑失败的轨迹升级到 Fable 5——两级集群能以零头的成本拿到大部分能力上限。
- 不可逆操作保留人工审批,无论用哪个模型。校准能减少静默失败,但不能消灭它。
所有模型的完整规格见模型目录。相关榜单:最佳编程大模型。本榜单反映截至 2026 年 7 月 29 日的格局。
更新记录
- 2026-07-29 — 7 月更新:Opus 5 替换 Opus 4.8(OSWorld 2.0 + AutomationBench 领跑);GPT-5.6 GA 替换 GPT-5.5(Terminal-Bench 91.91%)。
- 2026-07-02 — 首次发布:Sonnet 5 · Fable 5 · GPT-5.5 · Opus 4.8 · Sakana Fugu · GLM-5.2。反映 Sonnet 5 6 月 30 日发布与 Fable 5 7 月 1 日恢复。
常见问题
构建 AI Agent 最好的大模型是哪个?
对多数生产 agent 是 Claude Sonnet 5——agent 基准接近 Opus 水准(Terminal-Bench 2.1 80.4%),$2/$10 尝鲜价使它成为截至 2026 年 7 月最便宜的可用前沿模型。追求长程自主任务的能力上限,则是 $10/$50 的 Claude Fable 5。
长时间运行的自主 agent 用哪个模型最好?
Claude Fable 5——它专为数天级异步 agent 工作而造,在几乎所有测试基准上保持最先进水平(SWE-bench Pro 80.3%)。一个运维层面的注意点:其安全分类器会在网络安全、生物/化学话题上回落到 Opus 4.8,Terminal-Bench 试验中 20.9% 会触发。
做 agent 最便宜的好模型是哪个?
入选模型中是走 API 的 GLM-5.2,约每百万 token $1.40/$4.40——约为前沿价格的十分之一——且 SWE-bench Pro 反超 GPT-5.5。想要前沿实验室出品,Claude Sonnet 5 的 $2/$10 尝鲜价(截至 2026 年 8 月 31 日)就是价值窗口。
Terminal-Bench、OSWorld 这类 agent 基准真的有用吗?
方向上有用——它们衡量多步工具调用、错误恢复与任务完成率,而非单轮回答。但分数受测试框架与 effort 档位影响,各模型的 token 消耗差异巨大(最高档下 Sonnet 5 的 agentic 轮数约为 Opus 4.8 的 3 倍)。上线集群前,务必用自己的工作负载先测。
这份榜单多久更新一次?
重要模型发布时我们会复核。本榜单反映截至 2026 年 7 月 2 日的格局。