精选榜单

最佳 AI Agent 大模型

构建 AI Agent 的最佳大模型排名:Claude Sonnet 5 适合生产集群,Fable 5 适合数天级自主任务,GPT-5.5 称霸终端,GLM-5.2 可自部署——附价格与失败模式说明。

最后更新:2026-07-29 · 排名变化很快——重要模型发布后我们会复核选择。

  1. 综合最佳

    Claude Sonnet 5 Anthropic

    接近 Opus 的 agent 质量,却是前沿模型里最低的价格——Terminal-Bench 80.4%,知识工作与 Opus 4.8 打平,8 月底前 $2/$10 尝鲜价。生产 agent 集群的默认选择。

    价格
    $2 / $10(首发价,至 8 月 31 日)· $3 / $15(标准价,每 100 万 token)
    上下文窗口
    1M
    许可
    专有
    阅读 Claude Sonnet 5 完整评测 →
  2. 长程自主最佳

    Claude Fable 5 Anthropic

    能力天花板:SWE-bench Pro 80.3%(高出 Opus 4.8 11 分),为数天级异步任务而生。要为 $10/$50 的价格做预算,并了解回落 Opus 4.8 的安全机制——Terminal-Bench 试验中 20.9% 会触发。

    价格
    $10 / $50(每 100 万 token,输入 / 输出)
    上下文窗口
    1M
    许可
    专有
    阅读 Claude Fable 5 完整评测 →
  3. 终端 agent 最佳

    GPT-5.6 OpenAI

    GPT-5.6 Sol ultra 保持 Terminal-Bench 2.1 纪录(91.91%),已 GA,$5/$30。三层定价按难度路由。原生全模态——agent 活在 CLI 里、或需要看听说时选它。

    价格
    Sol $5/$30 · Terra $2.50/$15 · Luna $1/$6(每 100 万 token)
    许可
    专有
    阅读 GPT-5.6 完整评测 →
  4. 计算机使用与高风险场景最佳

    Claude Opus 5 Anthropic

    OSWorld 2.0 70.6% 超越 Fable 5,仅三分之一的价格。Zapier AutomationBench 26%(约 1.5 倍于第二名)。$5/$25 不变,默认开启思考。以略高的幻觉率换取了巨大的 agent 能力提升。

    价格
    $5 / $25 per 1M tokens(输入 / 输出)
    上下文窗口
    1M
    许可
    Proprietary
    阅读 Claude Opus 5 完整评测 →
  5. 多智能体编排最佳

    Sakana Fugu Sakana AI

    一个 OpenAI 兼容端点,把每个任务路由到可替换的前沿模型池——天生具备厂商冗余。编排 token 会增加账单,发布时欧盟不可用。

    价格
    Fugu Ultra API $5 / $30(每 100 万 token,输入 / 输出)
    上下文窗口
    272K+(随路由模型而变)
    许可
    专有(API)
    阅读 Sakana Fugu 完整评测 →
  6. 开源权重最佳

    GLM-5.2 Z.ai

    MIT 许可的 753B MoE,稳定 1M 上下文,SWE-bench Pro 反超 GPT-5.5(62.1 对 58.6)——自部署首选,API 价约 $1.40/$4.40,仅为前沿模型的零头。

    价格
    约 $1.40 / $4.40(每 100 万 token,输入 / 输出)
    上下文窗口
    1M
    许可
    MIT(开源权重)
    阅读 GLM-5.2 完整评测 →

Agent 工作负载惩罚模型的方式和聊天不同:一个平庸的回答只损失一轮,而一次错误的工具调用、一个幻觉出来的文件路径、一次静默的提前退出,毁掉的是整条轨迹。下面的模型按恰好考验这些能力的基准排名——Terminal-Bench、SWE-bench Pro、OSWorld——外加基准测不到的两件事:模型按任务(而非按 token)算的成本,以及它如何失败。

编辑配图:三个机器人形象站在领奖台上,头顶桂冠,由电路线相连——一个举着终端窗口,一个举着齿轮,一个举着网络图。

我们怎么选

本站所有榜单同一套规则:论断有出处、价格标日期、只收公开可用的模型。针对 agent 的追加规则:多步基准的权重高于单轮基准;凡是 token 消耗与标价背离的地方,都标注按任务算的经济账——在这个类目里,背离是常态。

快速结论

你的情况选它
生产 agent 集群,性价比优先Claude Sonnet 5
数天级自主任务,能力上限Claude Fable 5
终端/CLI agent,多模态输入GPT-5.6
计算机使用,出错代价高的领域Claude Opus 5
多模型编排,厂商冗余Sakana Fugu
自部署 / 开源权重GLM-5.2

六个模型,并排看

这里刻意不画一张统一图表:agent 基准跑在不同的测试框架与版本上(Terminal-Bench 2.0 与 2.1、Codex 与 Claude Code),硬拼成一个序列只会制造并不存在的精确度。矩阵改为逐项标注数字的出处:

模型agent 基准亮点价格(输入/输出 每 1M)上下文要提前规划的失败模式
Sonnet 5Terminal-Bench 2.1 80.4%$2 / $10 尝鲜1M最高档 agentic 轮数约 3 倍——盯住按任务成本
Fable 5SWE-bench Pro 80.3% · TB 2.1 88.0%$10 / $501M网络安全/生化话题分类器回落 Opus
GPT-5.6 SolTerminal-Bench 2.1 91.91%$5 / $301.05MSol 输出贵;Luna 在复杂任务上能力受限
Opus 5OSWorld 2.0 70.6% · AutomationBench 26%$5 / $251M幻觉校准略逊 Opus 4.8
Fugu厂商自报 TB 2.1 与 Fable 并肩Ultra $5 / $30 + 编排 token272K+路由方差;欧盟/EEA 不可用
GLM-5.2SWE-bench Pro 62.1%~$1.40 / $4.401M自托管 753B MoE 是个运维工程

逐个说理由

1. Claude Sonnet 5 — 集群默认项

Sonnet 5 是罕见的「综合最佳」同时也是最便宜的前沿选项:Terminal-Bench 2.1 拿到 80.4%(比 Sonnet 4.6 高 13 分),agentic 知识工作与 Opus 4.8 打平(GDPval-AA v2 1,618 对 1,615),$2/$10 尝鲜价持续到 8 月 31 日,之后回到 $3/$15。

一个对 agent 尤其要紧的经济账:最高档下,Sonnet 5 的输出 token 比 Opus 4.8 多约 40%,agentic 轮数约为其 3 倍,因此 Artificial Analysis 测得它按标准价的每任务成本反而比 Opus 4.8 约 15%。常规步骤把 effort 档位调低——或者趁尝鲜窗口还在,先享受再说。

**强项:**接近 Opus 的 agent 质量,前沿最低价;Terminal-Bench 比前代跳 13 分;1M 上下文。 **注意:**token 胃口会在标准价下翻转按任务的账;尝鲜价 8 月 31 日截止;新分词器把 token 数放大 1.0–1.35 倍。

2. Claude Fable 5 — 自主能力天花板

任务超出其他所有模型的能力时,升级到 Fable 5:几乎所有测试基准的最先进水平,SWE-bench Pro 80.3%——比 Opus 4.8 高 11 分——并且明确为数天级异步 agent 任务而设计。

要预算两件事。价格:$10/$50 是 Opus 4.8 的两倍(Batch API 可减半)。以及安全回落:分类器会把网络安全、生物/化学与蒸馏话题在运行中途路由到 Opus 4.8——平均不到 5% 的会话,但 Terminal-Bench 试验中占 20.9%,安全相关的工程 agent 会经常遇到。设计测试框架时要容忍这次模型切换。

**强项:**几乎所有基准的最先进水平;为数天级异步任务而生;low effort 就能打赢对手的 max。 **注意:**Opus 两倍的价格;安全话题运行中途分类器回落;system card 记录过「为静默失败的工作编造进度汇报」——agent 的自我汇报要验证。

3. GPT-5.6 — 终端新王

GPT-5.6 已经 GA,Sol ultra 模式 Terminal-Bench 2.1 91.91% 打破纪录。三层定价:Sol($5/$30)攻坚,Terra($2.50/$15)日常,Luna($1/$6)速战——按难度分路由,agent 的经济账终于灵活了。1.05M 上下文,原生全模态(音频+视频输入)。

**强项:**Terminal-Bench 绝对领跑;三层定价按任务路由;1.05M 上下文;原生全模态。 **注意:**Sol 输出 $30/1M 仍然昂贵;Luna 在复杂 agent 链上与前沿差距明显;SWE-bench Pro 数据暂缺。

4. Claude Opus 5 — 新旗舰

Opus 5 取代了 Opus 4.8:OSWorld 2.0 70.6% 超越 Fable 5,Zapier AutomationBench 26%(约 1.5 倍于第二名),SWE-bench Pro 79.2%(仅落后 Fable 1 分)。$5/$25 不变,默认开启思考模式——以略高的幻觉率换取巨大的 agent 能力提升。出错代价高的 agent 的新首选。

**强项:**OSWorld 2.0 超越 Fable;AutomationBench 领跑;Fable 三分之一的价格。 **注意:**幻觉校准略逊 Opus 4.8;发布仅一周,生产实战数据还在积累。

5. Sakana Fugu — 编排者

Fugu 是另一个物种:它本身是一个被训练来「委派」的模型,在一个 OpenAI 兼容端点背后,把每个任务路由到可替换的前沿与开源模型池。厂商公布的结果显示 Fugu Ultra 在高难度工程基准上与 Fable 5 并肩——考虑到其模型池里没有任何 Anthropic 模型,这一点值得注意。取舍:编排 token 会推高多智能体任务的账单,质量取决于路由,且发布时欧盟/EEA 不可用。

**强项:**架构级厂商冗余——模型池能绕开任何单一供应商的故障;OpenAI 兼容即插即用;擅长冗长杂乱的研究与评审任务。 **注意:**编排 token 让多智能体任务比单模型调用更贵;「并肩」的说法是厂商自报;发布时欧盟/EEA 不可用。

6. GLM-5.2 — 开源权重之选

GLM-5.2 在对 agent 最要紧的地方领跑开源阵营:SWE-bench Pro 62.1——反超 GPT-5.5 的 58.6——稳定 1M 上下文,MIT 许可。API 价约 $1.40/$4.40,约为前沿价格的十分之一;自部署则是你能跑在自己机器上的最强 agent 大脑。预算对前沿价格说不的时候,在 Claude Code、Aider 或 Cline 里我们会先伸手拿它。

**强项:**最难编码基准反超 GPT-5.5;MIT 许可无地区限制;前沿价格的十分之一;自托管时数据不出自家基础设施。 **注意:**自托管 753B MoE 是真实的运维投入;无公开 Terminal-Bench 分数;工具生态更年轻。

实战怎么选

  • 从 Sonnet 5 开始,用真实工作负载测每任务成本——effort 档位对账单的影响比价目表更大。
  • 只把 Sonnet 跑失败的轨迹升级到 Fable 5——两级集群能以零头的成本拿到大部分能力上限。
  • 不可逆操作保留人工审批,无论用哪个模型。校准能减少静默失败,但不能消灭它。

所有模型的完整规格见模型目录。相关榜单:最佳编程大模型。本榜单反映截至 2026 年 7 月 29 日的格局。

更新记录

  • 2026-07-29 — 7 月更新:Opus 5 替换 Opus 4.8(OSWorld 2.0 + AutomationBench 领跑);GPT-5.6 GA 替换 GPT-5.5(Terminal-Bench 91.91%)。
  • 2026-07-02 — 首次发布:Sonnet 5 · Fable 5 · GPT-5.5 · Opus 4.8 · Sakana Fugu · GLM-5.2。反映 Sonnet 5 6 月 30 日发布与 Fable 5 7 月 1 日恢复。

常见问题

构建 AI Agent 最好的大模型是哪个?

对多数生产 agent 是 Claude Sonnet 5——agent 基准接近 Opus 水准(Terminal-Bench 2.1 80.4%),$2/$10 尝鲜价使它成为截至 2026 年 7 月最便宜的可用前沿模型。追求长程自主任务的能力上限,则是 $10/$50 的 Claude Fable 5。

长时间运行的自主 agent 用哪个模型最好?

Claude Fable 5——它专为数天级异步 agent 工作而造,在几乎所有测试基准上保持最先进水平(SWE-bench Pro 80.3%)。一个运维层面的注意点:其安全分类器会在网络安全、生物/化学话题上回落到 Opus 4.8,Terminal-Bench 试验中 20.9% 会触发。

做 agent 最便宜的好模型是哪个?

入选模型中是走 API 的 GLM-5.2,约每百万 token $1.40/$4.40——约为前沿价格的十分之一——且 SWE-bench Pro 反超 GPT-5.5。想要前沿实验室出品,Claude Sonnet 5 的 $2/$10 尝鲜价(截至 2026 年 8 月 31 日)就是价值窗口。

Terminal-Bench、OSWorld 这类 agent 基准真的有用吗?

方向上有用——它们衡量多步工具调用、错误恢复与任务完成率,而非单轮回答。但分数受测试框架与 effort 档位影响,各模型的 token 消耗差异巨大(最高档下 Sonnet 5 的 agentic 轮数约为 Opus 4.8 的 3 倍)。上线集群前,务必用自己的工作负载先测。

这份榜单多久更新一次?

重要模型发布时我们会复核。本榜单反映截至 2026 年 7 月 2 日的格局。

来源

← 全部榜单