大语言模型

Claude Opus 5

Anthropic 2026 年 7 月旗舰——以 Opus 定价($5/$25)实现接近 Fable 的智能,Frontier-Bench、ARC-AGI-3 与 OSWorld 2.0 均为 SOTA,默认开启推理。

Claude Opus 5 是 Anthropic 2026 年 7 月 24 日发布的旗舰——接替 Opus 4.8,在多个独立基准上成为新的整体智能领先者。核心定位:以 Fable 5 一半的价格实现接近 Fable 的能力,默认开启推理,知识截止 2026 年 5 月,在新颖推理到计算机使用到业务自动化等任务上全面超越。

标志性数据是 Frontier-Bench v0.1(Terminal-Bench 2.1 的 74 任务后继):Opus 5 在 max effort 下达到 43.3%,超 Opus 4.8 的 18.7% 一倍以上,并领先 GPT-5.6 Sol(37.5%)和 Fable 5(33.7%)。

基准测试

Anthropic 在发布时公布了异常详尽的基准表。以下数据为厂商报告(2026 年 7 月 24 日),请视为特定时点快照。

基准测量内容Opus 5Fable 5Opus 4.8GPT-5.6 Sol
Frontier-Bench v0.1软件工程价值43.3%33.7%18.7%37.5%
SWE-bench VerifiedGitHub issue 解决96.0%95.0%
SWE-bench Pro最难编程79.2%80.3%69.2%64.6%
SWE-bench Multimodal多模态编程59.4%38.4%
ARC-AGI-3新颖推理30.2%1.5%7.8%
OSWorld 2.0计算机使用70.6%较低55.7%
Zapier AutomationBench业务自动化26.0%17.4%17.0%
GDPval-AA v2专业知识(Elo)SOTA1,615
IMO 2026数学奥赛42/42
Frontier-Bench v0.1 — 平均奖励(%)
Claude Opus 543.3%GPT-5.6 Sol37.5%Claude Fable 533.7%Claude Opus 4.818.7%
AnthropicOpenAI
Opus 5 超 Opus 4.8 一倍以上,并领先 GPT-5.6 Sol 与 Fable 5。
来源:Anthropic(2026 年 7 月 24 日)及厂商报告数据,Heyaiwiki 整理。

三个结果定义了差距:

  • ARC-AGI-3 最为突出:30.2% 约为第二名的 4 倍(GPT-5.6 Sol 7.8%)。这是测试新颖、分布外推理的测试——记忆模式无济于事。
  • OSWorld 2.0:70.6% 以约三分之一的每任务成本超越 Fable 5 的最佳成绩。计算机使用智能体的成本大幅降低。
  • SWE-bench Pro 仍属 Fable 5 领地:79.2% vs 80.3%。对于最难的长期编程任务,Fable 仍是巅峰——但差距现在约为 1 分而非 11 分。

定价

层级输入 / 1M输出 / 1M备注
标准$5.00$25.00与 Opus 4.8 相同
Fast Mode$10.00$50.00约 2.5 倍默认速度
缓存读取$0.50约为输入价的 10%
Batch API$2.50$12.50标准价的 50%

推理与 effort

推理默认开启——与 Opus 4.8 不同的是,high 以上 effort 不可关闭推理。尝试在高于 high 的 effort 设置 thinking.enabled = false 会返回 400 错误。这是破坏性变更。

Effort 仍为五个级别(lowmediumhighxhighmax),默认 high。一个有趣的数据:Frontier-Bench 上 xhigh(44.4%)实际优于 max(43.3%)——表明模型在最大 effort 时偶尔会过度思考。

横向对比

Claude Opus 5Claude Fable 5GPT-5.6 SolGemini 3.1 Pro
价格(输入 / 输出,per 1M)$5 / $25$10 / $50$5 / $30~$2 / $12
上下文1M1M1M1M
Frontier-Bench v0.143.3%33.7%37.5%
SWE-bench Pro79.2%80.3%64.6%54.2%
ARC-AGI-330.2%7.8%
  • vs Fable 5 Opus 5 在 Frontier-Bench、ARC-AGI-3 和 OSWorld 2.0 均领先。Fable 在 SWE-bench Pro 仍有约 1 分优势。2 倍价差使 Opus 5 成为默认选择。
  • vs GPT-5.6 Sol Opus 5 拿下 AA 智能指数第一和 ARC-AGI-3 大幅领先。Sol 接受音频/视频输入。
  • vs Opus 4.8 全面大幅提升——同价、同 API 形态。留在 4.8 的唯一理由是略好的幻觉校准。

Claude 产品线(2026 年 7 月)

模型API ID输入 / 输出(per 1M)上下文定位
Fable 5(Mythos 级)claude-fable-5$10 / $501M能力天花板
Opus 5claude-opus-5$5 / $251M前沿旗舰——最佳性价比
Sonnet 5claude-sonnet-5$2 / $10 优惠价1M日常智能体主力
Haiku 4.5claude-haiku-4-5$1 / $5200K最快、最便宜

适用场景

  • 智能体编程——CursorBench、Frontier-Bench、SWE-bench Verified 96%
  • 计算机使用自动化(OSWorld 2.0 70.6%)
  • 业务任务自动化(Zapier AutomationBench 26%,约为第二名的 1.5 倍)
  • 复杂推理与新颖问题求解(ARC-AGI-3、IMO 金牌水准)

优缺点

优势

  • Frontier-Bench v0.1 SOTA(43.3%),超 Opus 4.8 一倍以上,领先 Fable 5 与 GPT-5.6 Sol
  • ARC-AGI-3 达 30.2%——约为第二名(GPT-5.6 Sol 7.8%)的 4 倍
  • OSWorld 2.0 达 70.6%,以 Fable 5 约三分之一的成本超越其最佳成绩
  • 定价不变 $5/$25——Fable 5 的一半,能力接近 Fable

局限

  • 事实性幻觉略高于 Opus 4.8(Anthropic 自行披露)
  • SWE-bench Pro(79.2%)仍略逊 Fable 5(80.3%)
  • high 以上 effort 不可关闭推理——可能推高 token 用量
  • 不支持音频或视频输入/输出

常见问题

Claude Opus 5 什么时候发布的?

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,取代 Opus 4.8 成为 Opus 级旗舰。同日上线 Claude.ai(Claude Max 默认)、Claude Code、Claude Cowork、Claude API、AWS Bedrock、Google Vertex AI 和 Microsoft Foundry。

Claude Opus 5 多少钱?

标准 API 定价为每百万输入 token $5、输出 $25——与 Opus 4.8 持平,是 Fable 5($10/$50)的一半。Fast Mode $10 / $50(约 2.5 倍速度)。缓存读取 $0.50 / 1M。Batch API 半价。

Claude Opus 5 比 Fable 5 好吗?

在多个基准上是的——Opus 5 在 Frontier-Bench(43.3% vs 33.7%)、ARC-AGI-3(30.2%)和 OSWorld 2.0(70.6%,约 Fable 三分之一成本)均领先。Fable 5 在最难的编程拆分 SWE-bench Pro(80.3% vs 79.2%)仍占优,并在网络安全与生物任务上保持能力上限。问题在于差距是否值得 2 倍的 token 价格。

Claude Opus 5 的 API 模型 ID 是什么?

Claude API 和 Vertex AI 使用 `claude-opus-5`。AWS Bedrock 上为 `anthropic.claude-opus-5`。上下文窗口 1M token,最大输出 128K。

可以关闭 Claude Opus 5 的推理吗?

推理默认开启。low、medium 和 high effort 下可关闭,但 high 以上 effort 关闭会返回 400 错误。这是相对 Opus 4.8 的破坏性变更。

Claude Opus 5 的知识截止日期是什么?

根据 system card,为 2026 年 5 月——发布时所有 Claude 模型中最新的截止日期。

来源

最后更新:2026-07-29 · 规格与价格变动很快——使用前请在厂商官网核实。