Claude Opus 5 是 Anthropic 2026 年 7 月 24 日发布的旗舰——接替 Opus 4.8,在多个独立基准上成为新的整体智能领先者。核心定位:以 Fable 5 一半的价格实现接近 Fable 的能力,默认开启推理,知识截止 2026 年 5 月,在新颖推理到计算机使用到业务自动化等任务上全面超越。
标志性数据是 Frontier-Bench v0.1(Terminal-Bench 2.1 的 74 任务后继):Opus 5 在 max effort 下达到 43.3%,超 Opus 4.8 的 18.7% 一倍以上,并领先 GPT-5.6 Sol(37.5%)和 Fable 5(33.7%)。
基准测试
Anthropic 在发布时公布了异常详尽的基准表。以下数据为厂商报告(2026 年 7 月 24 日),请视为特定时点快照。
| 基准 | 测量内容 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Frontier-Bench v0.1 | 软件工程价值 | 43.3% | 33.7% | 18.7% | 37.5% |
| SWE-bench Verified | GitHub issue 解决 | 96.0% | 95.0% | — | — |
| SWE-bench Pro | 最难编程 | 79.2% | 80.3% | 69.2% | 64.6% |
| SWE-bench Multimodal | 多模态编程 | 59.4% | — | 38.4% | — |
| ARC-AGI-3 | 新颖推理 | 30.2% | — | 1.5% | 7.8% |
| OSWorld 2.0 | 计算机使用 | 70.6% | 较低 | 55.7% | — |
| Zapier AutomationBench | 业务自动化 | 26.0% | 17.4% | 17.0% | — |
| GDPval-AA v2 | 专业知识(Elo) | SOTA | — | 1,615 | — |
| IMO 2026 | 数学奥赛 | 42/42 | — | — | — |
三个结果定义了差距:
- ARC-AGI-3 最为突出:30.2% 约为第二名的 4 倍(GPT-5.6 Sol 7.8%)。这是测试新颖、分布外推理的测试——记忆模式无济于事。
- OSWorld 2.0:70.6% 以约三分之一的每任务成本超越 Fable 5 的最佳成绩。计算机使用智能体的成本大幅降低。
- SWE-bench Pro 仍属 Fable 5 领地:79.2% vs 80.3%。对于最难的长期编程任务,Fable 仍是巅峰——但差距现在约为 1 分而非 11 分。
定价
| 层级 | 输入 / 1M | 输出 / 1M | 备注 |
|---|---|---|---|
| 标准 | $5.00 | $25.00 | 与 Opus 4.8 相同 |
| Fast Mode | $10.00 | $50.00 | 约 2.5 倍默认速度 |
| 缓存读取 | $0.50 | — | 约为输入价的 10% |
| Batch API | $2.50 | $12.50 | 标准价的 50% |
推理与 effort
推理默认开启——与 Opus 4.8 不同的是,high 以上 effort 不可关闭推理。尝试在高于 high 的 effort 设置 thinking.enabled = false 会返回 400 错误。这是破坏性变更。
Effort 仍为五个级别(low、medium、high、xhigh、max),默认 high。一个有趣的数据:Frontier-Bench 上 xhigh(44.4%)实际优于 max(43.3%)——表明模型在最大 effort 时偶尔会过度思考。
横向对比
| Claude Opus 5 | Claude Fable 5 | GPT-5.6 Sol | Gemini 3.1 Pro | |
|---|---|---|---|---|
| 价格(输入 / 输出,per 1M) | $5 / $25 | $10 / $50 | $5 / $30 | ~$2 / $12 |
| 上下文 | 1M | 1M | 1M | 1M |
| Frontier-Bench v0.1 | 43.3% | 33.7% | 37.5% | — |
| SWE-bench Pro | 79.2% | 80.3% | 64.6% | 54.2% |
| ARC-AGI-3 | 30.2% | — | 7.8% | — |
- vs Fable 5: Opus 5 在 Frontier-Bench、ARC-AGI-3 和 OSWorld 2.0 均领先。Fable 在 SWE-bench Pro 仍有约 1 分优势。2 倍价差使 Opus 5 成为默认选择。
- vs GPT-5.6 Sol: Opus 5 拿下 AA 智能指数第一和 ARC-AGI-3 大幅领先。Sol 接受音频/视频输入。
- vs Opus 4.8: 全面大幅提升——同价、同 API 形态。留在 4.8 的唯一理由是略好的幻觉校准。
Claude 产品线(2026 年 7 月)
| 模型 | API ID | 输入 / 输出(per 1M) | 上下文 | 定位 |
|---|---|---|---|---|
| Fable 5(Mythos 级) | claude-fable-5 | $10 / $50 | 1M | 能力天花板 |
| Opus 5 | claude-opus-5 | $5 / $25 | 1M | 前沿旗舰——最佳性价比 |
| Sonnet 5 | claude-sonnet-5 | $2 / $10 优惠价 | 1M | 日常智能体主力 |
| Haiku 4.5 | claude-haiku-4-5 | $1 / $5 | 200K | 最快、最便宜 |
适用场景
- 智能体编程——CursorBench、Frontier-Bench、SWE-bench Verified 96%
- 计算机使用自动化(OSWorld 2.0 70.6%)
- 业务任务自动化(Zapier AutomationBench 26%,约为第二名的 1.5 倍)
- 复杂推理与新颖问题求解(ARC-AGI-3、IMO 金牌水准)
优缺点
优势
- Frontier-Bench v0.1 SOTA(43.3%),超 Opus 4.8 一倍以上,领先 Fable 5 与 GPT-5.6 Sol
- ARC-AGI-3 达 30.2%——约为第二名(GPT-5.6 Sol 7.8%)的 4 倍
- OSWorld 2.0 达 70.6%,以 Fable 5 约三分之一的成本超越其最佳成绩
- 定价不变 $5/$25——Fable 5 的一半,能力接近 Fable
局限
- 事实性幻觉略高于 Opus 4.8(Anthropic 自行披露)
- SWE-bench Pro(79.2%)仍略逊 Fable 5(80.3%)
- high 以上 effort 不可关闭推理——可能推高 token 用量
- 不支持音频或视频输入/输出
常见问题
Claude Opus 5 什么时候发布的?
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,取代 Opus 4.8 成为 Opus 级旗舰。同日上线 Claude.ai(Claude Max 默认)、Claude Code、Claude Cowork、Claude API、AWS Bedrock、Google Vertex AI 和 Microsoft Foundry。
Claude Opus 5 多少钱?
标准 API 定价为每百万输入 token $5、输出 $25——与 Opus 4.8 持平,是 Fable 5($10/$50)的一半。Fast Mode $10 / $50(约 2.5 倍速度)。缓存读取 $0.50 / 1M。Batch API 半价。
Claude Opus 5 比 Fable 5 好吗?
在多个基准上是的——Opus 5 在 Frontier-Bench(43.3% vs 33.7%)、ARC-AGI-3(30.2%)和 OSWorld 2.0(70.6%,约 Fable 三分之一成本)均领先。Fable 5 在最难的编程拆分 SWE-bench Pro(80.3% vs 79.2%)仍占优,并在网络安全与生物任务上保持能力上限。问题在于差距是否值得 2 倍的 token 价格。
Claude Opus 5 的 API 模型 ID 是什么?
Claude API 和 Vertex AI 使用 `claude-opus-5`。AWS Bedrock 上为 `anthropic.claude-opus-5`。上下文窗口 1M token,最大输出 128K。
可以关闭 Claude Opus 5 的推理吗?
推理默认开启。low、medium 和 high effort 下可关闭,但 high 以上 effort 关闭会返回 400 错误。这是相对 Opus 4.8 的破坏性变更。
Claude Opus 5 的知识截止日期是什么?
根据 system card,为 2026 年 5 月——发布时所有 Claude 模型中最新的截止日期。