2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5(claude-opus-5-20250724)——Claude 产品线的新顶端。核心卖点:与 Opus 4.8 同价($5/$25),在基准上大幅逼近 Fable 5,并在多项 agent 指标上超越它。
关键数据
| 基准 | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| AA Intelligence Index | 61(#1) | — | 61.4(前 #1) |
| SWE-bench Pro | 79.2% | 80.3% | 69.2% |
| Frontier-Bench | 43.3%(SOTA) | — | — |
| ARC-AGI-3 | 30.2%(4 倍于第二) | — | — |
| OSWorld 2.0 | 70.6% | ~65% | — |
| Zapier AutomationBench | 26%(约 1.5 倍于第二) | — | — |
变化要点
- 默认开启思考模式。 Opus 5 首次默认启用 extended thinking,无需手动开启。
- 近 Fable 半价。 SWE-bench Pro 79.2% 仅落后 Fable 5 的 80.3% 不到 1.1 分,价格是后者的一半($5/$25 vs $10/$50)。
- Agent 基准反超。 OSWorld 2.0(70.6%)和 Zapier AutomationBench(26%)均超越 Fable 5——Opus 5 已是 Claude 产品线中最强的计算机使用和自动化模型。
- 定价不变。 $5 输入 / $25 输出每 100 万 token,缓存和 Batch 折扣与 Opus 4.8 费率一致。
取舍
Anthropic 自身的 system card 指出,Opus 5 的幻觉率略高于 Opus 4.8——模型以极端校准换取了巨大的 agent 能力提升。对于静默失败代价高昂的高风险场景,这是需要随生产报告积累来监控的变量。
为什么重要
- 前沿价格门槛下降。 接近 Fable 的能力只需 $5/$25,多数用户不再需要在质量和预算之间取舍——差距只剩最难基准上的约 1 分。
- Opus 4.8 进入遗留。 Anthropic 仍在提供服务,但同价之下 Opus 5 立即成为新项目的默认选择。
- Claude 阵容现为四层。 Haiku → Sonnet 5 → Opus 5 → Fable 5,每层价格约翻倍、收益递减——agent 集群的清晰升级阶梯。
完整规格、基准与定价:Claude Opus 5 模型页。全景背景见 2026 LLM 指南。