注意: Claude Opus 5 已于 2026 年 7 月 24 日发布,取代 Opus 4.8 成为 Opus 级旗舰。Opus 5 同价($5/$25)且在所有已发表基准上均优于 4.8。留在 4.8 的主要理由是其略好的幻觉校准能力。
截至 2026 年 6 月,Claude Opus 4.8 曾是整体智能的领跑者——它拿下了任何已发布模型在 Artificial Analysis(AA)Intelligence Index 上的最高分(61.4),微弱领先 GPT-5.5(60.2)。它在最难的智能体编码(SWE-bench Pro 69.2%)、计算机使用(OSWorld-Verified 83.4%)与专业知识工作(GDPval-AA 1,890 Elo)上登顶,并辅以所有前沿模型中最审慎的幻觉校准。
它于 2026 年 5 月 28 日作为对 Opus 4.7 的小版本升级发布,亮点不在原始分数——那些只动了几分——而在判断力。Anthropic 报告 Opus 4.8 是首个在“不加批判地报告错误结果”上得 0% 的 Claude,且让代码缺陷未经标记溜过去的概率约为 4.7 的四分之一。对团队而言,这才是真正的故事:当错答代价高昂时——生产代码、法律与金融分析、长达数小时的智能体运行——Opus 4.8 就是你要伸手去拿的模型。
代价在成本。在 $5 / $25 每 100 万 token 下,它是 Anthropic 自家产品线中最贵的模型,是那些在最难基准上仅差几分的开源权重编码模型的数倍价格。新的、更便宜的 Fast Mode 与 Claude Code 中的 Dynamic Workflows 预览改变了成本与延迟的算式,但基础价目表未变。
基准
Opus 4.8 相对 4.7 的提升集中在智能体与知识工作任务,而非原始问答。下列数字为 Anthropic 于 2026 年 6 月自报,请当作有时效的快照看待。
| 基准 | 衡量什么 | Opus 4.8 | Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|
| SWE-bench Verified | 真实世界的缺陷修复 | 88.6% | 87.6% | 88.7% |
| SWE-bench Pro | 最难、控泄漏的编码 | 69.2% | 64.3% | 58.6% |
| SWE-bench Multilingual | 跨语言编码 | 84.4% | 80.5% | — |
| Terminal-Bench 2.1 (Terminus-2) | 终端 / CLI 任务 | 74.6% | 66.1% | 78.2% |
| OSWorld-Verified | 计算机使用(桌面控制) | 83.4% | 82.3% | 78.7% |
| MCP-Atlas | 通过 MCP 的工具使用 | 82.2% | 77.3% | — |
| GPQA Diamond | 研究生级科学问答 | 93.6% | 94.2% | 93.6% |
| Humanity’s Last Exam(带工具) | 困难专家问题 | 57.9% | 54.7% | 52.2% |
| GDPval-AA | 知识工作(Elo) | 1,890 | 1,753 | 1,769 |
几点值得了解的提醒:
- SWE-bench Pro 对比 Verified。 Pro 过滤掉模型表现出记忆迹象的任务,因此那里的 69.2% 比 Verified 上的 88.6% 来得更艰难。在 Pro 上对 GPT-5.5 约 11 分的领先,是 Opus 4.8 最清晰的编码优势。
- Terminal-Bench 是 GPT-5.5 取胜之处。 在通用的 Terminus-2 运行框架上,GPT-5.5 以 78.2% 胜过 Opus 4.8 的 74.6%;在自家的 Codex CLI 运行框架上,GPT-5.5 报告 83.4%。若终端原生智能体是你的工作负载,参见 GPT-5.5。
- 知识工作。 Anthropic 在 GDPval-AA(其衡量真实世界专业任务的指标)上把 Opus 4.8 置于 GPT-5.5 之上约 121 Elo。
定价与成本
基础价目表自 Opus 4.5 以来保持不变。4.8 中变动的是 Fast Mode 与提示缓存。
| 档位 | 输入 / 100 万 | 输出 / 100 万 | 备注 |
|---|---|---|---|
| 标准 | $5.00 | $25.00 | 自 Opus 4.5 以来未变 |
| Fast Mode | $10.00 | $50.00 | 同一模型,约 2.5× 输出速度;比之前的快速模式便宜 3× |
| 仅美国推理 | $5.50 | $27.50 | 数据驻留选项 |
| 提示缓存(读取) | ~$0.50 | — | 约为输入的 10%;缓存最低 1,024 token(由 2,048 下调) |
实际影响:
- 缓存是最大杠杆。 在约为输入 10% 的水平上,缓存读取让庞大而稳定的系统提示词与工具定义可在一次会话中廉价复用。1,024 token 的更低门槛意味着即便小提示词也值得缓存。
- Fast Mode 现在很划算。 由于 Fast Mode 降到此前价格的三分之一,延迟敏感的流程(交互式智能体、IDE 式循环)可以运行同一个前沿模型,而非降级到 Sonnet。
- 路由仍然重要。 对高并发或低风险工作,Gemini 3.1 Pro(约 $2 输入)或像 DeepSeek V4-Pro 这样的开源权重,单 token 成本只是零头。把 Opus 4.8 留给可靠性能自我回本的步骤。
能力与 4.8 的变化
- 幻觉校准。 旗舰级变化。Opus 4.8 明显更不会断言未经核实的结果,或静默地放过缺陷——正是这一特质让它成为高风险智能体运行的默认之选。
- 强度控制。 Opus 4.8 采用自适应思考,
effort参数在每个界面(含 API 与 Claude Code)上默认为high。调低它可用深度换速度与成本。在 Claude.ai 上,用户会得到对应的强度滑块。 - Dynamic Workflows(研究预览)。 在 Claude Code 中,Opus 4.8 能写出一段编排脚本并运行并行子智能体——单次运行最多 16 个并发、1,000 个总数——在一次会话内攻克代码库级别的任务。
- 计算机使用。 强劲的桌面控制(OSWorld-Verified 83.4%,Online-Mind2Web 约 84%),用于浏览器与 GUI 驱动的自动化。
- 长上下文。 可靠的 1M token 窗口,大海捞针召回率高,外加最多 128K token 输出(通过 Batch API beta 头可达 300K)。
安全与对齐
Anthropic 在其**负责任扩展策略(RSP)**下交付前沿模型,该策略以分级的 **AI 安全等级(ASL)**为能力设闸。Opus 4.8 在 ASL-3 防护下部署——与 Opus 4 系列其余成员同一等级——并对最高风险的滥用类别采用基于分类器的监控。再上一级的 Mythos 级 Fable 5 已于 2026 年 6 月 9 日经新分类器层面向大众开放——值得一提的是,它的网络安全/生物/蒸馏类回落正是由 Opus 4.8 承接。
日常使用中真正重要的:
- 校准就是安全故事。 4.8 的招牌变化是不确定性下的诚实:Anthropic 报告在“不加批判地报告错误结果”上得 0%,静默遗漏缺陷的概率约为 4.7 的 1/4。实践中,模型会抛出“我不确定”,而非编造——正是这一特质让把它放进循环更安全。
- 以 Constitutional AI + RLHF 训练。 拒答被调校得在面对无害请求时比早期 Claude 更不过度谨慎,同时仍拒绝真正有害的请求。
- 智能体加固。 由于 Opus 4.8 会对网页内容、文件与工具采取行动,抗提示注入与抗越狱是重点。没有前沿模型对此免疫,因此请对不可逆或高影响动作(支付、删除、部署)保留人工审批关卡。
- 数据处理。 默认情况下,API 的输入与输出不会被用于训练 Anthropic 模型,符合条件的账户还可启用零数据保留——这对法律、健康与金融工作负载很关键。
应用场景与实战示例
Opus 4.8 在错答代价高昂、或运行足够长以致小错误率会复利累积的任务上,配得起它的溢价。三种它是正确之选的模式:
1. 长时运行的编码智能体
这是旗舰用例。借助 Claude Code 中的 Dynamic Workflows(研究预览),Opus 4.8 能写出自己的编排脚本,并扇出并行子智能体——单次运行最多 16 个并发、1,000 个总数——在一次会话内承担代码库级别的重构、迁移与修测试。高 SWE-bench Pro 分数(69.2%)加上其缺陷标记校准,意味着它更不会通过悄悄破坏行为来“修好”一个测试。
import anthropic
client = anthropic.Anthropic()
resp = client.messages.create(
model="claude-opus-4-8", # AWS Bedrock:anthropic.claude-opus-4-8
max_tokens=8000,
effort="high", # 默认;调低为 "medium"/"low" 以削减成本与延迟
messages=[
{
"role": "user",
"content": "Refactor this module to remove the global state, and flag anything you are not certain about.",
}
],
)
print(resp.content[0].text)
2. 高风险分析(法律、金融、研究)
当“自信却错误”的答案代价高昂时——合同审阅、财务建模、尽职调查、科学文献综合——Opus 4.8 的校准就是差异化所在。提示它显式标出假设与低置信度论断;它遵循得很好,把黑箱答案变成可审计的答案。
3. 计算机使用自动化
凭借 OSWorld-Verified 83.4%(Online-Mind2Web 约 84%),Opus 4.8 擅长驱动真实的桌面与浏览器 UI——填表、跨遗留应用的数据抽取、没有 API 的多步工作流。把它与审批关卡配合,让智能体在任何破坏性动作前暂停。
对这些工作的高并发或低风险变体,把大头路由给 Sonnet 4.6 或更便宜的模型,把 Opus 4.8 留给最难的步骤(见下方的提示技巧)。
提示与最佳实践
- 刻意设置
effort。 它在每个界面上默认为high,那是最强也最贵/最慢的档位。常规工作降到medium或low——你能以零头的延迟保留模型的判断力。 - 积极缓存。 在约为输入 10% 的水平上,提示缓存读取让稳定的系统提示词与工具定义在一次会话内几乎免费复用;1,024 token 的门槛意味着即便小而重复的上下文也值得缓存。
- 升级而非默认。 让流量从 Sonnet 4.6 起步,只把最难的步骤升级到 Opus 4.8。为智能体循环的每一回合都支付 $5/$25 是最常见的超支方式。
- 倚重它的校准。 显式要求它“标出假设以及任何你不确定的地方”。Opus 4.8 会可靠地遵循,这正是你在高风险流程中想要的。
- 给出干净的工具 schema。 对智能体而言,清晰、描述良好的工具胜过花哨的提示。用 Dynamic Workflows 做代码库级别的并行,并对不可逆动作保留审批关卡。
- 组织好长上下文。 1M 窗口内的召回很强,但把关键指令放在开头与结尾附近、并对源材料分块,仍能提升可靠性。
局限与已知坑
- 终端/CLI 智能体交给 GPT-5.5。 在通用的 Terminus-2 运行框架上,GPT-5.5 以 78.2% 领先 74.6%。若你的工作负载是终端原生的,GPT-5.5 是更好的默认。
- 文本与图像输入,仅文本输出。 Opus 4.8 不接受音频或视频,也不生成图像、音频或视频。要全模态 I/O,参见 GPT-5.5 或 Gemini 3.1 Pro。
- 它是价格天花板。 在 $5/$25 下,它是 Anthropic 产品线中最贵的模型,是那些在最难基准上仅差几分的开源权重编码模型的 5–12×。在 $25–$50 每 100 万 token 下,输出密集的工作累加起来很快。
- 默认强度下的延迟。 深度思考增加延迟;对交互式、延迟敏感的循环使用 Fast Mode 或更低的
effort。 - 校准可能读作过度谨慎。 同样的诚实在防止编造的同时,也可能意味着更多对冲与澄清式提问——在你想要果断时,用提示把它调回来。
- 知识截止为 2026 年 1 月。 对更近的内容,请提供当前事实、文档或工具。
- 上下文上限因界面而异。 Microsoft Foundry 上限为 200K token,其余地方为完整 1M。
- Dynamic Workflows 是预览。 预期有粗糙之处;没有护栏前别把它放到生产关键路径上。
如何使用 Claude Opus 4.8
Opus 4.8 首日即在各处可用。知识截止为 2026 年 1 月。
| 界面 | 模型 ID | 上下文 |
|---|---|---|
| Claude API | claude-opus-4-8 | 1M |
| AWS Bedrock | anthropic.claude-opus-4-8 | 1M |
| Google Vertex AI | claude-opus-4-8 | 1M |
| Microsoft Foundry | claude-opus-4-8 | 200K |
| Claude.ai / Claude Code | —(付费档) | 最高 1M |
在 Microsoft Foundry 上上下文窗口被限制在 200K token;其余地方为完整 1M。各界面可用的成本控制手段包括提示缓存、Batch API、上下文裁剪,以及把模型路由到 Sonnet/Haiku。
从 Opus 4.7 迁移
对大多数调用方,升级就是一次模型字符串替换——API 形态与 $5/$25 基础价目表未变。收益在判断力,而非接口。不过仍有几处行为变动:
| 变化 | 该怎么做 |
|---|---|
| 模型 ID | 把 claude-opus-4-7 → claude-opus-4-8(Bedrock 上为 anthropic.claude-opus-4-8) |
effort 默认为 high | 若想要 4.7 式的成本/延迟,请显式设置;常规调用降到 medium/low |
| Fast Mode 便宜约 3× | 重新审视任何仅为延迟而降级到 Sonnet 的路由——同一前沿模型现在在 Fast Mode($10/$50)下已可负担 |
| 缓存最低 2,048 → 1,024 token | 比在 4.7 上缓存更多、更小的提示词 |
| 更强的缺陷/不确定性标记 | 更新假定 4.7 更自信语气的黄金测试与评测——4.8 更多对冲与标记 |
| Dynamic Workflows 预览 | 在 Claude Code 中可用,面向并行子智能体的代码库级别任务 |
分词器说明: 那个把有效成本抬高最多约 35% 的分词器落在 Opus 4.7,4.8 沿用了它——因此从 4.7 → 4.8 迁移时 token 计数稳定。只有当你从 Opus 4.6 或更早版本迁来时,才需要重新估算花费。
Claude Opus 4.8 横向对比
2026 年 6 月的前沿是一个紧密的集群——没有单一最佳模型,只有针对你任务的最佳模型。更完整的拆解见我们的 2026 LLM 全景指南;简而言之:
| Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro | |
|---|---|---|---|
| AA Intelligence Index | 61.4 | 60.2 | 57 |
| 价格(输入 / 输出,每 100 万) | $5 / $25 | $5 / $30 | ~$2 / $4–12 |
| 上下文 | 1M | 400K–1M | 1M |
| 输入模态 | 文本、图像 | 文本、图像、音频、视频 | 文本、图像、音频、视频 |
| 领先于 | 整体智能、最难的智能体编码、可靠性 | 终端/CLI 智能体、全模态 I/O | 性价比、多模态推理 |
- 对比 GPT-5.5: Opus 4.8 在整体智能与 SWE-bench Pro 上取胜;GPT-5.5 在终端智能体上取胜并接受音频/视频。Opus 的输出更便宜($25 对 $30)。
- 对比 Gemini 3.1 Pro: Gemini 是性价比之选(约 $2 输入)且原生多模态;Opus 在最难的编码与校准上领先。
- 对比开源权重(DeepSeek V4-Pro、Grok 4.3): 这些在编码上仅差几分,价格却低 5–12×。Opus 4.8 的溢价买到的是可靠性与排行榜榜首,而非一道断层式的能力鸿沟。
Claude 4.8 家族
Opus 是顶层;大多数生产流量应从 Sonnet 起步,只在最难的步骤升级到 Opus。
| 模型 | API ID | 输入 / 输出(每 100 万) | 上下文 | 最大输出 | 适合 |
|---|---|---|---|---|---|
| Fable 5(Mythos 级) | claude-fable-5 | $10 / $50 | 1M | 128K | 天花板能力,现已面向大众开放 |
| Opus 4.8 | claude-opus-4-8 | $5 / $25 | 1M | 128K | 最难的推理 + 智能体编码 |
| Sonnet 5 | claude-sonnet-5 | $2 / $10 首发 · $3 / $15 标准 | 1M | 64K | 日常智能体主力(已替代 Sonnet 4.6) |
| Haiku 4.5 | claude-haiku-4-5 | $1 / $5 | 200K | 64K | 最快、最便宜、接近前沿 |
Opus 之上是 Anthropic 的 Mythos 级层级:Fable 5 已于 2026 年 6 月 9 日面向大众开放(经历 18 天出口管制暂停后,7 月 1 日全球回归),其网络安全/生物/蒸馏类请求会回落到 Opus 4.8 处理。该层级最早以内部“Project Glasswing”项目下的“Claude Mythos Preview”形态出现在泄露的 Opus 系统提示词中(见下文)。Opus 之下,Sonnet 5 于 6 月 30 日替代 Sonnet 4.6,以远低于 Opus 的价格补齐了大部分智能体差距。
版本沿革
Opus 4.x 系列自 Opus 4.5 起共用同一份 $5 / $25 价目表。Opus 4.7 引入了一个新分词器,对某些迁移把有效成本抬高最多约 35%。Opus 4.8(2026 年 5 月 28 日)沿用该价目表,但加入了招牌的校准/诚实增益、比之前便宜三倍的 Fast Mode、Dynamic Workflows 预览,以及 AA Intelligence Index 的榜首——这是 Claude 模型首次完全领跑该指数。
适用场景
- 生产级编码与长时运行的软件智能体
- 法律、金融与分析等错答代价高昂的场景
- 计算机使用自动化(OSWorld 83.4%)
优缺点
优势
- 截至 2026 年 6 月,已发布模型中最高的 AA Intelligence Index(61.4)
- 在最难的智能体编码(SWE-bench Pro 69.2%)与计算机使用(OSWorld 83.4%)上登顶
- 前沿中最佳的幻觉校准;更便宜的 Fast Mode 与 Dynamic Workflows
局限
- 自家产品线中最贵的模型
- 比 SWE 分数相近的开源权重编码模型贵 5–8×
- 在终端/CLI 智能体上落后 GPT-5.5
常见问题
Claude Opus 4.8 何时发布?
Anthropic 于 2026 年 5 月 28 日发布 Claude Opus 4.8,作为对 Opus 4.7 的小版本升级。它当天即在 Claude.ai、Claude API、AWS Bedrock、Google Vertex AI 与 Microsoft Foundry 上线。
Claude Opus 4.8 价格如何?
标准 API 价格为每 100 万输入 token $5、每 100 万输出 token $25——自 Opus 4.5 以来未变。Fast Mode 为 $10 / $50,提示缓存读取约为输入的 10%(约 $0.50 / 100 万)。
Claude Opus 4.8 的上下文窗口有多大?
在 Claude API、AWS Bedrock 与 Google Vertex AI 上为 1,000,000 token,最多 128K token 输出(Batch API 提供 300K 输出的 beta)。在 Microsoft Foundry 上上下文窗口为 200K token。
Claude Opus 4.8 的 API 模型 ID 是什么?
在 Claude API 与 Vertex AI 上使用 `claude-opus-4-8`。在 AWS Bedrock 上,ID 带前缀为 `anthropic.claude-opus-4-8`。
Claude Opus 4.8 比 GPT-5.5 更好吗?
取决于任务。Opus 4.8 在整体智能(AA Index 61.4 对 60.2)与最难的智能体编码(SWE-bench Pro 69.2% 对 58.6%)上领先,幻觉校准也更强。GPT-5.5 仍在终端/CLI 智能体上领先,并且原生全模态。
Claude Opus 4.8 的 Fast Mode 是什么?
Fast Mode 以约 2.5× 的输出速度运行同一个 Opus 4.8 模型,token 价格翻倍($10 / $50)。Anthropic 表示 Fast Mode 现在比之前的 Opus 版本便宜三倍。
Claude Opus 4.8 接受图像吗?
是。Opus 4.8 接受文本与图像输入,返回文本输出。它不生成图像、音频或视频。
在自主智能体中使用 Claude Opus 4.8 安全吗?
它在 Anthropic 的 ASL-3 防护下部署,是校准最佳的前沿模型——它比 Opus 4.7 远更可靠地标记不确定性与遗漏的缺陷,从而减少长智能体运行中的静默失败。它并非万无一失,因此请对不可逆或高影响动作(如支付、删除与部署)保留人工审批关卡。
我应该从 Opus 4.7 升级到 Opus 4.8 吗?
对大多数集成而言,这是一次直接替换模型字符串、保持同样 $5 / $25 基础价格与 API 形态的升级,你还能获得更好的判断力与便宜得多的 Fast Mode。注意 effort 参数现在默认为 high、模型更频繁地标记不确定性,因此请显式设置 effort,并更新任何假定 4.7 更自信语气的评测。