Claude Sonnet 5 是 Anthropic 于 2026 年 6 月 30 日推出的 Sonnet 4.6 继任者——也是该公司迄今最清晰的一次表态:智能体能力正在向中端价位下沉。官方的说法是:规划、工具调用与自主多步工作「达到了几个月前还需要更大、更贵的模型才能做到的水平」,而首发价只要每 100 万 token $2 / $10(8 月 31 日后恢复 $3 / $15,与 Sonnet 4.6 持平)。
这次发布的主线是成本,而非新的能力天花板。按首发价,Sonnet 5 低于 GPT-5.5($5/$30)、Gemini 3.1 Pro(约 $2/$12),也低于 Anthropic 自家的 Opus 4.8($5/$25)——质量却贴近 Opus,在 Anthropic 的知识工作基准上甚至反超了 Opus 4.8。不过独立测试指出了一个重要的例外:Sonnet 5 每个任务干的活多得多,标准价下单任务成本可能反超 Opus 4.8。详见下文。

基准测试
Anthropic 发布时给出了 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比表。以下数字均为 Anthropic 自报(截至 2026 年 6 月 30 日),请视作一份带日期的快照。
| 基准 | 测什么 | Sonnet 5 | Sonnet 4.6 | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Pro | 最难、防泄漏的编码 | 63.2% | 58.1% | 69.2% |
| Terminal-Bench 2.1 | 终端 / CLI 智能体任务 | 80.4% | 67.0% | 未报告 |
| OSWorld-Verified | 计算机使用(桌面操控) | 81.2% | 78.5% | 未报告 |
| Humanity’s Last Exam(带工具) | 高难专家问题 | 57.4% | 46.8% | 57.9% |
| GDPval-AA v2 | 知识工作(Elo) | 1,618 | 未报告 | 1,615 |
三个结果值得注意:
- Terminal-Bench 2.1 比 Sonnet 4.6 跳升 13.4 分——这是真实终端 / CLI 智能体行为改善最直接的信号。
- 带工具的 Humanity’s Last Exam 与 Opus 4.8 只差半分(57.4% vs 57.9%),而 Sonnet 4.6 落后 11 分。
- GDPval-AA v2 小幅反超 Opus 4.8(1,618 vs 1,615)。注意 v2:Anthropic 为这轮评测更新了评分器,这些 Elo 与本站其他页面引用的 v1 数字(如 Opus 4.8 的 1,890)不可直接比较。
Opus 4.8 仍保有明确领先的地方是 SWE-bench Pro(69.2% vs 63.2%)。最难、最长程的编码任务,Opus 依然是更强的选择。
独立视角:Artificial Analysis
Anthropic 的数字终归是自报,所以最有用的外部信号来自发布前参与评估的 Artificial Analysis:
- 智能指数:53(max effort)——整体第 5 名,比 Sonnet 4.6 提升 6 分,与 high 档的 GPT-5.5 持平,落后 xhigh 档 GPT-5.5 与 max 档 Opus 4.8 约 2–3 分。
- 单任务成本:$2.29(按标准价 $3/$15 计)——约为 Sonnet 4.6 的两倍,比 Opus 4.8 高约 15%。推手是 token 用量而非单价:max effort 下 Sonnet 5 的输出 token 比 Sonnet 4.6 多约 40%,知识工作基准上的智能体轮次约为 3 倍。
- effort 影响巨大:在 GDPval-AA 上,max effort 的轮次约为 low 的 6 倍。真正决定账单的是 effort 旋钮,不是价目表。
- 越级表现:在 AA-Briefcase 与 GDPval-AA(智能体知识工作)上,Sonnet 5 略高于 Opus 4.8,仅次于 Claude Fable 5。
- 短板所在:在前沿物理推理基准 CritPt 上得 17%——比 Sonnet 4.6 高 14 分,但落后 GLM-5.2、Opus、Fable 与 xhigh 档 GPT-5.5。
诚实的成本结论是:「比 Opus 便宜」只在促销窗口内、或较低 effort 档位下成立。标准价 + max effort 时,Sonnet 5 的单任务成本可能高于 Opus 4.8,而智能略逊。按任务算账,别按 token 算。
定价
| 阶段 | 输入 / 100 万 | 输出 / 100 万 | 备注 |
|---|---|---|---|
| 首发价(至 2026-08-31) | $2.00 | $10.00 | 发布时最便宜的可用智能体模型 |
| 标准价(2026-09-01 起) | $3.00 | $15.00 | 与 Sonnet 4.6 价目表相同 |
| 缓存写入 | $3.75 | — | 加价 25%,TTL 5 分钟 |
| 缓存读取 | $0.30 | — | 立减 90% |
两个值得提前规划的成本注意点:
- tokenizer 变了。 Sonnet 5 的新 tokenizer 会把相同文本映射为约 1.0–1.35 倍的 token(代码与非英语文本靠上限)——类似 Opus 4.7 引入的那次变更。Anthropic 称首发价的设定让迁移大致成本中性;在假设省钱之前,先用有代表性的 prompt 重新基准。
- token 用量才是真正的变量。 如 Artificial Analysis 数据所示,高 effort 档会成倍放大轮次与输出 token。大规模部署请按工作负载显式设置 effort。
思考与 effort
自适应思考始终开启——模型自行决定为任务投入多少推理。API 与 Claude Code 中 effort 默认为 high。Sonnet 5 新增了 Sonnet 4.6 没有的 xhigh 档,与 Opus 4.8 一样拥有五档:max、xhigh、high、medium、low。
这与 Opus 层级采用的是同一套推理方案,也是 Sonnet 5 能大幅缩小智能体差距的关键:它可以规划多步任务、调用工具、读取结果并自行纠偏,无需人在每一步推动。这同样解释了成本为何随 effort 陡增——同一任务下 max effort 的智能体轮次是 low 的数倍。
为智能体而生
这次发布最清晰的主题:Sonnet 5 是为运行智能体设计的,不只是回答问题。涨幅最大的(Terminal-Bench、OSWorld)都是智能体基准,合作伙伴的反馈也集中在「有始有终」上:
- Zapier 报告说,过去「跑到一半就卡住」的多步自动化现在能端到端完成——「对日常自动化来说,这是个无脑之选。」
- Lovable 强调拒绝质量:「知道何时说不的模型,和知道怎么构建的模型同样重要。」
- ClickHouse 称其推理步骤更紧凑、实时数据智能体出结果明显更快;法律方向的 Eve 称其在原告方法律任务上处于帕累托前沿;Pace 用它跑保险后台工作流。
对已经把智能体流量路由到 Opus 4.8 的团队,实用模式是:主力跑 Sonnet 5,只把最难的编码步骤升级到 Opus。
安全性
Anthropic 报告 Sonnet 5 在其发布前评估套件中全面优于 Sonnet 4.6:失准行为更少、更少配合滥用、更少欺骗、幻觉更少、对恶意请求的拒绝更可靠——在智能体场景下对 prompt 注入劫持的抵抗也更强(不过其自动化审计的失准率仍高于 Opus 4.8)。
一个刻意的设计选择值得单独说:Sonnet 5 没有针对攻击性网络安全进行训练。在漏洞利用开发评估中(如构造可用的 Firefox exploit),它的完全成功率为 0%——远低于 Opus 4.8 与 Mythos 5。Anthropic 将此定位为大规模部署模型的安全属性,并默认启用网络安全防护(与 Opus 4.7/4.8 同级,比 Fable 5 的宽松)。如果你的防御性安全工作需要更少的护栏,Anthropic 建议使用 Opus 4.8 及其 Cyber Verification Program。
可用性
发布当天(2026 年 6 月 30 日)即全面上线:
| 渠道 | 状态 |
|---|---|
| claude.ai | Free 与 Pro 的新默认模型;Max、Team、Enterprise 可用 |
| Claude Code | 发布即可用 |
| Claude API / Platform | claude-sonnet-5 |
| 第三方工具 | Cursor、VS Code、GitHub Copilot 发布即接入 |
把它设为免费档默认模型,意味着 Anthropic 的整个消费者群体立刻用上了具备智能体能力的模型——Anthropic 也同步上调了 Chat、Cowork、Claude Code 与 Platform 的速率限制,以吸收高 effort 档更高的 token 用量。
Claude Sonnet 5 横向对比
| Claude Sonnet 5 | GPT-5.5 | Gemini 3.1 Pro | |
|---|---|---|---|
| 价格(输入/输出,每 100 万) | $2 / $10 首发 · $3 / $15 标准 | $5 / $30 | 约 $2 / $12 |
| 上下文 | 1M | 400K–1M | 1M |
| SWE-bench Pro | 63.2% | 58.6% | 54.2% |
| Terminal-Bench 2.1 | 80.4% | 83.4%(Codex CLI 环境) | 70.7% |
| 输入模态 | 文本、图像 | 文本、图像、音频、视频 | 文本、图像、音频、视频 |
- vs GPT-5.5: Sonnet 5 拿下 SWE-bench Pro;GPT-5.5 在自家环境下拿下 Terminal-Bench,并支持音视频输入。按 token 计 Sonnet 5 便宜得多。
- vs Gemini 3.1 Pro: 首发价下两者价格几乎相同;Gemini 原生全模态,Sonnet 5 领先智能体编码基准。
- vs Opus 4.8: 6 分的 SWE-bench Pro 差距如今是 Opus 溢价买到的主要东西。知识工作上两者打平。
没有哪个旗舰能赢下所有类目——Sonnet 5 的差异化在于:Claude 生态里最低的标价,买到贴近 Opus 的质量。
Claude 产品线(2026 年 7 月)
| 模型 | API ID | 输入/输出(每 100 万) | 上下文 | 定位 |
|---|---|---|---|---|
| Fable 5(Mythos 级) | claude-fable-5 | $10 / $50 | 1M | 能力天花板,面向大众开放 |
| Opus 4.8 | claude-opus-4-8 | $5 / $25 | 1M | 最难编码 + 可靠性 |
| Sonnet 5 | claude-sonnet-5 | $2 / $10 首发 | 1M | 日常智能体主力 |
| Haiku 4.5 | claude-haiku-4-5 | $1 / $5 | 200K | 最快、最便宜 |
Sonnet 5 是对 Sonnet 4.6 的彻底替代——每项已公布基准都更好,标准价不变。它逼出的问题已经不是「中端模型能不能跑智能体」,而是「哪些步骤还值得付 Opus 或 Fable 的价钱」。
适用场景
- Opus 价格难以承受的大规模智能体部署
- 日常编码、终端与浏览器自动化
- 智能体化知识工作——文档分析、研究、专业产出
优缺点
优势
- 接近 Opus 的智能体表现——知识工作追平 Opus 4.8(GDPval-AA v2 1,618 vs 1,615)
- Terminal-Bench 2.1 比 Sonnet 4.6 提升 13+ 分(80.4% vs 67.0%)
- 首发窗口内是最便宜的可用智能体模型——低于 GPT-5.5、Gemini 3.1 Pro 与 Opus 4.8
- 五档 effort(新增 xhigh)可按任务调节成本与智能的平衡
局限
- 每任务消耗的 token 远多于 Sonnet 4.6——标准价下单任务成本可能反超 Opus 4.8(Artificial Analysis 实测)
- 新 tokenizer 使相同文本的 token 数膨胀约 1.0–1.35 倍
- 在最难的编码基准 SWE-bench Pro 上落后 Opus 4.8 约 6 分
- 攻击性网络安全能力被刻意压低——这是设计使然,并非缺陷
常见问题
Claude Sonnet 5 是什么时候发布的?
Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5,作为 Sonnet 4.6 的继任者。发布当天即全面上线——claude.ai(成为 Free 与 Pro 用户的新默认模型)、Claude Code、Claude API,以及 Cursor、VS Code、GitHub Copilot 等第三方工具。
Claude Sonnet 5 的价格是多少?
首发价持续至 2026 年 8 月 31 日,为每 100 万 token 输入 $2、输出 $10。9 月 1 日起恢复标准价 $3 / $15——与 Sonnet 4.6 完全相同。缓存写入 $3.75 / 100 万,缓存读取 $0.30 / 100 万。
Claude Sonnet 5 比 Opus 4.8 更好吗?
取决于任务。Sonnet 5 在知识工作上小幅超过 Opus 4.8(GDPval-AA v2 1,618 vs 1,615),带工具推理也只差半分;但在最难的智能体编码基准 SWE-bench Pro 上落后约 6 分。对多数生产工作而言,质量差距已经小到由价格来决定选择。
Claude Sonnet 5 真的比 Opus 4.8 便宜吗?
按 token 计是的——但按任务计未必。Artificial Analysis 在标准价下实测 Sonnet 5 在其智能指数上的单任务成本为 $2.29,比 Opus 4.8 高约 15%,原因是 max effort 下 Sonnet 5 的输出 token 多约 40%、智能体轮次约为 3 倍。调低 effort 档位(或趁首发价)则结论反转。
Claude Sonnet 5 的新 tokenizer 是怎么回事?
Sonnet 5 采用更新后的 tokenizer(类似 Opus 4.7 引入的变化),相同文本会映射为约 1.0–1.35 倍的 token,代码与非英语文本靠上限。Anthropic 表示首发价的设定让从 Sonnet 4.6 迁移大致成本中性;在假设省钱之前,请先用真实工作负载重新校准。
Claude Sonnet 5 的 API 模型 ID 是什么?
在 Claude API 上使用 `claude-sonnet-5`。模型拥有 100 万 token 上下文窗口;自适应思考始终开启,API 与 Claude Code 中 effort 默认为 high。