大语言模型

Claude Sonnet 5

Anthropic 迄今最具智能体能力的 Sonnet——以 $2/$10 的首发价提供接近 Opus 的编码、智能体与知识工作能力,并成为 claude.ai 的新默认模型。

Claude Sonnet 5 是 Anthropic 于 2026 年 6 月 30 日推出的 Sonnet 4.6 继任者——也是该公司迄今最清晰的一次表态:智能体能力正在向中端价位下沉。官方的说法是:规划、工具调用与自主多步工作「达到了几个月前还需要更大、更贵的模型才能做到的水平」,而首发价只要每 100 万 token $2 / $10(8 月 31 日后恢复 $3 / $15,与 Sonnet 4.6 持平)。

这次发布的主线是成本,而非新的能力天花板。按首发价,Sonnet 5 低于 GPT-5.5($5/$30)、Gemini 3.1 Pro(约 $2/$12),也低于 Anthropic 自家的 Opus 4.8($5/$25)——质量却贴近 Opus,在 Anthropic 的知识工作基准上甚至反超了 Opus 4.8。不过独立测试指出了一个重要的例外:Sonnet 5 每个任务干的活多得多,标准价下单任务成本可能反超 Opus 4.8。详见下文。

编辑配图:一颗发光的琥珀色小球驱动着浏览器、终端、文档、齿轮组成的工具环,而一颗更大却暗淡、挂着价签的球体闲置一旁,象征中端模型干着旗舰价的活。

基准测试

Anthropic 发布时给出了 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比表。以下数字均为 Anthropic 自报(截至 2026 年 6 月 30 日),请视作一份带日期的快照。

基准测什么Sonnet 5Sonnet 4.6Opus 4.8
SWE-bench Pro最难、防泄漏的编码63.2%58.1%69.2%
Terminal-Bench 2.1终端 / CLI 智能体任务80.4%67.0%未报告
OSWorld-Verified计算机使用(桌面操控)81.2%78.5%未报告
Humanity’s Last Exam(带工具)高难专家问题57.4%46.8%57.9%
GDPval-AA v2知识工作(Elo)1,618未报告1,615

三个结果值得注意:

  • Terminal-Bench 2.1 比 Sonnet 4.6 跳升 13.4 分——这是真实终端 / CLI 智能体行为改善最直接的信号。
  • 带工具的 Humanity’s Last Exam 与 Opus 4.8 只差半分(57.4% vs 57.9%),而 Sonnet 4.6 落后 11 分。
  • GDPval-AA v2 小幅反超 Opus 4.8(1,618 vs 1,615)。注意 v2:Anthropic 为这轮评测更新了评分器,这些 Elo 与本站其他页面引用的 v1 数字(如 Opus 4.8 的 1,890)不可直接比较。

Opus 4.8 仍保有明确领先的地方是 SWE-bench Pro(69.2% vs 63.2%)。最难、最长程的编码任务,Opus 依然是更强的选择。

智能体编码 — SWE-bench Pro (%)
Claude Opus 4.869.2%Claude Sonnet 563.2%Claude Sonnet 4.658.1%GPT-5.558.6%
AnthropicOpenAI
Sonnet 5 在最难的编码基准上超过 GPT-5.5,但仍落后 Opus 4.8 约 6 分。
来源:Anthropic(2026 年 6 月 30 日)及各厂商自报数据,Heyaiwiki 汇编。

独立视角:Artificial Analysis

Anthropic 的数字终归是自报,所以最有用的外部信号来自发布前参与评估的 Artificial Analysis:

  • 智能指数:53(max effort)——整体第 5 名,比 Sonnet 4.6 提升 6 分,与 high 档的 GPT-5.5 持平,落后 xhigh 档 GPT-5.5 与 max 档 Opus 4.8 约 2–3 分。
  • 单任务成本:$2.29(按标准价 $3/$15 计)——约为 Sonnet 4.6 的两倍,比 Opus 4.8 高约 15%。推手是 token 用量而非单价:max effort 下 Sonnet 5 的输出 token 比 Sonnet 4.6 多约 40%,知识工作基准上的智能体轮次约为 3 倍。
  • effort 影响巨大:在 GDPval-AA 上,max effort 的轮次约为 low 的 6 倍。真正决定账单的是 effort 旋钮,不是价目表。
  • 越级表现:在 AA-Briefcase 与 GDPval-AA(智能体知识工作)上,Sonnet 5 略高于 Opus 4.8,仅次于 Claude Fable 5
  • 短板所在:在前沿物理推理基准 CritPt 上得 17%——比 Sonnet 4.6 高 14 分,但落后 GLM-5.2、Opus、Fable 与 xhigh 档 GPT-5.5。

诚实的成本结论是:「比 Opus 便宜」只在促销窗口内、或较低 effort 档位下成立。标准价 + max effort 时,Sonnet 5 的单任务成本可能高于 Opus 4.8,而智能略逊。按任务算账,别按 token 算。

定价

阶段输入 / 100 万输出 / 100 万备注
首发价(至 2026-08-31)$2.00$10.00发布时最便宜的可用智能体模型
标准价(2026-09-01 起)$3.00$15.00与 Sonnet 4.6 价目表相同
缓存写入$3.75加价 25%,TTL 5 分钟
缓存读取$0.30立减 90%

两个值得提前规划的成本注意点:

  • tokenizer 变了。 Sonnet 5 的新 tokenizer 会把相同文本映射为约 1.0–1.35 倍的 token(代码与非英语文本靠上限)——类似 Opus 4.7 引入的那次变更。Anthropic 称首发价的设定让迁移大致成本中性;在假设省钱之前,先用有代表性的 prompt 重新基准。
  • token 用量才是真正的变量。 如 Artificial Analysis 数据所示,高 effort 档会成倍放大轮次与输出 token。大规模部署请按工作负载显式设置 effort。

思考与 effort

自适应思考始终开启——模型自行决定为任务投入多少推理。API 与 Claude Code 中 effort 默认为 high。Sonnet 5 新增了 Sonnet 4.6 没有的 xhigh 档,与 Opus 4.8 一样拥有五档:maxxhighhighmediumlow

这与 Opus 层级采用的是同一套推理方案,也是 Sonnet 5 能大幅缩小智能体差距的关键:它可以规划多步任务、调用工具、读取结果并自行纠偏,无需人在每一步推动。这同样解释了成本为何随 effort 陡增——同一任务下 max effort 的智能体轮次是 low 的数倍。

为智能体而生

这次发布最清晰的主题:Sonnet 5 是为运行智能体设计的,不只是回答问题。涨幅最大的(Terminal-Bench、OSWorld)都是智能体基准,合作伙伴的反馈也集中在「有始有终」上:

  • Zapier 报告说,过去「跑到一半就卡住」的多步自动化现在能端到端完成——「对日常自动化来说,这是个无脑之选。」
  • Lovable 强调拒绝质量:「知道何时说不的模型,和知道怎么构建的模型同样重要。」
  • ClickHouse 称其推理步骤更紧凑、实时数据智能体出结果明显更快;法律方向的 Eve 称其在原告方法律任务上处于帕累托前沿;Pace 用它跑保险后台工作流。

对已经把智能体流量路由到 Opus 4.8 的团队,实用模式是:主力跑 Sonnet 5,只把最难的编码步骤升级到 Opus。

安全性

Anthropic 报告 Sonnet 5 在其发布前评估套件中全面优于 Sonnet 4.6:失准行为更少、更少配合滥用、更少欺骗、幻觉更少、对恶意请求的拒绝更可靠——在智能体场景下对 prompt 注入劫持的抵抗也更强(不过其自动化审计的失准率仍高于 Opus 4.8)。

一个刻意的设计选择值得单独说:Sonnet 5 没有针对攻击性网络安全进行训练。在漏洞利用开发评估中(如构造可用的 Firefox exploit),它的完全成功率为 0%——远低于 Opus 4.8 与 Mythos 5。Anthropic 将此定位为大规模部署模型的安全属性,并默认启用网络安全防护(与 Opus 4.7/4.8 同级,比 Fable 5 的宽松)。如果你的防御性安全工作需要更少的护栏,Anthropic 建议使用 Opus 4.8 及其 Cyber Verification Program。

可用性

发布当天(2026 年 6 月 30 日)即全面上线:

渠道状态
claude.aiFree 与 Pro 的新默认模型;Max、Team、Enterprise 可用
Claude Code发布即可用
Claude API / Platformclaude-sonnet-5
第三方工具Cursor、VS Code、GitHub Copilot 发布即接入

把它设为免费档默认模型,意味着 Anthropic 的整个消费者群体立刻用上了具备智能体能力的模型——Anthropic 也同步上调了 Chat、Cowork、Claude Code 与 Platform 的速率限制,以吸收高 effort 档更高的 token 用量。

Claude Sonnet 5 横向对比

Claude Sonnet 5GPT-5.5Gemini 3.1 Pro
价格(输入/输出,每 100 万)$2 / $10 首发 · $3 / $15 标准$5 / $30约 $2 / $12
上下文1M400K–1M1M
SWE-bench Pro63.2%58.6%54.2%
Terminal-Bench 2.180.4%83.4%(Codex CLI 环境)70.7%
输入模态文本、图像文本、图像、音频、视频文本、图像、音频、视频
  • vs GPT-5.5: Sonnet 5 拿下 SWE-bench Pro;GPT-5.5 在自家环境下拿下 Terminal-Bench,并支持音视频输入。按 token 计 Sonnet 5 便宜得多。
  • vs Gemini 3.1 Pro: 首发价下两者价格几乎相同;Gemini 原生全模态,Sonnet 5 领先智能体编码基准。
  • vs Opus 4.8: 6 分的 SWE-bench Pro 差距如今是 Opus 溢价买到的主要东西。知识工作上两者打平。

没有哪个旗舰能赢下所有类目——Sonnet 5 的差异化在于:Claude 生态里最低的标价,买到贴近 Opus 的质量。

Claude 产品线(2026 年 7 月)

模型API ID输入/输出(每 100 万)上下文定位
Fable 5(Mythos 级)claude-fable-5$10 / $501M能力天花板,面向大众开放
Opus 4.8claude-opus-4-8$5 / $251M最难编码 + 可靠性
Sonnet 5claude-sonnet-5$2 / $10 首发1M日常智能体主力
Haiku 4.5claude-haiku-4-5$1 / $5200K最快、最便宜

Sonnet 5 是对 Sonnet 4.6 的彻底替代——每项已公布基准都更好,标准价不变。它逼出的问题已经不是「中端模型能不能跑智能体」,而是「哪些步骤还值得付 Opus 或 Fable 的价钱」。

适用场景

  • Opus 价格难以承受的大规模智能体部署
  • 日常编码、终端与浏览器自动化
  • 智能体化知识工作——文档分析、研究、专业产出

优缺点

优势

  • 接近 Opus 的智能体表现——知识工作追平 Opus 4.8(GDPval-AA v2 1,618 vs 1,615)
  • Terminal-Bench 2.1 比 Sonnet 4.6 提升 13+ 分(80.4% vs 67.0%)
  • 首发窗口内是最便宜的可用智能体模型——低于 GPT-5.5、Gemini 3.1 Pro 与 Opus 4.8
  • 五档 effort(新增 xhigh)可按任务调节成本与智能的平衡

局限

  • 每任务消耗的 token 远多于 Sonnet 4.6——标准价下单任务成本可能反超 Opus 4.8(Artificial Analysis 实测)
  • 新 tokenizer 使相同文本的 token 数膨胀约 1.0–1.35 倍
  • 在最难的编码基准 SWE-bench Pro 上落后 Opus 4.8 约 6 分
  • 攻击性网络安全能力被刻意压低——这是设计使然,并非缺陷

常见问题

Claude Sonnet 5 是什么时候发布的?

Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5,作为 Sonnet 4.6 的继任者。发布当天即全面上线——claude.ai(成为 Free 与 Pro 用户的新默认模型)、Claude Code、Claude API,以及 Cursor、VS Code、GitHub Copilot 等第三方工具。

Claude Sonnet 5 的价格是多少?

首发价持续至 2026 年 8 月 31 日,为每 100 万 token 输入 $2、输出 $10。9 月 1 日起恢复标准价 $3 / $15——与 Sonnet 4.6 完全相同。缓存写入 $3.75 / 100 万,缓存读取 $0.30 / 100 万。

Claude Sonnet 5 比 Opus 4.8 更好吗?

取决于任务。Sonnet 5 在知识工作上小幅超过 Opus 4.8(GDPval-AA v2 1,618 vs 1,615),带工具推理也只差半分;但在最难的智能体编码基准 SWE-bench Pro 上落后约 6 分。对多数生产工作而言,质量差距已经小到由价格来决定选择。

Claude Sonnet 5 真的比 Opus 4.8 便宜吗?

按 token 计是的——但按任务计未必。Artificial Analysis 在标准价下实测 Sonnet 5 在其智能指数上的单任务成本为 $2.29,比 Opus 4.8 高约 15%,原因是 max effort 下 Sonnet 5 的输出 token 多约 40%、智能体轮次约为 3 倍。调低 effort 档位(或趁首发价)则结论反转。

Claude Sonnet 5 的新 tokenizer 是怎么回事?

Sonnet 5 采用更新后的 tokenizer(类似 Opus 4.7 引入的变化),相同文本会映射为约 1.0–1.35 倍的 token,代码与非英语文本靠上限。Anthropic 表示首发价的设定让从 Sonnet 4.6 迁移大致成本中性;在假设省钱之前,请先用真实工作负载重新校准。

Claude Sonnet 5 的 API 模型 ID 是什么?

在 Claude API 上使用 `claude-sonnet-5`。模型拥有 100 万 token 上下文窗口;自适应思考始终开启,API 与 Claude Code 中 effort 默认为 high。

来源

最后更新:2026-07-02 · 规格与价格变动很快——使用前请在厂商官网核实。