「最强编码模型」和「最适合你的编码模型」之间的距离,从来没有这么大过。截至 2026 年 7 月,榜首是一个 $10/$50、偶尔会出于安全原因把你的请求转给另一个模型处理的模型;而性价比之选只要五分之一的价格,就能补上大部分质量差距。该用哪个,几乎完全取决于你的编码工作长什么样。
这份榜单覆盖我们真正会推荐的 6 个模型、推荐理由,以及同样重要的——每一个的坑。

我们怎么选
三条规则,与本站所有内容一致:
- 有出处的基准。 我们更看重最难、防泄漏的智能体基准(SWE-bench Pro、Terminal-Bench 2.1、FrontierCode),弱化已饱和的基准(头部模型的 SWE-bench Verified 都在 90% 以上)。厂商自报数字会明确标注;有独立数据时(Artificial Analysis)以独立数据为准。
- 真实价格,尽量按任务算。 每 token 的标价会误导——推理模型在同一任务上花的 token 可以差好几倍。有单任务成本数据时,以它覆盖价目表。
- 只收公开可用的。 GPT-5.6(限量预览,约 20 家伙伴)与 Claude Mythos 5(受限)不入榜。它们开放时榜单会重排。
快速结论
| 你的情况 | 选它 |
|---|---|
| 最难的长程工作,预算允许 | Claude Fable 5 |
| 错误答案代价高的生产级智能体 | Claude Opus 5 |
| 大批量日常编码 | Claude Sonnet 5 |
| 终端原生 / CLI 工作流 | GPT-5.6 |
| 自托管或开源权重要求 | GLM-5.2 |
| 预算最紧 | Kimi K2.7 Code |
六个模型,并排看
我们权重最高的那个基准——SWE-bench Pro,最难的防泄漏智能体编码基准——所有公布过分数的入选模型:
完整决策矩阵——价格与上下文取自各模型页,基准取自厂商公布结果:
| 模型 | SWE-bench Pro | Terminal-Bench | 价格(输入/输出 每 1M) | 上下文 | 许可 |
|---|---|---|---|---|---|
| Fable 5 | 80.3% | 88.0%(2.1) | $10 / $50 | 1M | 专有 |
| Opus 5 | 79.2% | — | $5 / $25 | 1M | 专有 |
| Sonnet 5 | 63.2% | 80.4%(2.1) | $2 / $10 尝鲜 | 1M | 专有 |
| GPT-5.6 Sol | — | 91.91%(2.1) | $5 / $30 | 1.05M | 专有 |
| GLM-5.2 | 62.1% | — | ~$1.40 / $4.40 | 1M | MIT |
| Kimi K2.7 Code | —(Verified 81.1%*) | — | ~$0.95 / $4.00 | 256K | Modified MIT |
*厂商自报。Terminal-Bench 版本不一(2.0 与 2.1)、测试框架各异——跨列对比看方向,别抠小数点。
逐个说理由
1. Claude Fable 5 — 能力天花板
Fable 5 在 SWE-bench Pro 上的 80.3% 不叫领先,叫断层——高出 Opus 4.8 11 分、GPT-5.5 22 分。最扎眼的数据是「effort 倒挂」:low effort 下得 75.0,高于 Opus 4.8 在 max effort 下的 68.6。Stripe 的早期报告——5000 万行 Ruby 代码库迁移,从两个团队月压缩到一天——就是它解锁的东西的形状。
两个坑让它成不了万能答案。价格 $10/$50,是 Opus 的两倍。安全分类器会把网络安全相关请求回落到 Opus 4.8——超过 95% 的会话碰不到,但 Terminal-Bench 试验里 20.9% 碰到了。做安全工程,这就是实打实的税。(它 6 月还因美国出口管制下线了 18 天——完整报道——监管可用性如今是真实变量。)
**强项:**SWE-bench Pro 两位数断层;low effort 就能打赢对手的 max;为数天级异步任务而生。 注意:$10/$50 的价格;安全工程会碰到分类器回落(Terminal-Bench 试验 20.9%);6 月出口管制事件让监管风险不再是零。
2. Claude Opus 5 — 新旗舰
Opus 5 在保持 $5/$25 不变的前提下逼近 Fable:SWE-bench Pro 79.2%(仅落后 1 分),Frontier-Bench 43.3% SOTA,ARC-AGI-3 30.2%(4 倍于第二名)。默认开启思考模式,OSWorld 2.0 70.6% 超越 Fable 5。当错误答案代价高昂又预算有限时,它已经取代 Opus 4.8 成为首选。
**强项:**接近 Fable 的能力、一半的价格;Frontier-Bench 与 ARC-AGI-3 全面领先;默认 thinking。 **注意:**幻觉校准略逊于 Opus 4.8;刚发布一周,生产环境实战报告还在积累。
3. Claude Sonnet 5 — 性价比之选
Sonnet 5 补上了大部分差距:SWE-bench Pro 63.2%(高于 GPT-5.5),Terminal-Bench 80.4% 比前代跳升 13 分,知识工作与 Opus 打平——首发价 $2/$10(至 8 月 31 日)。坑在 Artificial Analysis 的数据里:max effort 下它的输出 token 多约 40%、智能体轮次约 3 倍,所以标准价下单任务成本可能反超 Opus 4.8。给主力流量配 medium effort 跑,它就是这份榜单上单位能力价格最好的模型。
**强项:**8 月底前最便宜的前沿选项;SWE-bench Pro 反超 GPT-5.5;1M 上下文。 **注意:**token 胃口大,标准价下单任务成本可能反超 Opus;新分词器把相同文本数成 1.0–1.35 倍 token——迁移前先重新基线。
4. GPT-5.6 — 终端新王
GPT-5.6 已经 GA,三层定价全面上线:Sol($5/$30)保持 Terminal-Bench 2.1 纪录 91.91%,Terra($2.50/$15)日常与 GPT-5.5 同等水平,Luna($1/$6)适合速战速决。1.05M 上下文,原生全模态(音频+视频输入)。按难度分路由,让 OpenAI 从「一个贵模型」变成三个阶梯。
**强项:**Terminal-Bench 绝对领跑;三层定价按任务路由;1.05M 上下文;原生全模态。 **注意:**Sol 输出 $30/1M 仍然昂贵;SWE-bench Pro 数据暂缺;Luna 在复杂任务上与前沿差距明显。
5. GLM-5.2 — 开源领跑者
GLM-5.2 是基准上最强的开源编码模型:SWE-bench Pro 62.1%,高于 GPT-5.5,外加纯 MIT 许可、无地区限制的稳定 1M 上下文。API 价格(约 $1.40/$4.40)低于榜单上所有闭源选择,编码订阅 $12.60/月起。持有成本是字面意义上的:753B 参数的 MoE,自托管实际需要多卡节点。
**强项:**开源阵营基准领跑;MIT 许可无附加条件;稳定 1M 上下文;API 价约为前沿十分之一。 **注意:**自托管 753B MoE 是多卡级投入;无公开 Terminal-Bench 分数;工具生态比 OpenAI/Anthropic 年轻。
6. Kimi K2.7 Code — 预算智能体
Kimi K2.7 Code 是专为编码智能体调优的 1T 参数开源 MoE(Modified MIT),原生图像/视频输入,推理比前代省约 30% token——直接降低智能体循环的成本,价格约 $0.95/$4.00。诚实的注脚:它的基准故事目前是厂商自报。作为大批量智能体流量的廉价可用默认,这个席位它配得上。
**强项:**全场每 token 最便宜;思考省 30% 进一步压低智能体循环账单;原生图像/视频输入支撑截图改码。 **注意:**基准为厂商自报(SWE-bench Verified 81.1%,无 Pro 分数);256K 上下文全场最小;Modified MIT 有附加条款——先读再用。
落选但值得一提
- Sakana Fugu — SWE-bench Pro 86.0,高于榜单上所有单一模型——但它是跨模型池路由的编排系统,不是模型。接受这种架构的话,值得一看。
- DeepSeek V4-Pro、MiniMax M3 — 强力开源选项,最难编码基准上紧跟 GLM-5.2;完整格局见 2026 LLM 全景指南。
- Kimi K3 — 世界首个开放权重 3T 级模型(2.8T MoE,104B 激活),但自定义许可且需 64+ GPU,实用性受限。
- Inkling — 975B MoE,Apache 2.0,Mira Murati 新公司出品;定位微调基座而非前沿竞争者。
关于时效的说明:本榜单反映截至 2026 年 7 月 29 日的基准与价格。
更新记录
- 2026-07-29 — 7 月更新:Opus 5 替换 Opus 4.8;GPT-5.6 GA 替换 GPT-5.5;新增 Kimi K3 与 Inkling 到落选提及。
- 2026-07-02 — 首次发布:Fable 5 · Opus 4.8 · Sonnet 5 · GPT-5.5 · GLM-5.2 · Kimi K2.7 Code。反映 Sonnet 5 6 月 30 日发布与 Fable 5 7 月 1 日恢复可用。
常见问题
现在最好的编码 LLM 是哪个?
论纯能力是 Claude Fable 5——截至 2026 年 7 月,其 SWE-bench Pro 80.3% 以两位数优势领先所有对手。日常工作则是 Claude Sonnet 5,以 $2/$10 的首发价提供接近 Opus 的编码能力。所以我们把 Fable 排综合最佳、Sonnet 排性价比最佳。
最好的免费或开源编码 LLM 是哪个?
GLM-5.2 以纯 MIT 许可领跑开源编码基准(SWE-bench Pro 62.1%,高于 GPT-5.5 的 58.6%)。预算优先则选 Kimi K2.7 Code,约 $0.95/$4.00 每 100 万 token。两者都开放权重可自托管,但都是大型 MoE,实际需要多卡节点。
写代码 Claude 比 GPT 强吗?
在仓库级基准上是的——截至 2026 年 7 月,Claude Fable 5、Opus 4.8、Sonnet 5 的 SWE-bench Pro 都高于 GPT-5.5。GPT-5.5 保有一项明确优势:自家 Codex CLI 环境下的终端/CLI 智能体(83.4%),而且它接受音频与视频输入,这是 Claude 系都做不到的。
哪个编码 LLM 运行成本最低?
入选模型中按 token 计最便宜的是 Kimi K2.7 Code(约 $0.95/$4.00),其次是 GLM-5.2(约 $1.40/$4.40,或 $12.60/月的编码订阅)。闭源阵营里 Claude Sonnet 5 的 $2/$10 首发价(至 2026 年 8 月 31 日)标价最低——但请按任务重新核算,因为高 effort 下 Sonnet 5 每个任务花的 token 更多。
这份榜单多久更新一次?
重要模型发布或价格变动时我们会复核。本榜单反映截至 2026 年 7 月 2 日的基准与价格——在 Claude Sonnet 5 发布(6 月 30 日)与 Claude Fable 5 回归(7 月 1 日)之后、GPT-5.6 走出限量预览之前。