精选榜单

最佳编码 LLM 排名

基于基准数据与真实价格排出的最佳编码 LLM:Claude Fable 5 能力第一,Sonnet 5 性价比最高,GLM-5.2 领跑开源——以及真正决定选择的那些取舍。

最后更新:2026-07-29 · 排名变化很快——重要模型发布后我们会复核选择。

  1. 综合最佳

    Claude Fable 5 Anthropic

    你真正买得到的最强编码模型——SWE-bench Pro 80.3% 领先全场 11 分,low effort 的下限甚至高于 Opus 4.8 的上限。预算按 $10/$50 准备,并留意安全相关工作的分类器回落。

    价格
    $10 / $50(每 100 万 token,输入 / 输出)
    上下文窗口
    1M
    许可
    专有
    阅读 Claude Fable 5 完整评测 →
  2. 生产级智能体最佳

    Claude Opus 5 Anthropic

    全新旗舰,价格不变($5/$25)。SWE-bench Pro 79.2%(仅落后 Fable 5 一分),Frontier-Bench SOTA(43.3%),ARC-AGI-3 30.2%(4 倍于第二名)。接近 Fable 的能力,一半的价格。

    价格
    $5 / $25 per 1M tokens(输入 / 输出)
    上下文窗口
    1M
    许可
    Proprietary
    阅读 Claude Opus 5 完整评测 →
  3. 性价比最佳

    Claude Sonnet 5 Anthropic

    $2/$10 首发价买到接近 Opus 的智能体编码,Terminal-Bench 比前代跳升 13 分。注意 token 胃口:max effort + 标准价下,单任务成本可能反超 Opus。

    价格
    $2 / $10(首发价,至 8 月 31 日)· $3 / $15(标准价,每 100 万 token)
    上下文窗口
    1M
    许可
    专有
    阅读 Claude Sonnet 5 完整评测 →
  4. 终端 / CLI 智能体最佳

    GPT-5.6 OpenAI

    GPT-5.6 Sol 已 GA,$5/$30——Sol ultra 模式保持 Terminal-Bench 纪录(91.91%)。三层定价随意路由:Sol 攻坚,Terra($2.50/$15)日常,Luna($1/$6)速战。

    价格
    Sol $5/$30 · Terra $2.50/$15 · Luna $1/$6(每 100 万 token)
    许可
    专有
    阅读 GPT-5.6 完整评测 →
  5. 开源权重最佳

    GLM-5.2 Z.ai

    MIT 许可,SWE-bench Pro 62.1%——高于 GPT-5.5——外加稳定的 1M 上下文。API 约 $1.40/$4.40,编码订阅 $12.60/月起。开源阵营的基准领跑者。

    价格
    约 $1.40 / $4.40(每 100 万 token,输入 / 输出)
    上下文窗口
    1M
    许可
    MIT(开源权重)
    阅读 GLM-5.2 完整评测 →
  6. 预算智能体最佳

    Kimi K2.7 Code Moonshot AI

    为编码智能体调优的开源 1T MoE,约 $0.95/$4.00,推理比前代省约 30% token。目前数据为厂商自报,但单位能力的价格难有对手。

    价格
    约 $0.95 / $4.00(每 100 万 token,输入 / 输出)
    上下文窗口
    256K
    许可
    开源权重(Modified MIT)
    阅读 Kimi K2.7 Code 完整评测 →

「最强编码模型」和「最适合的编码模型」之间的距离,从来没有这么大过。截至 2026 年 7 月,榜首是一个 $10/$50、偶尔会出于安全原因把你的请求转给另一个模型处理的模型;而性价比之选只要五分之一的价格,就能补上大部分质量差距。该用哪个,几乎完全取决于你的编码工作长什么样。

这份榜单覆盖我们真正会推荐的 6 个模型、推荐理由,以及同样重要的——每一个的坑。

编辑配图:三颗带电路纹理的球体站在领奖台上,头顶桂冠,背景是淡淡的代码括号与终端窗口。

我们怎么选

三条规则,与本站所有内容一致:

  1. 有出处的基准。 我们更看重最难、防泄漏的智能体基准(SWE-bench Pro、Terminal-Bench 2.1、FrontierCode),弱化已饱和的基准(头部模型的 SWE-bench Verified 都在 90% 以上)。厂商自报数字会明确标注;有独立数据时(Artificial Analysis)以独立数据为准。
  2. 真实价格,尽量按任务算。 每 token 的标价会误导——推理模型在同一任务上花的 token 可以差好几倍。有单任务成本数据时,以它覆盖价目表。
  3. 只收公开可用的。 GPT-5.6(限量预览,约 20 家伙伴)与 Claude Mythos 5(受限)不入榜。它们开放时榜单会重排。

快速结论

你的情况选它
最难的长程工作,预算允许Claude Fable 5
错误答案代价高的生产级智能体Claude Opus 5
大批量日常编码Claude Sonnet 5
终端原生 / CLI 工作流GPT-5.6
自托管或开源权重要求GLM-5.2
预算最紧Kimi K2.7 Code

六个模型,并排看

我们权重最高的那个基准——SWE-bench Pro,最难的防泄漏智能体编码基准——所有公布过分数的入选模型:

智能体编码 — SWE-bench Pro (%)
Claude Fable 580.3%Claude Opus 579.2%Claude Sonnet 563.2%GLM-5.262.1%GPT-5.558.6%
闭源开源权重
一张图看全场:Fable 5 在顶端拉开 11 分,开源权重的 GLM-5.2 反超 GPT-5.5。Kimi K2.7 Code 只公布了 SWE-bench Verified(81.1%,厂商自报)而非 Pro,故不在图中。
来源:Anthropic system cards、Z.ai、OpenAI,2026 年 6–7 月。图表:Heyaiwiki。

完整决策矩阵——价格与上下文取自各模型页,基准取自厂商公布结果:

模型SWE-bench ProTerminal-Bench价格(输入/输出 每 1M)上下文许可
Fable 580.3%88.0%(2.1)$10 / $501M专有
Opus 579.2%$5 / $251M专有
Sonnet 563.2%80.4%(2.1)$2 / $10 尝鲜1M专有
GPT-5.6 Sol91.91%(2.1)$5 / $301.05M专有
GLM-5.262.1%~$1.40 / $4.401MMIT
Kimi K2.7 Code—(Verified 81.1%*)~$0.95 / $4.00256KModified MIT

*厂商自报。Terminal-Bench 版本不一(2.0 与 2.1)、测试框架各异——跨列对比看方向,别抠小数点。

逐个说理由

1. Claude Fable 5 — 能力天花板

Fable 5 在 SWE-bench Pro 上的 80.3% 不叫领先,叫断层——高出 Opus 4.8 11 分、GPT-5.5 22 分。最扎眼的数据是「effort 倒挂」:low effort 下得 75.0,高于 Opus 4.8 在 max effort 下的 68.6。Stripe 的早期报告——5000 万行 Ruby 代码库迁移,从两个团队月压缩到一天——就是它解锁的东西的形状。

两个坑让它成不了万能答案。价格 $10/$50,是 Opus 的两倍。安全分类器会把网络安全相关请求回落到 Opus 4.8——超过 95% 的会话碰不到,但 Terminal-Bench 试验里 20.9% 碰到了。做安全工程,这就是实打实的税。(它 6 月还因美国出口管制下线了 18 天——完整报道——监管可用性如今是真实变量。)

**强项:**SWE-bench Pro 两位数断层;low effort 就能打赢对手的 max;为数天级异步任务而生。 注意:$10/$50 的价格;安全工程会碰到分类器回落(Terminal-Bench 试验 20.9%);6 月出口管制事件让监管风险不再是零。

2. Claude Opus 5 — 新旗舰

Opus 5 在保持 $5/$25 不变的前提下逼近 Fable:SWE-bench Pro 79.2%(仅落后 1 分),Frontier-Bench 43.3% SOTA,ARC-AGI-3 30.2%(4 倍于第二名)。默认开启思考模式,OSWorld 2.0 70.6% 超越 Fable 5。当错误答案代价高昂又预算有限时,它已经取代 Opus 4.8 成为首选。

**强项:**接近 Fable 的能力、一半的价格;Frontier-Bench 与 ARC-AGI-3 全面领先;默认 thinking。 **注意:**幻觉校准略逊于 Opus 4.8;刚发布一周,生产环境实战报告还在积累。

3. Claude Sonnet 5 — 性价比之选

Sonnet 5 补上了大部分差距:SWE-bench Pro 63.2%(高于 GPT-5.5),Terminal-Bench 80.4% 比前代跳升 13 分,知识工作与 Opus 打平——首发价 $2/$10(至 8 月 31 日)。坑在 Artificial Analysis 的数据里:max effort 下它的输出 token 多约 40%、智能体轮次约 3 倍,所以标准价下单任务成本可能反超 Opus 4.8。给主力流量配 medium effort 跑,它就是这份榜单上单位能力价格最好的模型。

**强项:**8 月底前最便宜的前沿选项;SWE-bench Pro 反超 GPT-5.5;1M 上下文。 **注意:**token 胃口大,标准价下单任务成本可能反超 Opus;新分词器把相同文本数成 1.0–1.35 倍 token——迁移前先重新基线。

4. GPT-5.6 — 终端新王

GPT-5.6 已经 GA,三层定价全面上线:Sol($5/$30)保持 Terminal-Bench 2.1 纪录 91.91%,Terra($2.50/$15)日常与 GPT-5.5 同等水平,Luna($1/$6)适合速战速决。1.05M 上下文,原生全模态(音频+视频输入)。按难度分路由,让 OpenAI 从「一个贵模型」变成三个阶梯。

**强项:**Terminal-Bench 绝对领跑;三层定价按任务路由;1.05M 上下文;原生全模态。 **注意:**Sol 输出 $30/1M 仍然昂贵;SWE-bench Pro 数据暂缺;Luna 在复杂任务上与前沿差距明显。

5. GLM-5.2 — 开源领跑者

GLM-5.2 是基准上最强的开源编码模型:SWE-bench Pro 62.1%,高于 GPT-5.5,外加纯 MIT 许可、无地区限制的稳定 1M 上下文。API 价格(约 $1.40/$4.40)低于榜单上所有闭源选择,编码订阅 $12.60/月起。持有成本是字面意义上的:753B 参数的 MoE,自托管实际需要多卡节点。

**强项:**开源阵营基准领跑;MIT 许可无附加条件;稳定 1M 上下文;API 价约为前沿十分之一。 **注意:**自托管 753B MoE 是多卡级投入;无公开 Terminal-Bench 分数;工具生态比 OpenAI/Anthropic 年轻。

6. Kimi K2.7 Code — 预算智能体

Kimi K2.7 Code 是专为编码智能体调优的 1T 参数开源 MoE(Modified MIT),原生图像/视频输入,推理比前代省约 30% token——直接降低智能体循环的成本,价格约 $0.95/$4.00。诚实的注脚:它的基准故事目前是厂商自报。作为大批量智能体流量的廉价可用默认,这个席位它配得上。

**强项:**全场每 token 最便宜;思考省 30% 进一步压低智能体循环账单;原生图像/视频输入支撑截图改码。 **注意:**基准为厂商自报(SWE-bench Verified 81.1%,无 Pro 分数);256K 上下文全场最小;Modified MIT 有附加条款——先读再用。

落选但值得一提

  • Sakana Fugu — SWE-bench Pro 86.0,高于榜单上所有单一模型——但它是跨模型池路由的编排系统,不是模型。接受这种架构的话,值得一看。
  • DeepSeek V4-ProMiniMax M3 — 强力开源选项,最难编码基准上紧跟 GLM-5.2;完整格局见 2026 LLM 全景指南
  • Kimi K3 — 世界首个开放权重 3T 级模型(2.8T MoE,104B 激活),但自定义许可且需 64+ GPU,实用性受限。
  • Inkling — 975B MoE,Apache 2.0,Mira Murati 新公司出品;定位微调基座而非前沿竞争者。

关于时效的说明:本榜单反映截至 2026 年 7 月 29 日的基准与价格。

更新记录

  • 2026-07-29 — 7 月更新:Opus 5 替换 Opus 4.8;GPT-5.6 GA 替换 GPT-5.5;新增 Kimi K3 与 Inkling 到落选提及。
  • 2026-07-02 — 首次发布:Fable 5 · Opus 4.8 · Sonnet 5 · GPT-5.5 · GLM-5.2 · Kimi K2.7 Code。反映 Sonnet 5 6 月 30 日发布与 Fable 5 7 月 1 日恢复可用。

常见问题

现在最好的编码 LLM 是哪个?

论纯能力是 Claude Fable 5——截至 2026 年 7 月,其 SWE-bench Pro 80.3% 以两位数优势领先所有对手。日常工作则是 Claude Sonnet 5,以 $2/$10 的首发价提供接近 Opus 的编码能力。所以我们把 Fable 排综合最佳、Sonnet 排性价比最佳。

最好的免费或开源编码 LLM 是哪个?

GLM-5.2 以纯 MIT 许可领跑开源编码基准(SWE-bench Pro 62.1%,高于 GPT-5.5 的 58.6%)。预算优先则选 Kimi K2.7 Code,约 $0.95/$4.00 每 100 万 token。两者都开放权重可自托管,但都是大型 MoE,实际需要多卡节点。

写代码 Claude 比 GPT 强吗?

在仓库级基准上是的——截至 2026 年 7 月,Claude Fable 5、Opus 4.8、Sonnet 5 的 SWE-bench Pro 都高于 GPT-5.5。GPT-5.5 保有一项明确优势:自家 Codex CLI 环境下的终端/CLI 智能体(83.4%),而且它接受音频与视频输入,这是 Claude 系都做不到的。

哪个编码 LLM 运行成本最低?

入选模型中按 token 计最便宜的是 Kimi K2.7 Code(约 $0.95/$4.00),其次是 GLM-5.2(约 $1.40/$4.40,或 $12.60/月的编码订阅)。闭源阵营里 Claude Sonnet 5 的 $2/$10 首发价(至 2026 年 8 月 31 日)标价最低——但请按任务重新核算,因为高 effort 下 Sonnet 5 每个任务花的 token 更多。

这份榜单多久更新一次?

重要模型发布或价格变动时我们会复核。本榜单反映截至 2026 年 7 月 2 日的基准与价格——在 Claude Sonnet 5 发布(6 月 30 日)与 Claude Fable 5 回归(7 月 1 日)之后、GPT-5.6 走出限量预览之前。

来源

← 全部榜单