单是 2026 年第一季度就有约 255 次模型发布——大约每天三次。截至 2026 年 6 月,前沿已经碎片化:没有单一最佳模型,只有针对你任务的最佳模型。本指南按基准、价格、上下文窗口与许可,逐一比较每个主流家族——并力求成为你可以引用的来源。
怎么读这份指南: 所有数字都是 2026 年 6 月的快照。厂商自报数字以
*标注;其余均来自官方文档或独立追踪器(见来源)。价格按每 100 万 token(输入 / 输出)。
关键要点
- 没有模型样样第一。 Claude Opus 4.8 领跑整体智能与智能体编码;GPT-5.5 领跑终端/CLI 智能体;Gemini 3.1 Pro 领跑性价比 + 多模态推理。
- 顶端很紧凑。 在 Artificial Analysis(AA)Intelligence Index 上:Opus 4.8(61.4)→ GPT-5.5(60.2)→ Gemini 3.1 Pro(57)→ Grok 4.3(53)——相差约 8 分以内。
- 开源权重已追上。 DeepSeek V4-Pro 与 MiniMax M3(AA 指数 ~44)以 5–12× 更低的价格拿出接近前沿的编码分数。
- 上下文爆发。 Llama 4 Scout 以 10M token 保持公开发布中最大的窗口;1M 现已成为默认。
本文如何编制
我们追踪了截至 2026 年 6 月 17 日每个实验室在售的旗舰,然后对照官方模型卡 / 定价页与独立追踪器(Artificial Analysis Intelligence Index v4.1、LLM-Stats)逐一核对规格。当来源相互矛盾时——在这个市场很常见——我们给出区间并同时引用两者。请把每个数字都当作有时效的快照,而非永久事实。
主对比表
闭源 / 专有前沿
| 家族 | 模型 | 发布 | 上下文 | 价格(输入/输出) | AA 指数 | 擅长 |
|---|---|---|---|---|---|---|
| Claude | Opus 4.8 | 2026-05-28 | 1M | $5 / $25 | 61.4 | 整体 + 智能体编码 |
| Claude | Fable 5(Mythos) | 2026-06-09 | 1M | $10 / $50 | — | 顶级编码(SWE-Pro 80.3%*)——可用性受限 |
| GPT | GPT-5.5 | 2026-04-23 | 400K–1M | $5 / $30 | 60.2 | 终端/CLI 智能体、全模态 |
| Gemini | 3.1 Pro | 2026-02 | 1M | $2 / $4–12 | 57 | 性价比 + 多模态推理 |
| Gemini | 3.5 Flash | 2026-05-19 | 1M | $1.50 / $9 | — | 快速、便宜的智能体 |
| Gemini | 3.5 Pro | 2026-06(陆续推出) | 最高 2M | ~$15 / $60* | — | Deep Think(6 月中尚未 GA) |
| Grok | 4.3 | 2026-04-30 | 1M | $1.25 / $2.50 | 53 | 预算前沿、工具调用 |
| Qwen | 3.7-Max | 2026-05-19 | 1M | $2.50 / $7.50 | ~(第 7) | 知识 + 长跨度智能体 |
| (Meta) | Muse Spark | 2026-04-08 | — | 暂无 | 52 | Meta 首个闭源推理模型 |
开源权重 / 开源
| 家族 | 模型 | 发布 | 上下文 | 价格(输入/输出) | 许可 | 擅长 |
|---|---|---|---|---|---|---|
| DeepSeek | V4-Pro | 2026-04-24 | 1M | ~$1.74 / $3.48 | MIT | 性价比冠军,SWE-V ~85% |
| DeepSeek | V4-Flash | 2026-04-24 | 1M | $0.14 / $0.28 | MIT | 最便宜的可信编码模型 |
| Llama | 4 Scout | 2025-04 | 10M | 自托管 | Llama Community | 最长上下文、RAG |
| Llama | 4 Maverick | 2025-04 | 1M | 自托管 | Llama Community | 多模态通才 |
| Qwen | 3.6-27B | 2026-04-22 | 262K→1M | 自托管 | Apache 2.0 | 小而强的编码模型 |
| Kimi | K2.7 Code | 2026-06-12 | 256K | $0.95 / — | Modified MIT | MCP 工具使用(81.1%) |
| GLM | 5.2 | 2026-06-13 | 1M | $1.40 / $4.40 | MIT(待定) | 1M 上下文开源旗舰 |
| MiniMax | M3 | 2026-06-01 | 1M | $0.30 / $1.20 | 开源 | 开源 AA 指数最高(44) |
| Nemotron | 3 Ultra | 2026-06-04 | — | 自托管 | 完全宽松 | 宽松许可的巨型模型 |
| Mistral | Large 3 | 2025-12-02 | 256K | $0.50 / $1.50 | Apache 2.0 | 最佳宽松许可的西方 MoE |
智能:前沿是一个集群
想要静态版本?下载图表:AA Intelligence Index(PNG)。
上下文窗口:1M 成为新默认
静态版本:上下文窗口(PNG)。
价格:开源权重重置了地板
静态版本:输出价格(PNG)。
按家族
OpenAI — GPT
GPT-5.5(2026 年 4 月 23 日)把 o 系列 + Codex 统一为一个旗舰。它领跑终端原生智能体(Terminal-Bench 2.0 ≈ 82.7%),原生全模态,并提供 Instant 默认款加更高精度的 Pro。定价 $5/$30;上下文 400K(Codex)至 1M(API)。血统:GPT-5(2025 年 8 月)→ 5.1 → 5.2 → 5.4 → 5.5。
Anthropic — Claude
Opus 4.8(2026 年 5 月 28 日)是 6 月的整体领跑者(AA 61.4):顶级智能体编码(SWE-V 88.6%)、计算机使用(OSWorld 83.4%)、知识工作(GDPval-AA 1,890)、最佳幻觉校准,外加 Fast Mode。档位:Opus 4.8($5/$25)· Sonnet 4.6($3/$15)· Haiku 4.5($1/$5)。Mythos 级的 Fable 5(6 月 9 日)立下编码天花板(SWE-Pro 80.3%*),但其可用性目前受限。
Google — Gemini
Gemini 3.1 Pro(2026 年 2 月,AA 57)是性价比 + 多模态领跑者(约 $2 输入,1M 上下文,GPQA ≈ 94.3%)。3.5 Flash(5 月 19 日 GA)是迄今最快/最便宜的档位($1.50/$9,约快 4×)。3.5 Pro(Deep Think,最高 2M 上下文)于 6 月陆续推出。
xAI — Grok
Grok 4.3(2026 年 4 月 30 日,AA 53):预算前沿——1M 上下文、函数调用、结构化输出、$1.25/$2.50。最强功能锁在 $300/月 的 SuperGrok Heavy 档位之后。
Meta — Llama + Muse
Llama 4 Scout(10M 上下文)与 Maverick(1M 上下文)是 MoE、原生多模态、对单机友好。Behemoth(约 2T)已搁置。Muse 家族现有三个模型:Muse Spark 1.2(8 月 5 日,编码旗舰,AA 54,$1.25/$4.25)、Muse Glimmer(8 月 10 日,30B Apache 2.0 本地智能体)和原始 Muse Spark(4 月 8 日,AA 52)。Llama 5 推迟到接近 2027。
DeepSeek(开源权重,MIT)
V4(2026 年 4 月 24 日)把 1M 上下文做到便宜。V4-Pro(1.6T/49B 激活)取得约 85% SWE-V;V4-Flash 是最便宜的可信编码模型($0.14/$0.28)。R2 尚未发布——把 R2 规格当作传闻看待。
Alibaba — Qwen
Qwen3.7-Max(5 月 19 日)是专有、仅 API(1M 上下文,$2.50/$7.50):在其同侪中拥有最高知识得分的“Agent Frontier”。开源权重在更低层级延续:Qwen3.6-27B / 35B-A3B(Apache 2.0)。
中国开源浪潮
- Kimi K2.7 Code(6 月 12 日):1T MoE,256K 上下文,领跑 MCP 工具使用(81.1%)。
- GLM-5.2(6 月 13 日):1M 上下文(开源中最大),MIT 待定,约 $1.40/$4.40。
- MiniMax M3(6 月 1 日):1M 上下文,原生图像/视频,$0.30/$1.20,开源 AA 指数最高。
NVIDIA — Nemotron
Nemotron 3 Ultra(6 月 4 日):550B,是完全宽松许可下最强的开源模型(无门槛)。Nemotron 3.5 Lightning(8 月 11 日):面向长时程智能体工作负载的最高效率模型,搭载 NeMo Switchyard 多模型路由库。
Mistral — 欧洲的开源标准
Mistral Large 3(2025 年 12 月 2 日):41B 激活 / 675B 总 MoE,256K 上下文,原生视觉,Apache 2.0($0.50/$1.50),与面向边缘的 Ministral 3 一同发布。
常见问题
2026 年 6 月最好的 LLM 是哪个? 没有单一赢家。Claude Opus 4.8 领跑整体智能与智能体编码;GPT-5.5 领跑终端/CLI 智能体;Gemini 3.1 Pro 领跑性价比与多模态推理;DeepSeek V4-Pro 在开源权重中领跑每分基准的性价比。
最好的开源 LLM 是哪个? MiniMax M3 与 DeepSeek V4-Pro 在开源权重的 AA 指数顶端打平(~44)。Kimi K2.7 Code 领跑 MCP 工具使用;Llama 4 Scout 领跑上下文长度(10M);NVIDIA Nemotron 3 Ultra 领跑宽松许可。
哪个模型的上下文窗口最大? Llama 4 Scout,10M token——截至 2026 年 6 月,是任何公开发布的 LLM 中最大的。
最便宜的有能力的模型是哪个? DeepSeek V4-Flash,$0.14 / $0.28 每 100 万 token,经核实的 SWE-bench Verified 分数约 79%。
2026 年 7 月更新
7 月格局变化很快。以下是自 6 月初始快照以来的变化:
新前沿模型
| 模型 | 发布日 | 关键变化 |
|---|---|---|
| Claude Opus 5 | 2026-07-24 | 新 AA Intelligence Index 第一名(61)。Frontier-Bench SOTA(43.3%),ARC-AGI-3 30.2%(4 倍于第二名)。定价不变 $5/$25。 |
| GPT-5.6 Sol/Terra/Luna | 2026-07-09(GA) | 三层家族全面上线。Sol $5/$30,Terra $2.50/$15,Luna $1/$6。1.05M 上下文。 |
| Grok 4.5 | 2026-07-08 | xAI 编码旗舰,$2/$6。500K 上下文,与 Cursor 联合训练。 |
| Gemini 3.6 Flash | 2026-07-21 | 比 3.5 Flash 少 17% 输出 token,更低价格($1.50/$7.50)。取代 3.5 Flash 成为工作马。 |
新开源权重模型
| 模型 | 发布日 | 关键变化 |
|---|---|---|
| Kimi K3 | 2026-07-16(API)/ 07-27(权重) | 全球首个开放 3T 级模型。2.8T MoE,104B 激活,1M 上下文。自定义许可(非 MIT)。 |
| Inkling | 2026-07-15 | Thinking Machines Lab(Mira Murati)。975B/41B MoE,Apache 2.0,多模态。定位微调基座,非前沿竞争者。 |
更新要点
- Claude Opus 5 成为新的整体领先者,以同等价格取代 Opus 4.8。在 SWE-bench Pro 上与 Fable 5 的差距缩小到 ~1 分(79.2% vs 80.3%)。
- GPT-5.6 分层定价上线。 Terra 以 GPT-5.5 一半的价格达到同等质量;Luna 是最便宜的 GPT-5.x,$1/$6。
- 开源权重上限跃升至 2.8T(Kimi K3),但自定义许可和 64+ GPU 要求限制了实际采用。Inkling 提供美国来源的 Apache 2.0 替代方案(975B)。
- Gemini 3.5 Pro 仍然缺席。 Google 改发了 3.6 Flash。Gemini 4 的预训练已开始。
2026 年 8 月更新
8 月初迎来中国模型攻势和视频生成井喷;8 月 5–11 日一周又新增 Meta 开源转向、NVIDIA 智能体布局和 GPT-5.6 重大更新:
新前沿模型
| 模型 | 发布日期 | 关键变化 |
|---|---|---|
| Qwen3.8-Max | 2026-08-03 | 阿里 2.4T 稀疏 MoE(95B 激活)。OSWorld-Verified 86.1(超 Fable 5)、PaperBench 93.0(最高分)。$2/$6——Opus 5 的三分之一。开放权重 8 月 12 日到来。 |
| Muse Spark 1.2 | 2026-08-05 | Meta 编码旗舰,与 Muse Code 终端智能体联合训练。TB 2.1 82.9%,AA Intelligence Index 54。标准 $1.25/$4.25;贡献者层 $0.10/$0.20(最便宜的前沿推理,需共享提示用于训练)。1M 上下文。 |
新开源权重模型
| 模型 | 发布日期 | 关键变化 |
|---|---|---|
| Muse Glimmer | 2026-08-10 | Meta 首个 Apache 2.0 模型——30B 密集多模态智能体。量化后可在 24GB 显存(单张消费级 GPU)上运行。DFlash 推测解码随权重发布(RTX 5090 上 3.1 倍加速)。面向本地智能体部署。 |
| Nemotron 3.5 Lightning | 2026-08-11 | NVIDIA 面向长时程智能体工作负载的最高效率模型。搭载 NeMo Switchyard——开源多模型路由库。首日即可通过 NIM、HuggingFace、OpenRouter 获取。 |
GPT-5.6 8 月中更新
GPT-5.6 收到三项重大变更:
- Sol — 改进推理滑块,可细粒度分配计算量;现支持自然语言「多想/少想」。
- Luna — 升级为所有 ChatGPT 用户的免费默认模型(无限文本,每日 25 次图像生成);新增「思考」按钮用于按需扩展推理。
- GPT-5.6-Cyber — 新安全强化变体,在对抗数据集上微调;提示注入基准检测率 95%。通过 API 可用,Sol 定价。
跨模态扩展
LLM 格局正日益与视频和多模态模型交织:
| 模型 | 发布日期 | 关键变化 |
|---|---|---|
| MiniMax H3 | 2026-07-31 | 33B 全模态视频模型带原生音频——首个主流开放权重视频模型。将 MiniMax 版图扩展到 M3 LLM 之外。 |
| FLUX 3 Video | 2026-08-04(GA) | BFL 统一模型正式 GA 并公布定价($0.06–0.53/秒)。视频生成成为商品化 API。 |
| Grok Imagine Video 1.5 | 2026-07-31 更新 | xAI 新增文生视频、原生 1080p 和引用功能。$0.08/秒 API。 |
| Grok Imagine Image 2.0 | 2026-08-07 | xAI 编辑优先图像模型——文生图与编辑竞技场双榜 #2。魔术棒、多参考合成、模板。 |
| Wan 3.0 | 2026-08-06 | 阿里 30 秒视频模型,支持文档/网页输入。$0.05–0.20/秒。闭源权重,Wan 2.7 的继任者。 |
| MAGI-2 Preview | 2026-08-05 | Sand.ai 114B MoE,Apache 2.0,10 秒带原生音频。AA 视频竞技场 #6。 |
| SeedRealtime | 2026-08-05 | 字节跳动音视频全双工 LLM。部署于豆包 App——实时看+听+说。 |
更新要点
- Meta 转向开源。 Muse Glimmer(Apache 2.0)是 Meta 首个完全宽松许可模型——继 Llama 限制性社区许可后的战略转向。Muse Spark 1.2(已宣布开放权重)将随后。贡献者层($0.10/$0.20 前沿推理换取训练数据)是一种值得关注的新定价模式。
- Qwen 3.8-Max 开放权重 8 月 12 日到达。 ModelScope 显示倒计时。加上 Kimi K3(2.8T,7 月),开放权重前沿正在冲刺。27B 变体(Qwen3.8-27B)紧随其后。
- 本地智能体模型成为新品类。 Muse Glimmer(30B,24GB 显存)和 Nemotron 3.5 Lightning(NeMo Switchyard 路由)都瞄准在本地或企业硬件上持续运行的智能体——三个月前这个品类还不存在。
- GPT-5.6 横向拓宽而非纵向拔高。 OpenAI 在横向扩展(Luna 全民免费、Cyber 安全变体),而非推新版本号。Sol 的推理滑块和 Luna 的思考按钮,以截然不同于对手的方式回答了「分配多少计算」这个问题。
- 视频输入成为新前沿。 Wan 3.0 的文档转视频和 MAGI-2 的宽松许可视频生成,加上 FLUX 3 和 MiniMax H3——一周内四个新视频模型,超越文生图成为最热模态。
- 前沿定价阶梯更清晰: Fable 5($10/$50)最强能力 → Opus 5($5/$25)近 Fable 半价 → Qwen 3.8-Max($2/$6)预算友好的智能体工作 → Muse Spark 1.2($1.25/$4.25)编码性价比 → Sonnet 5($2/$10)日常主力。
来源
- Anthropic — Claude models overview
- OpenAI — Introducing GPT-5.5
- Google — Gemini 3.5
- xAI — Grok 4.3 docs
- Meta — Llama 4 herd
- DeepSeek — V4 release notes
- Alibaba Cloud — Qwen3.7: The Agent Frontier
- Mistral AI — Introducing Mistral 3
- Artificial Analysis — Intelligence Index
- Build Fast with AI — Best AI Models June 2026
- Alibaba Cloud — Qwen3.8-Max: A New Bar for Coding and Cowork
更新日志:2026-08-11 — 8 月更新 2:添加 Muse Spark 1.2、Muse Glimmer、Nemotron 3.5 Lightning;GPT-5.6 Sol/Luna/Cyber 8 月中更新;Qwen 3.8-Max 开放权重倒计时;Grok Imagine Image 2.0、Wan 3.0、MAGI-2 加入跨模态扩展;更新 Meta 和 Nemotron 家族章节。2026-08-05 — 添加 8 月更新章节(Qwen 3.8-Max、跨模态扩展:MiniMax H3、FLUX 3 Video GA、Grok Imagine Video 1.5、SeedRealtime)。2026-07-29 — 添加 7 月更新章节(Opus 5、GPT-5.6 GA、Gemini 3.6 Flash、Kimi K3、Inkling)。2026-06-17 — 首次发布。
最后更新:2026-08-11