单是 2026 年第一季度就有约 255 次模型发布——大约每天三次。截至 2026 年 6 月,前沿已经碎片化:没有单一最佳模型,只有针对你任务的最佳模型。本指南按基准、价格、上下文窗口与许可,逐一比较每个主流家族——并力求成为你可以引用的来源。

怎么读这份指南: 所有数字都是 2026 年 6 月的快照。厂商自报数字以 * 标注;其余均来自官方文档或独立追踪器(见来源)。价格按每 100 万 token(输入 / 输出)。

关键要点

  • 没有模型样样第一。 Claude Opus 4.8 领跑整体智能与智能体编码;GPT-5.5 领跑终端/CLI 智能体;Gemini 3.1 Pro 领跑性价比 + 多模态推理。
  • 顶端很紧凑。 在 Artificial Analysis(AA)Intelligence Index 上:Opus 4.8(61.4)→ GPT-5.5(60.2)→ Gemini 3.1 Pro(57)→ Grok 4.3(53)——相差约 8 分以内。
  • 开源权重已追上。 DeepSeek V4-ProMiniMax M3(AA 指数 ~44)以 5–12× 更低的价格拿出接近前沿的编码分数。
  • 上下文爆发。 Llama 4 Scout10M token 保持公开发布中最大的窗口;1M 现已成为默认。

本文如何编制

我们追踪了截至 2026 年 6 月 17 日每个实验室在售的旗舰,然后对照官方模型卡 / 定价页与独立追踪器(Artificial Analysis Intelligence Index v4.1、LLM-Stats)逐一核对规格。当来源相互矛盾时——在这个市场很常见——我们给出区间并同时引用两者。请把每个数字都当作有时效的快照,而非永久事实。

主对比表

闭源 / 专有前沿

家族模型发布上下文价格(输入/输出)AA 指数擅长
ClaudeOpus 4.82026-05-281M$5 / $2561.4整体 + 智能体编码
ClaudeFable 5(Mythos)2026-06-091M$10 / $50顶级编码(SWE-Pro 80.3%*)——可用性受限
GPTGPT-5.52026-04-23400K–1M$5 / $3060.2终端/CLI 智能体、全模态
Gemini3.1 Pro2026-021M$2 / $4–1257性价比 + 多模态推理
Gemini3.5 Flash2026-05-191M$1.50 / $9快速、便宜的智能体
Gemini3.5 Pro2026-06(陆续推出)最高 2M~$15 / $60*Deep Think(6 月中尚未 GA)
Grok4.32026-04-301M$1.25 / $2.5053预算前沿、工具调用
Qwen3.7-Max2026-05-191M$2.50 / $7.50~(第 7)知识 + 长跨度智能体
(Meta)Muse Spark2026-04-08暂无52Meta 首个闭源推理模型

开源权重 / 开源

家族模型发布上下文价格(输入/输出)许可擅长
DeepSeekV4-Pro2026-04-241M~$1.74 / $3.48MIT性价比冠军,SWE-V ~85%
DeepSeekV4-Flash2026-04-241M$0.14 / $0.28MIT最便宜的可信编码模型
Llama4 Scout2025-0410M自托管Llama Community最长上下文、RAG
Llama4 Maverick2025-041M自托管Llama Community多模态通才
Qwen3.6-27B2026-04-22262K→1M自托管Apache 2.0小而强的编码模型
KimiK2.7 Code2026-06-12256K$0.95 / —Modified MITMCP 工具使用(81.1%)
GLM5.22026-06-131M$1.40 / $4.40MIT(待定)1M 上下文开源旗舰
MiniMaxM32026-06-011M$0.30 / $1.20开源开源 AA 指数最高(44)
Nemotron3 Ultra2026-06-04自托管完全宽松宽松许可的巨型模型
MistralLarge 32025-12-02256K$0.50 / $1.50Apache 2.0最佳宽松许可的西方 MoE

智能:前沿是一个集群

Artificial Analysis Intelligence Index(2026 年 6 月)
Claude Opus 4.861.4GPT-5.560.2Gemini 3.1 Pro57Grok 4.353Muse Spark52DeepSeek V4-Pro44MiniMax M344
闭源开源
前四名闭源模型相差约 8 分以内;开源权重落后约 16 分。
来源:Artificial Analysis Intelligence Index v4.1,截至 2026 年 6 月。

想要静态版本?下载图表:AA Intelligence Index(PNG)

上下文窗口:1M 成为新默认

LLM 上下文窗口(2026 年 6 月)
Llama 4 Scout10M tokensGemini 3.5 Pro2M tokensOpus 4.81M tokensGPT-5.5 (API)1M tokensDeepSeek V41M tokensGLM-5.21M tokensGPT-5.5 (Codex)400K tokensMistral Large 3256K tokensHaiku 4.5200K tokens
Llama 4 Scout 的 10M token 窗口是新的 1M token 默认值的 10×。
来源:官方模型卡,截至 2026 年 6 月。对数刻度。

静态版本:上下文窗口(PNG)

价格:开源权重重置了地板

输出价格($/100 万 token,2026 年 6 月)
DeepSeek V4-Flash$0.28MiniMax M3$1.2Mistral Large 3$1.5Grok 4.3$2.5DeepSeek V4-Pro$3.48Qwen3.7-Max$7.5Gemini 3.5 Flash$9Claude Opus 4.8$25GPT-5.5$30Claude Fable 5$50
开源闭源
DeepSeek V4-Flash($0.28)的输出价比 Claude Fable 5($50)便宜约 180×。
来源:官方 API 定价页,截至 2026 年 6 月。

静态版本:输出价格(PNG)

按家族

OpenAI — GPT

GPT-5.5(2026 年 4 月 23 日)把 o 系列 + Codex 统一为一个旗舰。它领跑终端原生智能体(Terminal-Bench 2.0 ≈ 82.7%),原生全模态,并提供 Instant 默认款加更高精度的 Pro。定价 $5/$30;上下文 400K(Codex)至 1M(API)。血统:GPT-5(2025 年 8 月)→ 5.1 → 5.2 → 5.4 → 5.5

Anthropic — Claude

Opus 4.8(2026 年 5 月 28 日)是 6 月的整体领跑者(AA 61.4):顶级智能体编码(SWE-V 88.6%)、计算机使用(OSWorld 83.4%)、知识工作(GDPval-AA 1,890)、最佳幻觉校准,外加 Fast Mode。档位:Opus 4.8($5/$25)· Sonnet 4.6($3/$15)· Haiku 4.5($1/$5)。Mythos 级的 Fable 5(6 月 9 日)立下编码天花板(SWE-Pro 80.3%*),但其可用性目前受限。

Google — Gemini

Gemini 3.1 Pro(2026 年 2 月,AA 57)是性价比 + 多模态领跑者(约 $2 输入,1M 上下文,GPQA ≈ 94.3%)。3.5 Flash(5 月 19 日 GA)是迄今最快/最便宜的档位($1.50/$9,约快 4×)。3.5 Pro(Deep Think,最高 2M 上下文)于 6 月陆续推出。

xAI — Grok

Grok 4.3(2026 年 4 月 30 日,AA 53):预算前沿——1M 上下文、函数调用、结构化输出、$1.25/$2.50。最强功能锁在 $300/月 的 SuperGrok Heavy 档位之后。

Meta — Llama + Muse

Llama 4 Scout(10M 上下文)与 Maverick(1M 上下文)是 MoE、原生多模态、对单机友好。Behemoth(约 2T)已搁置。Muse 家族现有三个模型:Muse Spark 1.2(8 月 5 日,编码旗舰,AA 54,$1.25/$4.25)、Muse Glimmer(8 月 10 日,30B Apache 2.0 本地智能体)和原始 Muse Spark(4 月 8 日,AA 52)。Llama 5 推迟到接近 2027。

DeepSeek(开源权重,MIT)

V4(2026 年 4 月 24 日)把 1M 上下文做到便宜。V4-Pro(1.6T/49B 激活)取得约 85% SWE-V;V4-Flash 是最便宜的可信编码模型($0.14/$0.28)。R2 尚未发布——把 R2 规格当作传闻看待。

Alibaba — Qwen

Qwen3.7-Max(5 月 19 日)是专有、仅 API(1M 上下文,$2.50/$7.50):在其同侪中拥有最高知识得分的“Agent Frontier”。开源权重在更低层级延续:Qwen3.6-27B / 35B-A3B(Apache 2.0)。

中国开源浪潮

  • Kimi K2.7 Code(6 月 12 日):1T MoE,256K 上下文,领跑 MCP 工具使用(81.1%)。
  • GLM-5.2(6 月 13 日):1M 上下文(开源中最大),MIT 待定,约 $1.40/$4.40。
  • MiniMax M3(6 月 1 日):1M 上下文,原生图像/视频,$0.30/$1.20,开源 AA 指数最高。

NVIDIA — Nemotron

Nemotron 3 Ultra(6 月 4 日):550B,是完全宽松许可下最强的开源模型(无门槛)。Nemotron 3.5 Lightning(8 月 11 日):面向长时程智能体工作负载的最高效率模型,搭载 NeMo Switchyard 多模型路由库。

Mistral — 欧洲的开源标准

Mistral Large 3(2025 年 12 月 2 日):41B 激活 / 675B 总 MoE,256K 上下文,原生视觉,Apache 2.0($0.50/$1.50),与面向边缘的 Ministral 3 一同发布。

常见问题

2026 年 6 月最好的 LLM 是哪个? 没有单一赢家。Claude Opus 4.8 领跑整体智能与智能体编码;GPT-5.5 领跑终端/CLI 智能体;Gemini 3.1 Pro 领跑性价比与多模态推理;DeepSeek V4-Pro 在开源权重中领跑每分基准的性价比。

最好的开源 LLM 是哪个? MiniMax M3 与 DeepSeek V4-Pro 在开源权重的 AA 指数顶端打平(~44)。Kimi K2.7 Code 领跑 MCP 工具使用;Llama 4 Scout 领跑上下文长度(10M);NVIDIA Nemotron 3 Ultra 领跑宽松许可。

哪个模型的上下文窗口最大? Llama 4 Scout,10M token——截至 2026 年 6 月,是任何公开发布的 LLM 中最大的。

最便宜的有能力的模型是哪个? DeepSeek V4-Flash,$0.14 / $0.28 每 100 万 token,经核实的 SWE-bench Verified 分数约 79%。

2026 年 7 月更新

7 月格局变化很快。以下是自 6 月初始快照以来的变化:

新前沿模型

模型发布日关键变化
Claude Opus 52026-07-24新 AA Intelligence Index 第一名(61)。Frontier-Bench SOTA(43.3%),ARC-AGI-3 30.2%(4 倍于第二名)。定价不变 $5/$25。
GPT-5.6 Sol/Terra/Luna2026-07-09(GA)三层家族全面上线。Sol $5/$30,Terra $2.50/$15,Luna $1/$6。1.05M 上下文。
Grok 4.52026-07-08xAI 编码旗舰,$2/$6。500K 上下文,与 Cursor 联合训练。
Gemini 3.6 Flash2026-07-21比 3.5 Flash 少 17% 输出 token,更低价格($1.50/$7.50)。取代 3.5 Flash 成为工作马。

新开源权重模型

模型发布日关键变化
Kimi K32026-07-16(API)/ 07-27(权重)全球首个开放 3T 级模型。2.8T MoE,104B 激活,1M 上下文。自定义许可(非 MIT)。
Inkling2026-07-15Thinking Machines Lab(Mira Murati)。975B/41B MoE,Apache 2.0,多模态。定位微调基座,非前沿竞争者。

更新要点

  • Claude Opus 5 成为新的整体领先者,以同等价格取代 Opus 4.8。在 SWE-bench Pro 上与 Fable 5 的差距缩小到 ~1 分(79.2% vs 80.3%)。
  • GPT-5.6 分层定价上线。 Terra 以 GPT-5.5 一半的价格达到同等质量;Luna 是最便宜的 GPT-5.x,$1/$6。
  • 开源权重上限跃升至 2.8T(Kimi K3),但自定义许可和 64+ GPU 要求限制了实际采用。Inkling 提供美国来源的 Apache 2.0 替代方案(975B)。
  • Gemini 3.5 Pro 仍然缺席。 Google 改发了 3.6 Flash。Gemini 4 的预训练已开始。

2026 年 8 月更新

8 月初迎来中国模型攻势和视频生成井喷;8 月 5–11 日一周又新增 Meta 开源转向、NVIDIA 智能体布局和 GPT-5.6 重大更新:

新前沿模型

模型发布日期关键变化
Qwen3.8-Max2026-08-03阿里 2.4T 稀疏 MoE(95B 激活)。OSWorld-Verified 86.1(超 Fable 5)、PaperBench 93.0(最高分)。$2/$6——Opus 5 的三分之一。开放权重 8 月 12 日到来。
Muse Spark 1.22026-08-05Meta 编码旗舰,与 Muse Code 终端智能体联合训练。TB 2.1 82.9%,AA Intelligence Index 54。标准 $1.25/$4.25;贡献者层 $0.10/$0.20(最便宜的前沿推理,需共享提示用于训练)。1M 上下文。

新开源权重模型

模型发布日期关键变化
Muse Glimmer2026-08-10Meta 首个 Apache 2.0 模型——30B 密集多模态智能体。量化后可在 24GB 显存(单张消费级 GPU)上运行。DFlash 推测解码随权重发布(RTX 5090 上 3.1 倍加速)。面向本地智能体部署。
Nemotron 3.5 Lightning2026-08-11NVIDIA 面向长时程智能体工作负载的最高效率模型。搭载 NeMo Switchyard——开源多模型路由库。首日即可通过 NIM、HuggingFace、OpenRouter 获取。

GPT-5.6 8 月中更新

GPT-5.6 收到三项重大变更:

  • Sol — 改进推理滑块,可细粒度分配计算量;现支持自然语言「多想/少想」。
  • Luna — 升级为所有 ChatGPT 用户的免费默认模型(无限文本,每日 25 次图像生成);新增「思考」按钮用于按需扩展推理。
  • GPT-5.6-Cyber — 新安全强化变体,在对抗数据集上微调;提示注入基准检测率 95%。通过 API 可用,Sol 定价。

跨模态扩展

LLM 格局正日益与视频和多模态模型交织:

模型发布日期关键变化
MiniMax H32026-07-3133B 全模态视频模型带原生音频——首个主流开放权重视频模型。将 MiniMax 版图扩展到 M3 LLM 之外。
FLUX 3 Video2026-08-04(GA)BFL 统一模型正式 GA 并公布定价($0.06–0.53/秒)。视频生成成为商品化 API。
Grok Imagine Video 1.52026-07-31 更新xAI 新增文生视频、原生 1080p 和引用功能。$0.08/秒 API。
Grok Imagine Image 2.02026-08-07xAI 编辑优先图像模型——文生图与编辑竞技场双榜 #2。魔术棒、多参考合成、模板。
Wan 3.02026-08-06阿里 30 秒视频模型,支持文档/网页输入。$0.05–0.20/秒。闭源权重,Wan 2.7 的继任者。
MAGI-2 Preview2026-08-05Sand.ai 114B MoE,Apache 2.0,10 秒带原生音频。AA 视频竞技场 #6。
SeedRealtime2026-08-05字节跳动音视频全双工 LLM。部署于豆包 App——实时看+听+说。

更新要点

  • Meta 转向开源。 Muse Glimmer(Apache 2.0)是 Meta 首个完全宽松许可模型——继 Llama 限制性社区许可后的战略转向。Muse Spark 1.2(已宣布开放权重)将随后。贡献者层($0.10/$0.20 前沿推理换取训练数据)是一种值得关注的新定价模式。
  • Qwen 3.8-Max 开放权重 8 月 12 日到达。 ModelScope 显示倒计时。加上 Kimi K3(2.8T,7 月),开放权重前沿正在冲刺。27B 变体(Qwen3.8-27B)紧随其后。
  • 本地智能体模型成为新品类。 Muse Glimmer(30B,24GB 显存)和 Nemotron 3.5 Lightning(NeMo Switchyard 路由)都瞄准在本地或企业硬件上持续运行的智能体——三个月前这个品类还不存在。
  • GPT-5.6 横向拓宽而非纵向拔高。 OpenAI 在横向扩展(Luna 全民免费、Cyber 安全变体),而非推新版本号。Sol 的推理滑块和 Luna 的思考按钮,以截然不同于对手的方式回答了「分配多少计算」这个问题。
  • 视频输入成为新前沿。 Wan 3.0 的文档转视频和 MAGI-2 的宽松许可视频生成,加上 FLUX 3 和 MiniMax H3——一周内四个新视频模型,超越文生图成为最热模态。
  • 前沿定价阶梯更清晰: Fable 5($10/$50)最强能力 → Opus 5($5/$25)近 Fable 半价 → Qwen 3.8-Max($2/$6)预算友好的智能体工作 → Muse Spark 1.2($1.25/$4.25)编码性价比 → Sonnet 5($2/$10)日常主力。

来源

  1. Anthropic — Claude models overview
  2. OpenAI — Introducing GPT-5.5
  3. Google — Gemini 3.5
  4. xAI — Grok 4.3 docs
  5. Meta — Llama 4 herd
  6. DeepSeek — V4 release notes
  7. Alibaba Cloud — Qwen3.7: The Agent Frontier
  8. Mistral AI — Introducing Mistral 3
  9. Artificial Analysis — Intelligence Index
  10. Build Fast with AI — Best AI Models June 2026
  11. Alibaba Cloud — Qwen3.8-Max: A New Bar for Coding and Cowork

更新日志:2026-08-11 — 8 月更新 2:添加 Muse Spark 1.2、Muse Glimmer、Nemotron 3.5 Lightning;GPT-5.6 Sol/Luna/Cyber 8 月中更新;Qwen 3.8-Max 开放权重倒计时;Grok Imagine Image 2.0、Wan 3.0、MAGI-2 加入跨模态扩展;更新 Meta 和 Nemotron 家族章节。2026-08-05 — 添加 8 月更新章节(Qwen 3.8-Max、跨模态扩展:MiniMax H3、FLUX 3 Video GA、Grok Imagine Video 1.5、SeedRealtime)。2026-07-29 — 添加 7 月更新章节(Opus 5、GPT-5.6 GA、Gemini 3.6 Flash、Kimi K3、Inkling)。2026-06-17 — 首次发布。


最后更新:2026-08-11