文本与推理
大语言模型
面向对话、推理、编程与智能体的前沿与开源语言模型——按价格、上下文窗口与基准对比。
Muse Glimmer
Meta 首个 Apache 2.0 模型——30B 密集多模态智能体,为消费级 GPU 本地部署优化,DFlash 推测解码加速推理。
Muse Spark 1.2
Meta 编码旗舰——与 Muse Code 终端智能体联合训练,TB 2.1 82.9%,$1.25/$4.25 标准定价,1M 上下文,已宣布将开放权重。
Qwen3.8-Max
阿里巴巴新旗舰——2.4T 参数稀疏 MoE(95B 激活),多模态,智能体/研究基准顶尖,$2/$6 定价,开放权重即将发布。
Claude Opus 5
Anthropic 2026 年 7 月旗舰——以 Opus 定价($5/$25)实现接近 Fable 的智能,Frontier-Bench、ARC-AGI-3 与 OSWorld 2.0 均为 SOTA,默认开启推理。
Gemini 3.6 Flash
Google 2026 年 7 月主力模型——比 3.5 Flash 少 17% 输出 token,更便宜($1.50/$7.50),为智能体编码与知识工作优化。
Kimi K3
全球首个开放权重的 3T 级前沿模型——2.8T 参数(104B 激活 MoE),1M 上下文,原生视觉,自定义收入分级许可。
Grok 4.5
xAI 于 2026 年 7 月发布的编程与智能体旗舰——500K 上下文、$2/$6 每 100 万 token,默认用于 Grok Build 与 Cursor,并与 Cursor 联合训练。
Claude Sonnet 5
Anthropic 迄今最具智能体能力的 Sonnet——以 $2/$10 的首发价提供接近 Opus 的编码、智能体与知识工作能力,并成为 claude.ai 的新默认模型。
GPT-5.6
OpenAI 的 GPT-5.6 家族——旗舰 Sol、均衡 Terra 与快省 Luna——具备 max/ultra 推理模式与分档定价。2026 年 7 月 9 日全面上线。
Sakana Fugu
东京 Sakana AI 于 2026 年 6 月推出的多智能体编排系统——以单一 OpenAI 兼容模型交付,动态把每个任务路由到一个可替换的前沿与开源模型池。
GLM-5.2
Z.ai 的开源权重长跨度旗舰——753B 参数 MoE,MIT 许可下稳定 1M 上下文,在多个编码基准上击败 GPT-5.5。
Kimi K2.7 Code
Moonshot 的开源权重智能体编码旗舰——1T 参数 MoE(32B 激活),256K 上下文,原生图像/视频输入,思考量比 K2.6 精简约 30%。
Claude Fable 5
Anthropic 首个面向大众的 Mythos 级模型——几乎所有基准都是 SOTA,并配备安全分类器,敏感话题自动回落到 Opus 4.8。6 月 12–30 日曾因美国出口管制下线,7 月 1 日起全球恢复。
Claude Opus 4.8
2026 年 6 月的整体智能领跑者,也是智能体编码的顶尖模型,拥有所有前沿模型中最审慎的幻觉校准。
DeepSeek V4-Pro
开源权重的性价比冠军——以 MIT 许可、1M token 上下文,在闭源模型的零头价格下实现接近前沿的编码能力(SWE-V ~85%)。
GPT-5.5
OpenAI 的统一推理与对话旗舰——终端原生智能体工作的最强模型,原生全模态,覆盖文本、图像、音频与视频。
Gemini 3.1 Pro
性价比最高的闭源前沿模型——顶级推理与原生多模态,约 $2 每 100 万输入 token,配 1M token 上下文。
Nemotron 3.5 Lightning
NVIDIA 面向长时程智能体工作流的最高效率开放模型——由 Nemotron Coalition 构建,配套 NeMo Switchyard 智能多模型路由。
Inkling
Mira Murati 的首个模型——975B/41B 激活的开放权重 MoE,Apache 2.0 许可,原生文本/图像/音频,1M 上下文,定位为微调基础模型。
MiniMax M3
首个把前沿编码、1M token 上下文与原生多模态合于一身的开源权重模型——基于稀疏注意力构建的 428B MoE(22B 激活)。
Ornith-1.0
Ornith-1.0 是 DeepReinforce 面向智能体编码的开源、自我改进 LLM 家族——从 9B 边缘模型到在 SWE-Bench 上比肩 Claude Opus 4.7 的 397B MoE。
Qwen3.7-Max
阿里巴巴的专有“Agent Frontier”旗舰——顶尖的知识得分与跨 1M token 上下文的长跨度自主能力。
Grok 4.3
xAI 的预算前沿模型——强劲的智能体工具调用与自报的低幻觉率,搭配 1M token 窗口,价格 $1.25 / $2.50 每 100 万。