Qwen3.8-Max 是阿里巴巴 2026 年 8 月 3 日发布的新旗舰,以 2.4 万亿参数(95B 激活)成为 Qwen 系列迄今发布过基准数据的最大模型。核心宣传:「仅次于 Fable 5」——在智能体和科研基准上数据确实支撑了这个说法,但在深度软件工程上差距明显。
真正的亮点是组合拳:前沿竞争力的分数搭配 $2/$6 每百万 token 定价——约为 Claude Opus 5 的三分之一、GPT-5.6 Sol 的四分之一——加上开放权重(及 27B 蒸馏版)即将发布的承诺。如果阿里兑现开放权重,Qwen3.8-Max 将以显著优势成为最强可下载模型。Qwen3.7-Max 作为前代,各项指标已全面落后。
架构
| 规格 | 数值 |
|---|---|
| 总参数 | 2.4T |
| 激活参数 | ~95B(约 4% 网络激活) |
| 架构 | 稀疏 MoE transformer(基于 Qwen 3.5) |
| 上下文窗口 | 1M tokens |
| 输入模态 | 文本、图像、视频 |
| 输出模态 | 文本 |
| API 模型 ID | qwen3.8-max |
定价
| 费率 / 1M tokens | |
|---|---|
| 输入 | $2.00 |
| 输出 | $6.00 |
兼容 OpenAI 和 Anthropic API 协议,通过 QwenCloud 调用。
基准
所有数据来自阿里 8 月 3 日发布博文中的厂商自报数据。独立验证仍然有限——视为方向性参考,而非最终定论。
| 基准 | Qwen 3.8-Max | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| TerminalBench 2.1 | 86.6 | 84.6 | 88.8 | 84.6 |
| SWE-bench Pro | 67.7 | 80.0 | 64.6 | 69.2 |
| PaperBench | 93.0 | 88.8 | 90.5 | 80.3 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.0 |
| OSWorld-Verified | 86.1 | 85.0 | 83.2 | — |
| IFBench | 82.8 | 63.5 | 72.7 | 62.2 |
| HLE | 43.6 | 53.3 | 47.2 | 45.7 |
规律:Qwen 3.8-Max 在智能体/研究行(OSWorld、PaperBench、IFBench)表现突出,但在核心软件工程上大幅落后 Fable 5(SWE-bench Pro 差距 12.3 分、FrontierSWE 差距 15.3 分)。
开放权重问题
阿里发布博文明确表示:「首个 Max 级开放权重模型……开放权重将于下周发布。」承诺两组权重:
- Qwen3.8-Max(Qwen3.8-2.4T-A95B)—— 完整 2.4T 模型
- Qwen3.8-27B —— 蒸馏变体,适合更平民的硬件
更新(8 月 11 日): ModelScope 倒计时显示 Qwen3.8-2.4T-A95B 权重将于 2026 年 8 月 12 日发布。Qwen3.8-27B 预计随后跟进。许可条款仍未公布。这是 Qwen Max 级模型首次承诺开放权重——社区正在密切关注。
横向对比
- vs Claude Fable 5: Fable 在深度编码上领先两位数。Qwen 在智能体计算机使用和科研任务上胜出。Fable 定价 $10/$50——输入贵 5 倍、输出贵 8 倍。
- vs GPT-5.6 Sol: Sol 在 TerminalBench(88.8 vs 86.6)和 GPQA Diamond(94.1 vs 92.6)上领先。Qwen 在 OSWorld 和 PaperBench 上胜出。Sol 定价 $5/$30——贵 2.5×/5×。
- vs Claude Opus 5: Opus 5 定价 $5/$25,智能体工具链更成熟。Qwen 在多数基准上持平或超越,价格仅为 40%。
- vs Kimi K3: K3 为 2.8T(更大)且权重已开放。Qwen 3.8-Max 宣称基准更高——但 K3 的权重今天就能下载。
- vs Qwen3.7-Max: 前代。TerminalBench 从 74.5 升至 86.6,PaperBench 从 64.8 升至 93.0。代际跃升。
全景参见 2026 LLM 指南。
适用场景
- 长时程自主智能体与计算机使用任务
- 端到端科研复现与科学工作流
- 以 $2/$6 替代 $5/$25+ 闭源替代方案的高性价比前沿推理
- 开放权重发布后的下游微调
优缺点
优势
- 智能体基准顶尖——OSWorld-Verified 86.1(超 Fable 5 的 85.0 和 GPT-5.6 Sol 的 83.2)
- PaperBench 93.0——端到端科研复现最高分
- 激进定价 $2/$6——约为 Opus 5 的 1/3、GPT-5.6 Sol 的 1/4
- 开放权重(含 27B 变体)即将发布——阿里首个开放权重的 Max 级模型
局限
- SWE-bench Pro 67.7——落后 Fable 5 超 12 分,深度编码差距显著
- 基准数据为厂商自报——目前缺乏独立验证
- 截至 2026 年 8 月 5 日开放权重尚未发布——许可条款仍未公布
- 多模态输入范围(视频、文档、语音)未被阿里完整说明
常见问题
Qwen 3.8-Max 什么时候发布的?
阿里巴巴于 2026 年 7 月 19 日在上海世界人工智能大会上预览 Qwen 3.8-Max,2026 年 8 月 3 日正式发布,公布完整规格、基准与 API 访问。
Qwen 3.8-Max 有多大?
稀疏混合专家配置中共 2.4 万亿参数,每 token 约 950 亿参数激活(约 4% 的网络参与计算)。基于 Qwen 3.5 架构构建。
Qwen 3.8-Max 是开源的吗?
尚未,但即将发布。ModelScope 倒计时显示 Qwen3.8-2.4T-A95B 权重将于 2026 年 8 月 12 日发布。Qwen3.8-27B 预计随后跟进。许可条款尚未公布。请关注 Hugging Face 和 ModelScope 更新。
与 Fable 5 相比如何?
Qwen 3.8-Max 在 OSWorld-Verified(86.1 vs 85.0)、PaperBench(93.0 vs 88.8)、TerminalBench(86.6 vs 84.6)上领先。但 Fable 5 在 SWE-bench Pro(80.0 vs 67.7)和 FrontierSWE(88.8 vs 73.5)上大幅领先——恰好是软件工程智能体最关键的深度编码基准。