大语言模型

MiniMax M3

首个把前沿编码、1M token 上下文与原生多模态合于一身的开源权重模型——基于稀疏注意力构建的 428B MoE(22B 激活)。

MiniMax M3 由总部位于上海的 MiniMax 于 2026 年 6 月 1 日发布,给出一个明确主张:它是首个把前沿级编码、1M token 上下文与原生多模态(文本、图像、视频)合于单一系统的开源权重模型。它是一个 4280 亿参数的混合专家,单 token 约 22B 激活,从第零步起就以多模态方式在约 100 万亿交织 token 上训练。

使能它的关键是 MiniMax Sparse Attention(MSA):它先对上下文块做预筛选,而非对一切都做注意力——在 1M 上下文下把单 token 算力削到约 M2 的 1/20,预填充与解码都快得多。正是这让 1M 窗口成为可投产的能力,而非规格表上的数字。在 SWE-Bench Pro 上它得分约 59%,在该基准上领先 GPT-5.5 与 Gemini 3.1 Pro,而价格仅约 $0.60 / $2.40 每 100 万 token。

两点实话提醒。许可是 MiniMax Community License——权重可在 Hugging Face 下载,但属于源码可得而非 OSI 开源,商用前需先核对其限制。其次,1M 上下文是“最高可达”,512K 有保证;请按 512K 规划,并预期自托管需要多卡节点。

适用场景

  • 长上下文智能体编码与 8 小时以上的会话
  • 长视频与多文档理解
  • 自托管的多模态部署

优缺点

优势

  • 在单一开源模型里集前沿编码 + 1M 上下文 + 原生多模态于一体
  • SWE-bench Pro ~59,在该测试上领先 GPT-5.5 与 Gemini 3.1 Pro
  • 稀疏注意力(MSA)让长上下文变便宜(单 token 算力约为 M2 的 1/20)

局限

  • Community 许可限制商用(非 OSI 开源)
  • 428B MoE 需多卡节点;1M 为“最高可达”,512K 有保证

来源

最后更新:2026-06-18 · 规格与价格变动很快——使用前请在厂商官网核实。