MiniMax M3 由总部位于上海的 MiniMax 于 2026 年 6 月 1 日发布,给出一个明确主张:它是首个把前沿级编码、1M token 上下文与原生多模态(文本、图像、视频)合于单一系统的开源权重模型。它是一个 4280 亿参数的混合专家,单 token 约 22B 激活,从第零步起就以多模态方式在约 100 万亿交织 token 上训练。
使能它的关键是 MiniMax Sparse Attention(MSA):它先对上下文块做预筛选,而非对一切都做注意力——在 1M 上下文下把单 token 算力削到约 M2 的 1/20,预填充与解码都快得多。正是这让 1M 窗口成为可投产的能力,而非规格表上的数字。在 SWE-Bench Pro 上它得分约 59%,在该基准上领先 GPT-5.5 与 Gemini 3.1 Pro,而价格仅约 $0.60 / $2.40 每 100 万 token。
两点实话提醒。许可是 MiniMax Community License——权重可在 Hugging Face 下载,但属于源码可得而非 OSI 开源,商用前需先核对其限制。其次,1M 上下文是“最高可达”,512K 有保证;请按 512K 规划,并预期自托管需要多卡节点。
适用场景
- 长上下文智能体编码与 8 小时以上的会话
- 长视频与多文档理解
- 自托管的多模态部署
优缺点
优势
- 在单一开源模型里集前沿编码 + 1M 上下文 + 原生多模态于一体
- SWE-bench Pro ~59,在该测试上领先 GPT-5.5 与 Gemini 3.1 Pro
- 稀疏注意力(MSA)让长上下文变便宜(单 token 算力约为 M2 的 1/20)
局限
- Community 许可限制商用(非 OSI 开源)
- 428B MoE 需多卡节点;1M 为“最高可达”,512K 有保证