MAGI-2 Preview 是 Sand.ai 在视频生成扩展路径上的押注:一个 1140 亿参数的混合专家模型,每 token 仅激活 60 亿参数。于 2026 年 8 月 5 日以 Apache 2.0 发布,能在一次传递中生成 10 秒视频配同步音频。
这是一个研究预览,不是生产产品。Sand.ai 对此非常坦诚——他们称之为「扩展路径的中间验证」。但一个完整的 114B 视频 MoE(含权重、代码和技术报告)以 Apache 2.0 免费提供,这件事本身就很重要。
架构
| 规格 | 数值 |
|---|---|
| 总参数 | 114B |
| 每 token 激活 | ~6B(约 5.3%) |
| 架构 | MagiMoE——超细粒度 MoE + 多头潜空间路由 |
| 文本编码器 | Qwen3.5-27B(56 GB) |
| 视频 VAE | Wan2.2 |
| 音频 VAE | Stable Audio Open 1.0 |
输出规格
| 数值 | |
|---|---|
| 时长 | 10 秒(固定) |
| 生成 | 两阶段:预览 512×896 → 精化至 1088×1920(1080p) |
| 音频 | 与视频同步生成 |
| 模式 | T2V(文本到视频)、I2V(图像+文本到视频) |
硬件要求
完整检查点约 307 GB,推理需 8 块 NVIDIA Hopper GPU。
横向对比
- vs MiniMax H3: 两者都能生成带原生音频的视频。H3 是 33B 密集模型,RTX 3060 可跑,15 秒。MAGI-2 是 114B MoE,需 8 块 H100,10 秒。H3 更实用;MAGI-2 更面向研究。
- vs FLUX 3 Video: FLUX 3 最长 20 秒 Full HD 带原生音频,质量排名更高。FLUX 3 是商业产品;MAGI-2 是开源研究发布。
- vs Wan 2.7: Wan 2.7 是成熟的开放权重视频模型。MAGI-2 在更大参数量上探索 MoE 扩展,但输出更短、硬件要求更高。
全景参见视频模型目录。
适用场景
- 通过 MoE 架构研究高效视频生成扩展
- 拥有 Hopper 级 GPU 集群的团队自托管视频生成
- 在 Apache 2.0 下进行微调和衍生模型开发
- 研究 100B 级别视频 MoE 路由行为
优缺点
优势
- Apache 2.0——视频生成模型的完全开放商用许可
- 114B 总参 / 6B 激活——高效 MoE 架构将容量与计算成本解耦
- 原生同步音频——视频和声音在一次传递中生成,无需独立音频管线
- 完整研究发布——权重、推理代码和技术报告全部公开
局限
- 需 8 块 NVIDIA Hopper GPU——大多数个人开发者无法使用
- 固定 10 秒时长——不支持可变片段长度
- 研究预览——Sand.ai 明确将其定位为「中间验证」而非成品
- AA 视频排行榜
常见问题
MAGI-2 Preview 什么时候发布的?
2026 年 8 月 5 日,权重发布在 Hugging Face,推理代码发布在 GitHub。
需要什么硬件?
推理通过 torchrun 运行,需 8 块 NVIDIA Hopper GPU(H100 或同等)。完整检查点约 307 GB:预览 transformer(228 GB)、精化器(14 GB)、Qwen3.5-27B 文本编码器(56 GB)、Wan2.2 视频 VAE、Stable Audio Open 1.0 音频 VAE。
什么是 MagiMoE?
MAGI-2 的定制 MoE 架构。使用多头潜空间路由和超细粒度专家,将模型总容量与每 token 计算量解耦。每个 token 表示被切分为 12 个 256 维潜空间头,top-6 路由——激活 114B 中的约 6B 参数。