视频模型

MAGI-2 Preview

Sand.ai 开源 114B MoE 视频模型——每 token 仅激活 6B 参数,生成 10 秒视频配同步音频。Apache 2.0。

MAGI-2 Preview 是 Sand.ai 在视频生成扩展路径上的押注:一个 1140 亿参数的混合专家模型,每 token 仅激活 60 亿参数。于 2026 年 8 月 5 日Apache 2.0 发布,能在一次传递中生成 10 秒视频配同步音频。

这是一个研究预览,不是生产产品。Sand.ai 对此非常坦诚——他们称之为「扩展路径的中间验证」。但一个完整的 114B 视频 MoE(含权重、代码和技术报告)以 Apache 2.0 免费提供,这件事本身就很重要。

架构

规格数值
总参数114B
每 token 激活~6B(约 5.3%)
架构MagiMoE——超细粒度 MoE + 多头潜空间路由
文本编码器Qwen3.5-27B(56 GB)
视频 VAEWan2.2
音频 VAEStable Audio Open 1.0

输出规格

数值
时长10 秒(固定)
生成两阶段:预览 512×896 → 精化至 1088×1920(1080p)
音频与视频同步生成
模式T2V(文本到视频)、I2V(图像+文本到视频)

硬件要求

完整检查点约 307 GB,推理需 8 块 NVIDIA Hopper GPU

横向对比

  • vs MiniMax H3 两者都能生成带原生音频的视频。H3 是 33B 密集模型,RTX 3060 可跑,15 秒。MAGI-2 是 114B MoE,需 8 块 H100,10 秒。H3 更实用;MAGI-2 更面向研究。
  • vs FLUX 3 Video FLUX 3 最长 20 秒 Full HD 带原生音频,质量排名更高。FLUX 3 是商业产品;MAGI-2 是开源研究发布。
  • vs Wan 2.7 Wan 2.7 是成熟的开放权重视频模型。MAGI-2 在更大参数量上探索 MoE 扩展,但输出更短、硬件要求更高。

全景参见视频模型目录

适用场景

  • 通过 MoE 架构研究高效视频生成扩展
  • 拥有 Hopper 级 GPU 集群的团队自托管视频生成
  • 在 Apache 2.0 下进行微调和衍生模型开发
  • 研究 100B 级别视频 MoE 路由行为

优缺点

优势

  • Apache 2.0——视频生成模型的完全开放商用许可
  • 114B 总参 / 6B 激活——高效 MoE 架构将容量与计算成本解耦
  • 原生同步音频——视频和声音在一次传递中生成,无需独立音频管线
  • 完整研究发布——权重、推理代码和技术报告全部公开

局限

  • 需 8 块 NVIDIA Hopper GPU——大多数个人开发者无法使用
  • 固定 10 秒时长——不支持可变片段长度
  • 研究预览——Sand.ai 明确将其定位为「中间验证」而非成品
  • AA 视频排行榜

常见问题

MAGI-2 Preview 什么时候发布的?

2026 年 8 月 5 日,权重发布在 Hugging Face,推理代码发布在 GitHub。

需要什么硬件?

推理通过 torchrun 运行,需 8 块 NVIDIA Hopper GPU(H100 或同等)。完整检查点约 307 GB:预览 transformer(228 GB)、精化器(14 GB)、Qwen3.5-27B 文本编码器(56 GB)、Wan2.2 视频 VAE、Stable Audio Open 1.0 音频 VAE。

什么是 MagiMoE?

MAGI-2 的定制 MoE 架构。使用多头潜空间路由和超细粒度专家,将模型总容量与每 token 计算量解耦。每个 token 表示被切分为 12 个 256 维潜空间头,top-6 路由——激活 114B 中的约 6B 参数。

来源

最后更新:2026-08-11 · 规格与价格变动很快——使用前请在厂商官网核实。