视频模型

Wan 3.0

阿里巴巴统一视频生成模型——30 秒单次生成、支持文档和网页输入、$0.05–$0.20/秒 API 定价。

Wan 3.0 是阿里巴巴 2026 年 8 月 6 日发布的视频生成模型——最大亮点是时长:30 秒单次生成,是 Wan 2.7 15 秒上限的两倍。这足以实现连续运镜、一镜到底和短片不拼接所需的场景构图。

但更有意思的特性是输入。Wan 3.0 接受文档(PDF、PPT、电子表格)和网页 URL 作为创意来源——直接将静态文本数据转化为动态视频。目前没有其他主流视频模型提供这个能力。

代价是:与 Wan 2.1、2.2、2.7(合计积累 690 万次开放权重下载)不同,Wan 3.0 是闭源托管产品

输出规格

数值
时长最长 30 秒(单次生成)
分辨率480p / 720p / 1080p
音频语音和环境音生成
语言多语言语音输出

输入模式

输入类型格式
文本文本提示词
图像角色/风格一致性参考图
视频参考片段(1–15 秒)
音频参考音频(WAV、MP3)
文档DOCX、DOC、XLS、XLSX、PPTX、PPT、PDF、TXT、KEY、PAGES、NUMBERS、MD
网页链接公开网页(无需登录)

定价

分辨率每秒费率
480p$0.05
720p$0.10
1080p$0.20

30 秒 1080p 片段:$6.00。对比 FLUX 3 Video 的 $0.29/s FHD 或 Veo 3.1 的 $0.40/s。

横向对比

  • vs Wan 2.7 Wan 2.7 最长 15 秒且需分别调用不同模型。Wan 3.0 时长翻倍、功能统一——但失去了开放权重。
  • vs Seedance 2.5 Seedance 2.5 也可 30 秒 + 4K。Seedance 领先 AA Video Arena。Wan 3.0 的独特角度是文档/网页输入。
  • vs FLUX 3 Video FLUX 3 最长 20 秒带原生音频。Wan 3.0 可到 30 秒且接受文档输入,但 FLUX 3 有开放权重计划。

全景参见视频模型目录

适用场景

  • 将文档和演示文稿直接转化为视频内容
  • 用于影视和短剧的长镜头视频生成
  • 从现有素材制作营销和教育视频
  • 为自动驾驶和机器人训练生成仿真视频

优缺点

优势

  • 30 秒单次生成——Wan 2.7 的两倍,支持连续运镜和一镜到底
  • 文档和网页输入——直接将 PDF、PPT、电子表格和 URL 转化为视频(独有能力)
  • 有竞争力的定价 $0.05–$0.20/秒——同分辨率下低于多数竞品
  • 统一模型——参考、编辑、复制、动作驱动合为一体(Wan 2.7 需分别调用不同模型)

局限

  • 公测阶段——API 尚未完全开放,需申请使用
  • 闭源托管产品——不可自托管(与前代 Wan 2.7 的开放权重不同)
  • 无独立质量基准发布
  • 完整 API 访问标注「即将开放」但无确切日期

常见问题

Wan 3.0 什么时候发布的?

阿里巴巴于 2026 年 8 月 6 日开放公测,通过阿里云 Model Studio、Qwen Cloud 和万相创作站使用。

Wan 3.0 与 Wan 2.7 有何不同?

三大变化:时长从 15 秒翻倍至 30 秒(单次生成);新增文档和网页输入(PDF、PPT、DOC、XLS、MD、网页链接);将之前分散的任务专用模型统一为一个。Wan 2.7 仍以开放权重继续提供。

Wan 3.0 是开源的吗?

不是。与 Wan 2.1、2.2、2.7(共积累 690 万次下载的开放权重)不同,Wan 3.0 是闭源托管产品。每生成一秒都通过阿里云基础设施计费。

支持哪些文档格式?

DOCX、DOC、XLS、XLSX、PPTX、PPT、PDF、TXT、KEY、PAGES、NUMBERS 和 MD 文件。也支持不需要登录的公开网页 URL。

来源

最后更新:2026-08-11 · 规格与价格变动很快——使用前请在厂商官网核实。