文/图生视频

视频模型

文本与图像生成视频模型——电影级质感、原生音频与经济型选项,按每秒成本对比。

MiniMax 开源

MiniMax H3

首个主流开放权重视频模型——33B 全模态 transformer,支持原生立体声音频,可生成 4–15 秒视频,分辨率最高 2K。

API 定价按分辨率区分;开放权重可用
Black Forest Labs

FLUX 3

BFL 统一多模态模型——视频(最长 20 秒带原生音频)、图像和动作预测共用一组权重,基于 Self-Flow。视频 2026 年 8 月 4 日起 GA。

$0.06–0.53 / 秒(按模式和分辨率区分)
ByteDance

Seedance 2.5

字节跳动的长序列视频模型——原生 30 秒单镜头、原生 4K、最多 50 个多模态参考素材、音素级唇同步与单次渲染同步音频。

暂未公开(企业 beta;正式可用 2026 年 7 月初)
PixVerse

PixVerse V6

短视频的最佳免费之选——多镜头角色一致、原生音频与 20+ 电影镜头控制,每日赠送免费额度。

每日免费额度 · $10–$199 / 月 · API 约 $0.025–$0.115 / 秒
Kuaishou

Kling 3.0

性价比顶尖的视频模型——出色的人物运动与面部一致性、原生 4K 输出与多语言音频。

约 $0.067 / 秒(Standard)至约 $0.17 / 秒(Pro)
Google

Veo 3.1

Google 的电影级视频模型,带原生音频——精致、声画同步片段的质量领跑者,在 Gemini API 上按秒计费。

$0.40 / 秒(1080p 标准档,含音频) · $0.05–0.12 / 秒(Fast/Lite)
Runway

Runway Gen-4.5

专业人士的视频模型——运动笔刷、镜头运动等丰富创意控制,内置于成熟的剪辑工具集中。

基于积分(有效约 $0.10–0.25 / 秒)
Alibaba

Wan 3.0

阿里巴巴统一视频生成模型——30 秒单次生成、支持文档和网页输入、$0.05–$0.20/秒 API 定价。

$0.05–$0.20 每秒(按分辨率)
Sand.ai 开源

MAGI-2 Preview

Sand.ai 开源 114B MoE 视频模型——每 token 仅激活 6B 参数,生成 10 秒视频配同步音频。Apache 2.0。

免费(开放权重)
xAI

Grok Imagine Video 1.5

xAI 专用视频生成模型——原生 1080p,6–15 秒带同步音频,支持图像/语音引用,基于 Aurora 自回归引擎。

$0.08 / 秒(API)
Alibaba

Wan 2.7

阿里巴巴的旗舰视频模型——1080p、原生音频同步、首/尾帧与多场景控制,出自其开源血统造就社区基座的 Wan 系列。

约 $6 / 分钟(云端),较 Wan 2.5/2.6 降约 33%
ByteDance

Seedance 2.0

为电商与重参考任务打造的多模态可控视频模型——图生视频契合度强、运动物理出色、支持多素材输入。

约 $0.022–0.14 / 秒(随供应商而异)
MiniMax

Hailuo 2.3

AI 视频的预算速度冠军——同类最低的按秒成本与快速出片,适合草稿与高并发社交内容。

约 $0.025 / 秒
OpenAI

Sora 2

OpenAI 以物理真实感与同步音频著称的视频模型,通过 ChatGPT 与 API 提供。

经 ChatGPT Plus/Pro · 约 $0.15 / 秒(第三方 API 路由)