文/图生视频
视频模型
文本与图像生成视频模型——电影级质感、原生音频与经济型选项,按每秒成本对比。
MiniMax H3
首个主流开放权重视频模型——33B 全模态 transformer,支持原生立体声音频,可生成 4–15 秒视频,分辨率最高 2K。
FLUX 3
BFL 统一多模态模型——视频(最长 20 秒带原生音频)、图像和动作预测共用一组权重,基于 Self-Flow。视频 2026 年 8 月 4 日起 GA。
Seedance 2.5
字节跳动的长序列视频模型——原生 30 秒单镜头、原生 4K、最多 50 个多模态参考素材、音素级唇同步与单次渲染同步音频。
PixVerse V6
短视频的最佳免费之选——多镜头角色一致、原生音频与 20+ 电影镜头控制,每日赠送免费额度。
Kling 3.0
性价比顶尖的视频模型——出色的人物运动与面部一致性、原生 4K 输出与多语言音频。
Veo 3.1
Google 的电影级视频模型,带原生音频——精致、声画同步片段的质量领跑者,在 Gemini API 上按秒计费。
Runway Gen-4.5
专业人士的视频模型——运动笔刷、镜头运动等丰富创意控制,内置于成熟的剪辑工具集中。
Wan 3.0
阿里巴巴统一视频生成模型——30 秒单次生成、支持文档和网页输入、$0.05–$0.20/秒 API 定价。
MAGI-2 Preview
Sand.ai 开源 114B MoE 视频模型——每 token 仅激活 6B 参数,生成 10 秒视频配同步音频。Apache 2.0。
Grok Imagine Video 1.5
xAI 专用视频生成模型——原生 1080p,6–15 秒带同步音频,支持图像/语音引用,基于 Aurora 自回归引擎。
Wan 2.7
阿里巴巴的旗舰视频模型——1080p、原生音频同步、首/尾帧与多场景控制,出自其开源血统造就社区基座的 Wan 系列。
Seedance 2.0
为电商与重参考任务打造的多模态可控视频模型——图生视频契合度强、运动物理出色、支持多素材输入。
Hailuo 2.3
AI 视频的预算速度冠军——同类最低的按秒成本与快速出片,适合草稿与高并发社交内容。
Sora 2
OpenAI 以物理真实感与同步音频著称的视频模型,通过 ChatGPT 与 API 提供。