Grok Imagine Video 1.5 是 xAI 的专用视频生成模型——不是 Grok 聊天机器人,而是基于 Aurora 自回归引擎(在 110,000 块 NVIDIA GB200 GPU 上训练)的独立创作工具。2026 年 5 月 31 日首发,7 月 31 日重大更新增加了文生视频、原生 1080p 和图像/语音引用。
突出特点:在大多数竞品上限 720p(或升分辨率需额外付费)时提供原生 1080p,搭配图像和语音引用确保角色和风格在片段间保持一致。API 定价 $0.08/秒,在中档视频模型中具有竞争力。
规格
| 规格 | 数值 |
|---|---|
| 引擎 | Aurora 自回归 |
| 分辨率 | 480p(草稿)、720p、1080p(原生) |
| 帧率 | 24 FPS |
| 时长 | 6–15 秒 |
| 音频 | 原生,与视频同步生成 |
| 宽高比 | 1:1、16:9、9:16、4:3、3:4、3:2、2:3 |
| 引用 | 1–7 张图片 + 可选语音引用 |
| API 模型 ID | grok-imagine-video-1.5 |
定价
| 费率 | |
|---|---|
| 输出 | $0.08 / 秒 |
通过 xAI API(grok-imagine-video-1.5)调用。消费者通过 grok.com/imagine 和 iOS/Android 应用访问。
生成模式
- 图生视频 —— 原始和最强模式:提供起始图像,描述运动
- 文生视频 —— 无需起始图像,直接描述画面(7 月 31 日新增)
- 引用生视频 —— 1–7 张引用图片用于角色/风格锚定(7 月 31 日新增)
- 语音引用 —— 克隆说话风格用于唇同步对话(API 中按需提供)
横向对比
- vs Seedance 2.0: Seedance 在 AA Video Arena 盲测中领先,成本更低(~$0.022–0.14/秒)。Imagine Video 1.5 提供原生 1080p 和语音引用。
- vs Veo 3.1: Veo 以 $0.40/秒输出更电影感的画面——贵 5 倍。Imagine Video 1.5 更快更便宜,适合迭代。
- vs FLUX 3: FLUX 3 Video 支持最长 20 秒和更丰富的控制。Imagine Video 1.5 更简单,今天即可使用。
- vs MiniMax H3: H3 提供开放权重和更丰富的引用系统(图片+视频+音频)。Imagine Video 1.5 更快、更简单、有原生 1080p。
- vs Grok 4.5(LLM): 完全不同的产品。Grok 4.5 是文本/代码 LLM。Imagine Video 1.5 是视频生成器。同一公司,不同模型。
全景参见视频模型目录。
适用场景
- 从产品图快速制作社交和营销视频
- 用图像引用保持角色一致的系列视频
- 语音引用确保品牌语音一致性
- 快速文生视频起草和迭代
优缺点
优势
- 原生 1080p 生成——少数原生支持全高清的视频模型之一
- 图像和语音引用确保角色/风格在片段间保持一致
- Aurora 自回归引擎生成速度快(5–30 秒每片段)
- API 定价 $0.08/秒——简单、可预测
局限
- 无开放权重——闭源且仅 API 可用
- 最长 15 秒——短于 FLUX 3(20 秒)和 Seedance 2.5(30 秒)
- 引用功能美国优先——国际可用性滞后
- 与 Grok LLM 分开——生成过程中无集成文本推理
常见问题
Grok Imagine Video 1.5 什么时候发布的?
xAI 于 2026 年 5 月 31 日推出 Grok Imagine Video 1.5(6 月 16 日 API 正式 GA)。2026 年 7 月 31 日重大更新增加了文生视频、原生 1080p 和图像/语音引用能力。
这和 Grok 聊天机器人一样吗?
不一样。Grok Imagine Video 1.5 是独立的视频生成模型,与 Grok LLM 聊天机器人完全分开。它们共享 xAI 品牌但服务于不同目的——视频模型生成片段,聊天机器人处理文本对话。
视频最长多久?
每片段 6 到 15 秒,24 FPS。支持 480p(草稿)和 720p/1080p 分辨率。提供七种宽高比。