视频模型

Grok Imagine Video 1.5

xAI 专用视频生成模型——原生 1080p,6–15 秒带同步音频,支持图像/语音引用,基于 Aurora 自回归引擎。

Grok Imagine Video 1.5 是 xAI 的专用视频生成模型——不是 Grok 聊天机器人,而是基于 Aurora 自回归引擎(在 110,000 块 NVIDIA GB200 GPU 上训练)的独立创作工具。2026 年 5 月 31 日首发,7 月 31 日重大更新增加了文生视频、原生 1080p 和图像/语音引用。

突出特点:在大多数竞品上限 720p(或升分辨率需额外付费)时提供原生 1080p,搭配图像和语音引用确保角色和风格在片段间保持一致。API 定价 $0.08/秒,在中档视频模型中具有竞争力。

规格

规格数值
引擎Aurora 自回归
分辨率480p(草稿)、720p、1080p(原生)
帧率24 FPS
时长6–15 秒
音频原生,与视频同步生成
宽高比1:1、16:9、9:16、4:3、3:4、3:2、2:3
引用1–7 张图片 + 可选语音引用
API 模型 IDgrok-imagine-video-1.5

定价

费率
输出$0.08 / 秒

通过 xAI API(grok-imagine-video-1.5)调用。消费者通过 grok.com/imagine 和 iOS/Android 应用访问。

生成模式

  • 图生视频 —— 原始和最强模式:提供起始图像,描述运动
  • 文生视频 —— 无需起始图像,直接描述画面(7 月 31 日新增)
  • 引用生视频 —— 1–7 张引用图片用于角色/风格锚定(7 月 31 日新增)
  • 语音引用 —— 克隆说话风格用于唇同步对话(API 中按需提供)

横向对比

  • vs Seedance 2.0 Seedance 在 AA Video Arena 盲测中领先,成本更低(~$0.022–0.14/秒)。Imagine Video 1.5 提供原生 1080p 和语音引用。
  • vs Veo 3.1 Veo 以 $0.40/秒输出更电影感的画面——贵 5 倍。Imagine Video 1.5 更快更便宜,适合迭代。
  • vs FLUX 3 FLUX 3 Video 支持最长 20 秒和更丰富的控制。Imagine Video 1.5 更简单,今天即可使用。
  • vs MiniMax H3 H3 提供开放权重和更丰富的引用系统(图片+视频+音频)。Imagine Video 1.5 更快、更简单、有原生 1080p。
  • vs Grok 4.5(LLM): 完全不同的产品。Grok 4.5 是文本/代码 LLM。Imagine Video 1.5 是视频生成器。同一公司,不同模型。

全景参见视频模型目录

适用场景

  • 从产品图快速制作社交和营销视频
  • 用图像引用保持角色一致的系列视频
  • 语音引用确保品牌语音一致性
  • 快速文生视频起草和迭代

优缺点

优势

  • 原生 1080p 生成——少数原生支持全高清的视频模型之一
  • 图像和语音引用确保角色/风格在片段间保持一致
  • Aurora 自回归引擎生成速度快(5–30 秒每片段)
  • API 定价 $0.08/秒——简单、可预测

局限

  • 无开放权重——闭源且仅 API 可用
  • 最长 15 秒——短于 FLUX 3(20 秒)和 Seedance 2.5(30 秒)
  • 引用功能美国优先——国际可用性滞后
  • 与 Grok LLM 分开——生成过程中无集成文本推理

常见问题

Grok Imagine Video 1.5 什么时候发布的?

xAI 于 2026 年 5 月 31 日推出 Grok Imagine Video 1.5(6 月 16 日 API 正式 GA)。2026 年 7 月 31 日重大更新增加了文生视频、原生 1080p 和图像/语音引用能力。

这和 Grok 聊天机器人一样吗?

不一样。Grok Imagine Video 1.5 是独立的视频生成模型,与 Grok LLM 聊天机器人完全分开。它们共享 xAI 品牌但服务于不同目的——视频模型生成片段,聊天机器人处理文本对话。

视频最长多久?

每片段 6 到 15 秒,24 FPS。支持 480p(草稿)和 720p/1080p 分辨率。提供七种宽高比。

来源

最后更新:2026-08-05 · 规格与价格变动很快——使用前请在厂商官网核实。