FLUX 3 是 Black Forest Labs 2026 年 7 月 23 日从图像生成迈向全面多模态视觉智能的一步。FLUX.2 仅限图像,而 FLUX 3 是单一统一模型,联合学习图像、视频和音频——生成带声音的视频、编辑图像、渲染可读文字甚至预测机器人动作,全部基于同一组权重。
核心能力:单次生成最长 20 秒带原生同步音频的视频——这是 BFL 首次做到,与 Veo 3.1 和 Seedance 2.0 的最长片段持平。模型基于 Self-Flow(BFL 跨模态自监督流匹配方法),已在 Canva、Burda、Magnific、Krea 和 Picsart 测试使用。
可用状态
截至 2026 年 8 月 5 日:
| 能力 | 获取方式 | 状态 |
|---|---|---|
| FLUX 3 Video(视频 + 原生音频) | BFL API + 合作伙伴 | 已正式 GA(2026-08-04) |
| FLUX 3 Action(机器人动作预测) | 指定研究与商业伙伴 | 进行中 |
| FLUX 3 Image(图像合成 + 编辑) | API + 私有权重 | 未来几周推出 |
| FLUX 3 Dev(开放权重全模态骨干) | 开放权重 | 计划中——时间未定 |
定价(FLUX 3 Video)
2026 年 8 月 4 日公布。所有层级均含音频。
| 模式 | Draft (HD) | HD (720p) | Full HD (1080p) |
|---|---|---|---|
| 文生视频 / 图生视频 | $0.06/s | $0.17/s | $0.29/s |
| 视频到视频 | — | $0.41/s | $0.53/s |
视频生成
支持多种生成模式:文本到视频、图像到视频、视频到视频、关键帧过渡、多语言对话生成,以及智能体驱动的多镜头片段串联构建更长叙事。
BFL 特别强调模型在人脸表情、声音与物理事件匹配和多语言能力上的优势。
横向对比
- vs FLUX.2: FLUX.2 仅限图像;FLUX 3 用同一模型新增视频、音频和动作预测。FLUX.2 [dev] 开放权重已可用;FLUX 3 Dev 权重计划中但未定时间。
- vs Seedance 2.0 / Seedance 2.5: Seedance 在 AA Video Arena 盲测中领先。FLUX 3 宣称更高 Elo,定价从 $0.06/s(Draft)起,已 GA。
- vs MiniMax H3: H3 提供开放权重(33B,本地 768p)和更广泛的引用系统。FLUX 3 宣称更高 Elo,最长 20 秒(vs 15 秒),但无开放权重。
- vs Grok Imagine Video 1.5: Imagine Video 1.5 提供原生 1080p 和语音引用,$0.08/s。FLUX 3 支持更长片段和更多生成模式,但 HD 质量更贵($0.17/s)。
- vs Veo 3.1: Veo 以 $0.40/s 生成带原始音频的视频。FLUX 3 以更低成本($0.17/s HD)匹配时长和原生音频,且已 GA。
适用场景
- 文本到视频和图像到视频生成,带原生音频
- 关键帧到视频过渡
- 智能体驱动的多镜头片段串联
- 机器人动作预测(FLUX-mimic,已在 Audi 测试)
优缺点
优势
- 单一统一模型同时生成视频、图像、音频和动作预测——非拼凑管线
- 单次生成最长 20 秒视频带原生同步音频
- 在人脸表情、声音-事件匹配和多语言对话上表现突出
- 计划发布开放权重 FLUX 3 Dev 骨干——延续 BFL 开放传统
局限
- 视频已 GA 但图像生成尚不可用
- 图像生成尚不可用(未来几周推出)
- 基准尚未公开——"完整结果与方法将伴随更广泛可用性发布"
- 开放权重时间表未确认
常见问题
FLUX 3 什么时候发布的?
Black Forest Labs 于 2026 年 7 月 23 日发布 FLUX 3 Early Access。FLUX 3 Video 于 2026 年 8 月 4 日正式 GA 并公布定价。FLUX 3 Image 和开放权重 FLUX 3 Dev 骨干将稍后推出。
FLUX 3 与 FLUX.2 有什么不同?
FLUX.2 仅生成图像。FLUX 3 是统一多模态基础模型,使用 Self-Flow(自监督流匹配)联合训练图像、视频和音频。它能生成最长 20 秒带原生音频的视频,同时支持图像生成甚至机器人动作预测——全部基于同一组权重。
FLUX 3 视频最长能有多长?
单次生成最长 20 秒,带原生同步音频。支持文本到视频、图像到视频、视频到视频、关键帧过渡、多语言对话和智能体驱动的多镜头串联。
FLUX 3 会开源吗?
BFL 计划发布用于图像、视频、音频和动作预测的开放权重 FLUX 3 Dev 骨干。时间表未确认。分阶段推出顺序为 Video/Action → Image → Dev 权重。