大模型
Black Forest Labs发布FLUX 3:统一多模态模型,支持视频、音频和机器人动作预测
发布时间:2026年08月16日 15:00:008月16日,Black Forest Labs发布FLUX 3,一个统一多模态生成模型,支持视频生成、音频合成和机器人动作预测。模型可生成20秒视频并带有原生音频,同时可用于机器人动作的预测和规划。FLUX 3将视频生成、音频合成和具身智能统一在一个模型中,是多模态生成模型向通用化发展的重要里程碑。
事件概况
8月16日,Black Forest Labs发布FLUX 3多模态生成模型。FLUX 3不是单一领域的模型,而是一个统一的多模态生成系统,同时支持视频生成、音频合成和机器人动作预测。这是多模态生成模型从"单任务专用"向"多任务通用"发展的重要里程碑。
FLUX 3核心能力
三大生成能力
| 能力 | 详情 |
|---|---|
| 视频生成 | 可生成20秒视频 |
| 音频合成 | 视频带有原生音频 |
| 机器人动作预测 | 支持机器人动作的预测和规划 |
统一架构
FLUX 3的关键创新在于统一架构:
- 一个模型同时处理视频、音频和动作
- 不需要为每种模态使用不同的模型
- 模态之间可以互相增强(如视频+音频同步生成)
- 降低了多模态应用的部署复杂度
技术亮点
20秒视频生成
- 生成时长:20秒(远超多数视频生成模型的5-10秒)
- 原生音频:视频自带同步音频,无需后期合成
- 画质:高分辨率,细节丰富
- 时序一致性:长视频中的物体和场景保持一致
机器人动作预测
FLUX 3最独特的能力是机器人动作预测:
- 将视频生成能力扩展到物理世界
- 预测机器人在特定场景中的动作序列
- 可用于机器人运动规划
- 连接了生成式AI和具身智能
原生音频
- 音频与视频同步生成
- 包括环境音、对话和音效
- 不需要额外的音频生成模型
- 提升视频内容的完整性
行业意义
多模态生成的通用化趋势
| 阶段 | 特征 | 代表 |
|---|---|---|
| 1.0 | 单模态专用 | 图像生成模型、视频生成模型 |
| 2.0 | 跨模态组合 | 图像+文本、视频+文本 |
| 3.0 | 统一多模态 | FLUX 3(视频+音频+动作) |
生成式AI与具身智能的融合
FLUX 3将生成式AI和具身智能统一在一个模型中:
- 视频生成 → 理解视觉世界的动态
- 音频生成 → 理解声音世界
- 动作预测 → 理解物理交互
这种融合可能指向更通用的AI系统。
竞品对比
| 模型 | 公司 | 视频生成 | 原生音频 | 动作预测 |
|---|---|---|---|---|
| FLUX 3 | Black Forest Labs | 20秒 | 支持 | 支持 |
| Sora | OpenAI | 未明确 | 未明确 | 不支持 |
| Seedance 2.5 | 字节跳动 | 30秒 | 未明确 | 不支持 |
| Veo 3 | 未明确 | 支持 | 不支持 | |
| H3 | MiniMax | 2K | 立体声 | 不支持 |
FLUX 3是首个将视频、音频和机器人动作预测统一的模型。
应用场景
视频创作
- 20秒短视频生成
- 带原生音频的完整视频
- 适合广告、社交媒体和内容创作
- 降低视频制作门槛
机器人训练
- 生成机器人动作预测
- 用于机器人运动规划
- 在仿真环境中训练机器人
- 加速具身智能研究
多模态内容生成
- 视频+音频一站式生成
- 虚拟场景创建
- 游戏内容生成
- 教育和培训内容
行业背景
Black Forest Labs
- 由Stable Diffusion原始团队成员创立
- 此前发布FLUX系列图像生成模型
- FLUX 3是首个多模态统一模型
- 定位为多模态生成领域的领导者
多模态生成竞争
多模态生成正成为AI竞争的新焦点:
- OpenAI Sora:视频生成
- Google Veo:视频+音频
- 字节Seedance:长视频
- MiniMax H3:高清视频+立体声
- Black Forest Labs FLUX 3:视频+音频+动作
后续观察
FLUX 3的实际生成质量、机器人动作预测的准确性、以及开源策略,将是关键观察点。