大模型

Black Forest Labs发布FLUX 3:统一多模态模型,支持视频、音频和机器人动作预测

发布时间:2026年08月16日 15:00:00

8月16日,Black Forest Labs发布FLUX 3,一个统一多模态生成模型,支持视频生成、音频合成和机器人动作预测。模型可生成20秒视频并带有原生音频,同时可用于机器人动作的预测和规划。FLUX 3将视频生成、音频合成和具身智能统一在一个模型中,是多模态生成模型向通用化发展的重要里程碑。


事件概况

8月16日,Black Forest Labs发布FLUX 3多模态生成模型。FLUX 3不是单一领域的模型,而是一个统一的多模态生成系统,同时支持视频生成、音频合成和机器人动作预测。这是多模态生成模型从"单任务专用"向"多任务通用"发展的重要里程碑。

FLUX 3核心能力

三大生成能力

能力详情
视频生成可生成20秒视频
音频合成视频带有原生音频
机器人动作预测支持机器人动作的预测和规划

统一架构

FLUX 3的关键创新在于统一架构:

  • 一个模型同时处理视频、音频和动作
  • 不需要为每种模态使用不同的模型
  • 模态之间可以互相增强(如视频+音频同步生成)
  • 降低了多模态应用的部署复杂度

技术亮点

20秒视频生成

  • 生成时长:20秒(远超多数视频生成模型的5-10秒)
  • 原生音频:视频自带同步音频,无需后期合成
  • 画质:高分辨率,细节丰富
  • 时序一致性:长视频中的物体和场景保持一致

机器人动作预测

FLUX 3最独特的能力是机器人动作预测:

  • 将视频生成能力扩展到物理世界
  • 预测机器人在特定场景中的动作序列
  • 可用于机器人运动规划
  • 连接了生成式AI和具身智能

原生音频

  • 音频与视频同步生成
  • 包括环境音、对话和音效
  • 不需要额外的音频生成模型
  • 提升视频内容的完整性

行业意义

多模态生成的通用化趋势

阶段特征代表
1.0单模态专用图像生成模型、视频生成模型
2.0跨模态组合图像+文本、视频+文本
3.0统一多模态FLUX 3(视频+音频+动作)

生成式AI与具身智能的融合

FLUX 3将生成式AI和具身智能统一在一个模型中:

  • 视频生成 → 理解视觉世界的动态
  • 音频生成 → 理解声音世界
  • 动作预测 → 理解物理交互

这种融合可能指向更通用的AI系统。

竞品对比

模型公司视频生成原生音频动作预测
FLUX 3Black Forest Labs20秒支持支持
SoraOpenAI未明确未明确不支持
Seedance 2.5字节跳动30秒未明确不支持
Veo 3Google未明确支持不支持
H3MiniMax2K立体声不支持

FLUX 3是首个将视频、音频和机器人动作预测统一的模型。

应用场景

视频创作

  • 20秒短视频生成
  • 带原生音频的完整视频
  • 适合广告、社交媒体和内容创作
  • 降低视频制作门槛

机器人训练

  • 生成机器人动作预测
  • 用于机器人运动规划
  • 在仿真环境中训练机器人
  • 加速具身智能研究

多模态内容生成

  • 视频+音频一站式生成
  • 虚拟场景创建
  • 游戏内容生成
  • 教育和培训内容

行业背景

Black Forest Labs

  • 由Stable Diffusion原始团队成员创立
  • 此前发布FLUX系列图像生成模型
  • FLUX 3是首个多模态统一模型
  • 定位为多模态生成领域的领导者

多模态生成竞争

多模态生成正成为AI竞争的新焦点:

  • OpenAI Sora:视频生成
  • Google Veo:视频+音频
  • 字节Seedance:长视频
  • MiniMax H3:高清视频+立体声
  • Black Forest Labs FLUX 3:视频+音频+动作

后续观察

FLUX 3的实际生成质量、机器人动作预测的准确性、以及开源策略,将是关键观察点。