斜杠中年斜杠中年AI × 沟通 × 商业 × 人生
AI 研究

FLUX 3 通用世界模型:Black Forest Labs 打造图像、视频、音频与动作的统一基础

Black Forest Labs 发布 FLUX 3 —— 一个从底层联合训练图像、视频和音频的多模态基础模型。采用 Self-Flow 训练方法,支持最长 20 秒带原生音频的视频生成,并延伸至物理 AI 的动作预测。现已开启早期访问。

2026-07-24更新: 2026-07-248 分钟阅读Wesley Chong
#FLUX 3#Black Forest Labs#多模态模型#Self-Flow#视频生成#物理 AI
FLUX 3 通用世界模型:Black Forest Labs 打造图像、视频、音频与动作的统一基础|AI 研究 封面图

摘要

FLUX 3 是第一个完全从零开始构建的统一多模态架构模型——不是把独立的图像和视频模型拼凑在一起。它联合训练图像、视频和音频三种模态,同时生成所有内容,甚至能预测机器人动作。目前已开放早期体验。

一句话总结

FLUX 3 给出了一个明确的答案:图像、视频、音频和机器人动作根本不是各自独立的问题——它们是同一物理现实的不同投影。一个同时学习所有这些模态的模型,自然会发展出任何单模态模型都无法企及的世界理解能力。

联合训练,而非拼凑而成

FLUX 3 最大的概念转变不在于分辨率或速度——而在于训练哲学

过去的模型是一种模态一种模态地学:先训练图像模型,再加视频,最后挂上音频。每个新能力都需要架构改动和从头训练或大量微调。结果是能用的,但根本上是碎片化的——模型没有学到"声音必须匹配撞击"、"运动必须服从物理规律",因为它从未同时看到这些约束的表达。

FLUX 3 改变了前提假设:没有任何单一模态能提供对现实的完整描述。

图像捕捉的是某个冻结瞬间的空间结构和关系。视频恢复了时间维度,揭示物理定律。音频揭示了机械现象和声学之间的因果关系——这是纯视觉无法检测到的。语言将这些感知与目标和指令联系起来。当一个模型同时学习所有这些时,它们之间的相互约束告诉了我们任何单一模态都无法单独揭示的东西:未来必须从过去延续而来,声音必须匹配冲击,运动必须服从质量。模态不再是独立的,而是成为同一个底层现实的不同证据。

这就是 FLUX 3 背后的核心洞察——而它由 Self-Flow 驱动,BFL 对齐多模态生成与理解的训练方法。

FLUX 3 到底能做什么

FLUX 3 原生混合多种模态。它从同一个骨干生成图像、带音频的视频,并编辑两者。关键能力包括:

视频(含原生音频)

  • 文字到视频:最长 20 秒,含同步音频
  • 图片到视频:从静态帧启动画
  • 视频到视频:从参考片段进行风格/内容迁移
  • 生成式续写:扩展已有视频+音频片段
  • 关键帧到视频:受控的场景过渡
  • 多语言对话:角色用多种语言说话
  • 风格多样性:从手持录像到动画到电影级画面全覆盖
  • 强排版能力:高质量文字生成和动态文本设计
  • 智能链接:将单段片段拼接成持续数分钟的多镜头序列

BFL 在初步评估中生成了 10 秒 720p 文字到视频片段(含音频)。目前 视频生成门户已开放早期体验。

图像合成与编辑

  • 丰富的风格、宽高比和分辨率选择
  • 相比之前 FLUX 版本,复杂提示的处理能力显著提升
  • 多国语言文字高精度渲染
  • 图像能力的早期体验预计在未来几周内开放

动作预测(物理 AI)

这才是有趣的地方。FLUX 3 的世界理解不只生成像素——它还预测动作。BFL 展示了两条路径:

  1. 原生集成:通过扩展 Self-Flow 训练直接将动作预测融入 FLUX 3
  2. 基础微调:利用预训练的视频骨干,用有限的特定任务数据微调专门的动作模型

mimic robotics 是其中的旗舰案例:他们用 FLUX 3 的骨干加上自身的灵巧操作专长,构建了 FLUX-mimic。结果?在奥迪生产线上运行的真机器人,解决传统自动化无法完成的难题(软体材料操控、密封条和电缆等柔性物料)。阅读我们的 FLUX-mimic 专题文章获取完整解析。

Self-Flow:让这一切成为可能的训练方法

FLUX 3 基于 Self-Flow,它解决了一个生成式 AI 中的根本矛盾:生成模型产生高质量的 world model,但通常具有纠缠的、难解码的特征表示。同时,专门的表征学习方法产生干净、解耦的特征,但缺乏现实模拟所需的生成能力。

Self-Flow 统一了这两个目标。更好的生成 → 更好的 world model → 更好的特征 → 更容易解码用于下游任务 → 更好的动作预测。这些改进是相互促进的:

| 指标 | Self-Flow | 流匹配(基线) | |---|---|---| | 生成误差(Fréchet 距离) | 各模态均更低 | 归一化为 100 | | 机器人操作成功率 | 微调后更高 | 基线 |

视频生成占总计算成本的 95% 以上,既是主要训练开销来源,也是最终世界表示质量的主导因素。

FLUX 3 视频测评对比

BFL 的初步测评(仍在开发中)在人类判断测试中表现出强劲的偏好率:

| 竞品 | FLUX 3 更优比例 | |---|---| | Luma Ray 3.2 | 93% | | Runway Gen-4.5 | 77% | | Grok Imagine Video | 69% | | Kling v3 Pro | 60% | | Happy Horse v1 | 59% | | Happy Horse 1.1 | 57% | | Seedance 2.0 | 52% | | Gemini Omni Flash | 52% |

这些数据仍是模型积极开发阶段的初步结果。BFL 明确表示希望在早期体验阶段继续改进——但竞争格局表明这确实是一次显著的质量飞跃。

FLUX 3 Video 在人类面部表情、声事关联和多语言方面尤其出色。这些优势值得注意,因为面部表情保真度需要真正的时序建模(而不只是好看的静态帧),多语言能力意味着模型学会了跨模态语言映射——它知道不同语言和视觉线索搭配时听起来是怎样的。

发布路线图

未来几周至几个月内,BFL 将分阶段推出 FLUX 3:

  1. FLUX 3 Video — API + 私有权重访问,视频+音频生成和编辑 (当前早期体验中)
  2. FLUX 3 Action — 仅限选定研究/商业合作伙伴,从 mimic robotics 开始 (进行中)
  3. FLUX 3 Image — API + 私有权重访问,图像合成和编辑 (即将推出)
  4. FLUX 3 Dev — 开放权重,覆盖完整的多模态骨干 (计划中)

所有能力共享同一底层架构。与当前每种模态独立 checkpoint 的做法不同,FLUX 3 是一个模型的多个面孔。

BFL 下一步做什么

公司的野心不止于联合生成。他们的既定目标是统一感知、动作和语言预测在一个单一模型中——本质上是一个通用的智能骨干,能够看、行动和推理。交互式图像和视频编辑、模拟环境、计算机使用和物理 AI 都被明确列为应用方向。

他们同时在德国和美国招聘,并着手下一代模型的研发。

超越炒作的意义

FLUX 3 代表了基础模型设计方式的一个结构性转变。业界花了多年时间构建"模态逐个"架构——图像生成器、视频生成器、语音合成器、动作预测器——各有自己的训练流程和评估指标。FLUX 3 的理念说:别再把这些当成独立问题,把它们视为同一底层现实信号。

证明不仅仅在于生成质量——尽管早期结果已经很强。关键在于共享表征使什么成为可能:一个既能生成逼真视频又能预测机器人动作的模型,不是在做两件事,而是在展示一种统一的因果理解和物理因果关系理解——这是任何碎片化架构都做不到的。

对于关注这个领域的开发者和创作者,含义很直接:你用于内容创作的工具正在变得越来越像对物理世界的理解工具。"生成式 AI"和"理解式 AI"之间的界限正在消融——而 FLUX 3 是这个方向上最清晰的里程碑之一。

延伸阅读

常见问题

FLUX 3 跟之前的 FLUX 模型有什么不一样?

之前的 FLUX 版本是单模态的(仅图像)。FLUX 3 从第一天起就是统一的多模态模型,联合训练图像、视频和音频——不是在已有模型上后来叠加的。这意味着它的世界理解能力来源于模态之间的相互约束,而不是事后补丁。

视频生成的时长是多少?

FLUX 3 单次生成最长 20 秒的视频,并原生生成配套音频。视频还可以通过智能链接(agentic chaining)拼接成多镜头序列,持续数分钟,用视觉参考保持角色在不同场景中的一致性。

FLUX 3 会开源吗?

计划发布开放的 FLUX 3 Dev 版本,涵盖内容创作(图像、视频、音频)和动作预测。目前早期体验主要通过 API 和限定合作伙伴(如 mimic robotics)获取私有权重访问权限。

什么是 Self-Flow?为什么重要?

Self-Flow 是 BFL 的训练框架,将多模态生成与表征学习统一起来。传统 Flow Matching 只优化生成质量,而 Self-Flow 同时改善模型内部特征的解码可用性——结果是生成质量和下游任务表现(如机器人控制)双提升。

分享这篇文章 / Share Article
Wesley Chong

作者

Wesley Chong

来自马来西亚居銮的软件开发者、数字顾问、Toastmasters 讲员。

专注帮助普通人用 AI 升级沟通、表达、商业与人生。

相关阅读