一句话总结
FLUX 3 回答了这个问题:一个基础模型能否同时做所有事——从同一个骨干生成逼真图像和视频、产生同步音频、预测机器人动作?与 mimic robotics 合作的 FLUX-mimic 项目展示了它在奥迪真实工厂机器人上的运行情况。
理解物理现实的基础模型
当 FLUX 3 首次公布时,焦点是多模态内容生成——由单一架构产生的图像、视频和音频。但研究论文中真正突破性的东西没那么花哨:视频是教会模型理解世界行为的东西。
要生成逼真的视频,模型必须学会接触、运动、重量、因果关系。任何一个环节出错,视频看起来就不对。没有捷径可走。通过强制模型在训练中学习这些动力学规律,FLUX 3 吸收了对物理现实的表征——而这种表征恰好可以解码为机器人动作。
正如 BFL 所说:
"如果一个模型同时做两件事【生成像素和控制机器人】,那它从来就不只是一个内容创作模型。它是理解世界如何运行的模型,而内容创作只是它能做的事之一。"
这个视角改变了所有事情。业界一直将视觉生成和物理 AI 视为需要不同模型的独立问题。FLUX 3 的论点是:它们是同一种底层能力,只是解码方式不同。
为什么视频是最难的部分(也是最关键的)
音频相对简单——维度低,在 720p 视频中所占 token 不到 0.5%。一旦模型学会了视觉理解,它自然就能建立起视频和音频之间的因果关系:唇语同步说话、声音效果匹配物理事件。
但视频呢?要准确预测下一帧,模型必须理解:
- 物体如何在空间中随时间移动
- 重力和动量的运作方式
- 物体接触或碰撞时会发生什么
- 材料如何变形、拉伸或断裂
那不是渲染——那是世界模拟。而一个理解了因果关系的 world model 可以被多种方式使用:渲染像素帧,或者输出机器人关节的动作向量。
视频预测占 FLUX 3 总计算成本的 95% 以上。它是最难训练的模态,正因如此它最有价值。模型不是因为我们想让它生成片段才学视频的——我们让它学视频,是因为只有这种级别的训练才能产生对其他一切有用的表征。
动作预测如何融入同一骨干
整合的故事很有启发性。当 BFL 在 FLUX 3 的训练课程中加入动作预测时,他们观察到了看似暂时的性能回退:
- 文字到视频的真人评分最初下降了多达 10%
- 大约经过 3,500 个额外步骤后,质量恢复到超越基线
- 从那时起,模型既能生成视频也能预测动作
没有永久的容量交换。模型只需要学习新的动作模态如何与其现有的世界模型关联。一旦这个映射搞清楚了一切共存。
这直接向当前物理 AI 的主流方法提出了挑战——研究人员通常取一个冻结的视觉语言模型然后外挂动作解码器。FLUX-mimic 做了更优雅的事:它在一个轻量级动作解码器上训练,直接在 FLUX 3 视频预测路径中提取的中间特征上工作。动作解码器从已经结构化为表达世界动力学的特征中学习。
Self-Flow:贯穿始终的训练方法论
FLUX 3 基于 Self-Flow,BFL 将生成和表征学习统一的框架。原理简洁但强大:生成模型中的表征改进应该提升生成质量(世界模型变得更精确),而更好的生成应该改善表征质量(特征变得更加解耦和可解码)。
BFL 对比 Self-Flow 和传统流匹配(Flow Matching)的基准测试显示:
- 更低的生成误差覆盖视频、图像和音频各模态
- 微调后更高的机器人操作成功率
- 各项改进齐头并进,而非互相牺牲
结果:FLUX-mimic 的动作解码器即使在完全冻结的 FLUX 骨干上也超越了以前的视觉-语言-动作模型——在这个设定下,竞争方案完全无法成功。微调骨干则进一步将性能推向最前沿。
从实验室到生产线
这不是模拟练习。mimic 将 FLUX-mimic 部署在真实机器人上,运行真正的奥迪生产任务:
- 零件装箱:将零件装入结构化托盘
- 插入电子控制单元:将 ECU 插入紧凑夹具
- 组装组件:各个部件拼装
- 处理软性、柔性材料:如密封条和电缆——传统自动化从未能够处理的领域
最后一项尤其重要。软体操控是工业机器人领域数十年来未解决的难题。传统自动化在这里失败,因为不存在可以利用的刚性几何结构。一个从视频中学习过世界动力学的模型可以直观地推理材料变形——而基于规则的系统在此撞墙。
奥迪生产实验室的 Christoph Schneider 直言不讳:
"我们看到这些机器人解决了传统机器人根本无法完成的复杂软体操控工作。"
样本效率:更少数据,更快学习
对开发者和机器人工程师最实用的一个启示:**FLUX-mimic 达到给定成功率所需的训练步数仅为没有 Self-Flow 的视频模型的一半。**世界表征越好,你需要的演示数据就越少。
加上 mimic 报告的 10 倍样本效率提升(相比视觉-语言-动作模型),FLUX-mimic 将这些收益相乘——不是相加。这很重要,因为收集真实世界的机器人演示既昂贵又繁琐,有时还很危险。如果只用 1/20 的数据就能做到,机器人训练的经济账就会彻底改变。
模型还表现出自然的故障恢复:一个抓取失败的机器人会自我纠正、再次尝试并完成任务,使用的是从未被明确演示过的行为。这种自发涌现的稳健性来自拥有深层世界模型而非记忆的任务序列。
延迟:快得足以真正行动
工厂部署设置了一个硬性约束——模型必须跟上物理世界的速度。FLUX-mimic 实现了:
- 不到 80 毫秒从输入到世界表示(单张 NVIDIA RTX 5090)
- 101 毫秒端到端系统反应时间(全优化)
- 与人类视觉反应时间相当
光看 80 毫秒这个数字可能很厉害,但你还没意识到全链路——传感器读取、进程间通信、动作解码、致动器——会添加显著开销。mimic 的优化贯穿整个管线:削减进程间延迟、实时分块使预测和执行重叠、定制动作解码器调优。结果是一个自包含的系统,在运行中不会卡顿或抖动。
这对 AI 内容创作意味着什么
BFL 刻意描绘的叙事弧线是:**内容创作和物理 AI 是同一个基础模型的两个输出。**一个生成像素;另一个生成关节命令。但它们共享相同的骨干和相同的世界理解。
对于今天用生成式 AI 做事的人——无论制作视频内容、生成产品图设计还是创建交互体验——含义值得认真思考:越来越擅长生成媒体的模型同时也在更好地理解现实。而且这种理解是双向流动的:更好的世界模型做出更好的内容(更符合物理规律),而被要求生成内容则迫使模型更好地建立世界模型(通过因果推理)。
这种融合表明,你为视觉生成所学的工具和技术将越来越多地转移到你可能没想到它们能用的场景里。
快速对比:FLUX-mimic 的定位
| 能力 | FLUX-mimic | 以前的 VLA 模型 | 传统自动化 | |---|---|---|---| | 骨干训练 | 联合多模态(图像+视频+音频+动作) | 视觉语言冻结后外挂动作解码器 | 基于规则的编程 | | 软体处理 | 支持(已演示于生产环境) | 不可靠 | 不支持 | | 冻结骨干性能 | 超越竞争对手 | 基线 | 不适用 | | 反应时间 | 101ms 端到端 | 不等(通常更慢) | 实时但僵化 | | 样本效率 | 比先前方法好 10–20 倍 | 基线 | 需要完整重新编程 | | 物理合理性 | 从视频动力学中学习 | 仅从图像中学习 | 硬编码 |
延伸阅读
- FLUX 3 博客原文 — 原始的多模态基础模型发布
- Self-Flow 研究 — 统一的生成+表征训练框架
- mimic Robotics — 构建全栈机器人部署的公司
- mimic 发布 FLUX-mimic — 从机器人视角解读这次合作
更大格局
"创意 AI"和"物理 AI"之间的分野一直让我觉得人为。两者本质上都需要理解世界如何运作——只是通过不同的通道表达。BFL 的 FLUX-mimic 把这个说清楚了:一个既能生成电路板组装的逼真视频又能组装电路板的模型。
对于马来西亚的开发者和创作者来说,最实际的启示是:你内容创作工作流背后的模型正在成为世界模型。这个转变没有让生成式 AI 变得没价值——它让 AI 比以往任何时候都更强大。关键在于学会用你现有的工具去解决之前解决不了的问题。
不管是在虚拟展厅中物理模拟产品,还是——多年之后——训练真正理解因果关系而非仅仅模式的机器人,方向是清晰的:一个模型,一个理解,多种输出。


