FLUX 3: from video generation to robot control

TL;DR · AI 摘要
FLUX 3模型通过多模态训练实现视频生成与工业机器人控制,性能优于竞品。
核心要点
- FLUX 3在77%的对比中优于Runway Gen-4.5,生成20秒带音频视频
- 模型结合图像/视频/音频模态,支持工业机器人精准操作
- Black Forest Labs与mimic合作开发FLUX-mimic系统
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- FLUX 3技术应用
- 多模态能力
- 图像/视频/音频融合
- 跨模态信息约束
- 工业场景
- 奥迪机器人控制
- mimic系统集成
- 性能指标
- 77%胜率对比Runway
- 20秒视频生成
金句 / Highlights
值得收藏与分享的关键句。
FLUX 3在77%的对比中优于Runway Gen-4.5,69%优于Grok Imagine Video
模型能生成带同步多语言对话的20秒视频,保持跨镜头角色一致性
多模态联合训练使物体形变、材质特性等物理规律得以准确建模
FLUX 3:从视频生成到机器人控制
新闻
在奥迪生产实验室中,用于生成带音频的20秒视频的相同多模态主干模型正在工业操作任务中进行测试。
Air Street Press
和
Nathan Benaich
2026年7月27日
文章配音
0:00
-7:18
您的浏览器不支持音频播放。请升级浏览器。
在奥迪生产实验室中,机械臂将电子控制单元安装到精密工装中。当抓取失败时,机械臂会自我修正、重新抓取并完成任务。这台机械臂及其控制系统来自mimic,这是一家总部位于苏黎世的机器人公司,专注于为工业操作构建视频-动作模型。系统的核心是视频生成器的主干:FLUX 3,这是来自Black Forest Labs的新多模态基础模型。
FLUX 3被训练用于预测场景如何演变。要做好这一点,需要它学习并表征物体如何持续存在、材料如何变形,以及当一个物体与另一个物体接触时会发生什么。FLUX-mimic测试这些内部表征是否也能在现实世界中支持机器人控制。
作为Air Street的投资组合公司,Black Forest Labs上周发布了FLUX 3。该模型通过单一架构联合学习图像、视频和音频信息。每种模态都提供其他模态缺乏的信息:图像捕捉空间结构,视频增加时间和运动信息,音频有助于定位语音和撞击等事件。BFL正在将相同的底层模型扩展到动作预测,并通过选定的研究和商业合作伙伴提供该功能。
mimic同时发布了FLUX-mimic。该系统将FLUX 3的视频主干与mimic的机器人操作数据、动作解码器、硬件和部署栈相结合。FLUX 3视频功能现已开放早期访问,图像生成和编辑功能将很快推出,动作预测功能将通过选定合作伙伴提供,同时计划推出一个开源权重的多模态主干模型。该模型系列将进一步丰富BFL迄今为止超过5亿次下载的开源权重记录。
一个模型实现视觉、声音和动作的统一
新的视频模型通常通过成对的人类偏好测试进行评估:评分者观看由相同提示生成的两个视频片段,并选择更喜欢的一个。在BFL对10秒、720p带音频的文本到视频片段的初步评估中,FLUX 3在77%的对比中优于Runway Gen-4.5,在最多69%的对比中优于Grok Imagine Video,与最强系统相比差距较小:对Kling v3 Pro的胜率是60%,对Seedance 2.0和Gemini Omni Flash的胜率是52%。
该模型可以在单次生成中创建长达20秒的带音频视频。它可以从文本、图像或视频生成内容;在多镜头序列中保持角色和其他视觉参考;渲染字体;并用多种语言生成同步对话。
生成令人信服的视频需要对场景有内部理解。当物体移出画面时必须持续存在。电缆必须在手部握持处弯曲。零件卡入外壳时的声音应与掉落地板时不同,且声音必须与可见的撞击同步。联合训练使每种模态都能相互约束:
FLUX 3 在数千万小时的通用视频数据上进行训练,其中包含数万小时专注于人类和机器人操作的视频。生成质量展示了模型所学到的内容,而机器人实验则检验这些知识是否足够可访问以指导行动。
从预测到行动
FLUX-mimic 在 FLUX 3 视频预测路径提取的中间特征上放置了一个轻量级动作解码器。主干网络形成对场景如何演变的预期,而解码器将这种表示转化为机器人动作片段。它在推理时从不生成视频,因此一个动作片段只需通过主干网络进行一次前向传递,而不是完整的视频生成。
在柔性物料装配任务中,mimic 使用真实机器人对预览版本进行了基准测试。该公司报告称,在未进行单任务微调或后训练的情况下,成功率达到了 95%,相比之下,使用相同数据混合训练的适应版 π0.5 模型成功率仅为 55%,而针对该任务进行过密集后训练的 flow-matching 策略成功率则为 70%。
另一个消融实验更揭示了表示本身的特性。在冻结 FLUX 主干网络的情况下,FLUX-mimic 仍保持竞争力,而 π0.5 动作解码器则未完成任何任务。结果表明,有关操作的有用信息已经在预训练视频主干网络中存在,无需针对特定任务进行调整即可使用。
系统还需要足够快速的响应速度来控制物理机器。BFL 表示,FLUX-mimic 主干网络可以优化为在单个 NVIDIA RTX 5090 上以不到 80 毫秒的时间完成从输入到内部表示的处理。通过进一步优化动作解码器、传感器与模型、执行器之间的进程路径,以及实时重叠预测与执行的动作分块处理,整个系统的反应时间可缩短至 101 毫秒。
奥迪生产实验室已在真实生产场景中测试并部署了该系统。应用场景包括将零件装配到结构化托盘中、将电子元件插入紧密配合的夹具、组装组件,以及操作柔性材料(如密封件和电缆),mimic 将这些材料描述为传统自动化从未能处理的物料。
奥迪生产实验室的 Christoph Schneider 表示:“我们看到这些机器人解决了传统机器人根本无法完成的复杂柔性物料操作任务。”
通向物理智能的道路
常读者会认出这个论点。当 Odyssey 上个月完成 3.1 亿美元 B 轮融资时,我们曾写道,机器智能的下一次突破可能来自能够构建世界、在其中行动并学习现实规律的系统。FLUX-mimic 将这一论点带到了工厂车间:通过视频生成学到的表示正在被用来控制执行工业操作的机器人。
我们通过 Air Street 新投资机会的流动看到了这一现象的另一面。仅在今年,我们接触到的二十多家机器人公司中,有一半正在构建操作策略,且它们大多已收敛到相同的 VLA 风格架构。但差异最终归结于数据。远程操作演示需要逐项收集,生产过程缓慢且成本高昂,当任务发生变化时其迁移效果较差。一个已编码物体行为规律的骨干架构改变了小型团队需要投入的资源:世界知识来源于已有的视频,而演示预算则用于最后阶段的优化。这正是冻结骨干架构成果的亮点所在,而开放权重特性意味着它能够赋能整个机器人开发生态系统。
FLUX 3 Video 现已开放早期访问。图像生成与编辑功能将随后推出,同时将提供动作预测的合作伙伴访问权限,以及多模态骨干架构的开放权重版本。
上一页
下一页