文章摘要
FLUX 3是BFL推出的多模态基础模型,与mimic robotics合作开发出视频动作模型FLUX-mimic,已部署在奥迪机器人上。该模型能同时生成视听内容并理解物理世界,本质是世界行为模型,视频训练占其95%以上。
文章总结
好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。
标题:FLUX 3 x mimic:新一代视频-动作模型
FLUX 3(我们新的多模态基础模型)的早期版本现已应用于机器人。我们向mimic机器人公司提供了FLUX 3的早期访问权限。结合mimic在机器人学习和部署方面的优势,以及FLUX模型的世界知识和BFL的基础模型专长,我们共同打造了FLUX-mimic:新一代的视频-动作模型。
FLUX
FLUX 1和FLUX 2用于生成图像。FLUX 3扩展至多模态,能联合生成视听内容,并同时为FLUX-mimic提供了基础。FLUX-mimic是一个视频-动作模型,由我们与mimic合作开发,其驱动的机器人已在奥迪公司完成测试和部署。
乍看之下,生成逼真的视觉内容与控制机器人似乎关联不大。前者需要生成像素,后者则需要理解物理世界在被触摸和操控时如何响应。如果一个模型能同时做到这两点,那么它本质上就不仅仅是一个内容创作模型。它是一个关于世界如何运作的模型,内容创作只是其应用之一。FLUX 3正是这样的模型。
视频是难点
FLUX 3是一个从零开始联合训练图像、视频和音频的单一模型。训练中最具挑战性的部分——占总计算成本的95%以上——是视频预测。为了生成逼真的视频,模型必须学习接触、运动、重量、因果关系;任何一点出错,视频看起来就会不真实。准确渲染世界意味着学习世界如何运作。
相对而言,音频是较简单的模态。其维度低,细节远少于视频,在720p带音频的视频中,音频仅占不到0.5%的token。一旦模型完成了学习视频理解的艰巨任务,它就能学习视频与音频之间的因果关系,从而预测与嘴唇动作同步的语音,以及与引发声音的物理事件同步的音效。
动作遵循相同的模式:它是机器人状态的低维表示,与视觉观察紧密耦合。动作、音频和视频帧都是同一底层物理现实的部分表征。在模型学习了视频和音频背后的物理过程后,动作预测并非全新的开始——它只是模型已建模的现实世界的另一个视角。
单一主干网络
如果这个框架是正确的,那么教会FLUX 3预测动作不应产生持久的成本:我们预计会有一个短暂的扰动期,在此期间模型需要学习动作空间的结构,并将其内部世界表征与之对齐,之后性能将恢复如初。这正是我们观察到的现象。
在一次大规模训练中,我们将动作预测加入训练课程,并观察其对视频生成质量的影响。在文本到视频和图像到视频任务上的人工评分最初下降了多达10%,因为模型开始整合新的动作模态。但在3500步训练后,模型在视频生成任务上完全恢复了之前的质量,同时还能预测动作。
模型必须将动作整合到其输入和输出中——但这并未永久性地消耗其容量。它只需要学习这种新模态如何与其现有的世界模型相关联。一旦解决了这个问题,对其现有能力的性能惩罚就消失了。视频生成和动作预测不需要各自独立的基础。同一个主干网络承载了这两者。
这使得物理人工智能成为我们Black Forest Labs路线图的自然延伸,而非方向的改变。内容创作是我们的多模态FLUX 3主干网络在图像、视频和音频上的应用。物理人工智能则是它在动作上的应用。一个以视觉智能为核心的基础模型,催生了两个应用系列。我们并没有构建一个独立的基础模型。我们专注于最困难的事情:构建一个理解世界的模型。而在这个世界中行动,正是这种理解所带来的可能。
从实验室到现实:FLUX-mimic
当我们把FLUX 3主干网络应用于真实生产线上的自动化任务时,会发生什么?
这正是mimic和BFL创建FLUX-mimic要回答的问题。mimic制造自己的机器人,并在机器人学习、灵巧操作和生产部署方面拥有专长;BFL则构建视觉基础模型,并在多模态训练和建模方面拥有专长。我们共同构建了用于通用操作的新一代模型——它适应了工业需求,并集成到mimic的全栈部署系统中。FLUX-mimic是一个基于FLUX 3主干网络构建的视频-动作模型。
解码学到的世界模型
我们的论点是,FLUX 3必须学习一个世界的内部表征才能生成视频。FLUX-mimic贯彻了这一论点,并从FLUX主干网络学到的世界表征中解码出动作。这种方法由mimic-video首创,它在从FLUX视频预测路径中提取的中间特征之上,训练一个轻量级的动作解码器。
这种方法成功与否取决于两个相关但不同的方面:FLUX学到的世界模型的质量,以及这个世界模型的特征表征的质量。世界模型的质量与生成质量直接相关:如果模型不理解世界如何运作,它就无法模拟世界。然而,即使是最好的世界模型,如果其特征空间以非线性方式纠缠了模态间的因果关系,那么从特征表征中理解这些关系仍然和从原始输入中理解一样困难——表征质量至关重要。
长期以来,生成质量和表征质量一直被孤立地研究和处理。生成方法能产生高质量的世界模型,支持模拟,并展现出计算投资回报的可预测缩放定律。然而,与更专门化的表征学习方法相比,它们产生的表征解缠性较差,这限制了它们在需要世界理解的任务上的实用性。
由于生成模型本身也依赖自身的特征,这种表征质量上的差异似乎有悖直觉。生成模型内部改进的表征应能提升其世界模型的质量,并使其更易于用于下游任务。在我们的工作Self-Flow中,我们展示了如何在单一框架内统一生成和表征学习,并观察到了这种互惠的改进:世界模型得到改进(通过视频、图像和音频的生成质量衡量),其表征质量也得到提升(通过模拟中机器人控制任务的成功率衡量)。
扩展世界模型
缩放定律在Self-Flow中依然成立,而FLUX 3正是其应用:它是Self-Flow的规模化版本。它使用数千万小时的通用视频内容进行训练,以尽可能广泛地学习世界动态;并使用数十万小时专注于人类和机器人操作任务的视频内容进行训练,以准备好作为视觉智能的主干网络。这种规模化将Self-Flow的成功从实验室带到了现实。mimic在真实的工厂用例中部署了FLUX-mimic,这些用例涵盖了生产和物流工作的日常现实:将零件分拣到结构化托盘、将电子控制单元插入紧密配合的夹具、组装组件,以及处理密封件和电缆等柔软、柔性材料——这些是传统自动化从未能触及的。
基准测试表明,即使FLUX主干网络完全冻结(在此设置下,先前的视觉-语言-动作模型无法成功),其动作解码器的性能也优于先前的视觉-语言-动作模型。这突显了规模化如何赋予我们的主干网络强大的世界知识以及在其中行动的知识,以及Self-Flow如何使这些知识易于从主干网络的特征表征中解码。当主干网络与动作解码器一起微调时,FLUX-mimic达到了最先进的成功率。
从世界知识到可执行任务
一个以可解码表征形式展现世界知识的主干网络,改变了教会机器人新任务所需的条件。如果物理规律已经存在于表征中且易于访问,那么适应一个新任务就不再是教模型世界如何运作——它只需要学习这个特定任务如何映射到它已知的知识上。昂贵的部分在机器人移动之前就已经完成了。
这直接体现在新任务所需的示范数据量上。在我们的Self-Flow实验中,与没有Self-Flow的视频模型相比,动作预测达到给定成功率所需的训练步骤减少了一半——更好的表征使世界知识更易于提取,因此达到相同能力所需的数据更少。mimic-video论文报告称,视频-动作模型相比视觉-语言-动作模型,样本效率提高了多达10倍;FLUX-mimic结合了这两种效果。
同样的优势也体现在行为上。FLUX-mimic能自然地从失败中恢复:一个抓取失败的机器人会自我纠正,再次抓取,并完成任务。没有任何示范集能涵盖任务可能出错的所有方式。从未被示范过的恢复能力必须来自其他地方——来自一个已经知道世界如何运作的模型。
足够快的行动速度
现实世界的部署设定了一个硬性约束:模型必须像世界移动一样快地行动。FLUX-mimic的主要计算成本在于主干网络。它是模型中最大的组件,在mimic优化的部署栈中,其延迟实际上设定了整个系统的上限。
这正是我们的方法论第二次带来回报的地方。更好的表征意味着每个参数有更强的能力:一个学习了结构良好的世界模型的模型,要达到给定性能水平所需的容量比未学习的模型更少。对于部署而言,这直接转化为能够运行更小的主干网络——而更小的主干网络是更快的网络。
因此,FLUX-mimic的主干网络可以优化到在单个NVIDIA RTX 5090 GPU上,从输入到世界表征的延迟低于80毫秒——这与人类的视觉反应时间处于同一数量级。
现实世界的部署需要对整个部署栈进行额外优化,以避免增加任何额外延迟:mimic的优化范围从动作解码器,到削减传感器、模型和执行器之间的进程间延迟,再到实时分块处理,使得预测和执行重叠进行,从而保持机器人平稳运行而无抖动。最终结果是一个反应时间为101毫秒的自包含机器人系统。
在工厂车间
所有这一切都回到了自动化至关重要的地方:工厂。奥迪运营着汽车行业最自动化的生产网络之一——这使其对传统自动化仍然止步的地方有精确的认识。尽管在机器人技术方面投资了数十年,但涉及柔性零件和精细操作的任务仍然依赖人工,这主要是出于经济原因:高端生产的变体多样性使得传统编程的机器人单元为每种情况重新设计的成本过高。基于学习的系统改变了这种计算方式。
“与mimic合作,奥迪一直在测试和部署FLUX-mimic。我们看到这些机器人解决了复杂的软体操作工作,这些工作使用传统机器人技术是完全不可能的。这可能在协助我们的员工、提高效率以及在生产与物流运营中扩展灵活自动化方面产生重大影响。对我们来说,与mimic和Black Forest Labs这样的先驱公司合作,对于推动物理人工智能的前沿并在真实生产环境中验证这些创新至关重要。”——克里斯托夫·施耐德,奥迪生产实验室
结语
FLUX-mimic是一个专门构建的机器人模型——也是未来发展的一个证明。其样本效率和鲁棒性源于FLUX 3主干网络及其所展现的表征质量,而非特定任务的工程技巧。这正是该方法能够跨任务、跨行业、跨硬件进行迁移的原因。
一个以视觉智能为核心的模型,既能生成图像、视频和音频,也能驱动生产线上的机器人。内容创作和物理人工智能是同一个基础模型的两个应用。
评论总结
根据评论内容,主要观点和论据总结如下:
正面评价(认可度较高)
- 评论1(rlupi)赞赏欧洲初创公司间的合作,认为这是积极现象。
- 评论3(vessenes)认为该工作有趣且创新:从视频模型中提取世界模型并应用于机器人,尽管概念不新,但首次实现从视频实验室转向机器人实验室,可能开辟新商业路径。关键引用:“a well trained multimodal video generation model has a world representation model trained inside it” 和 “I’m not aware of a video lab that’s turned itself into a robot lab yet”。
- 评论5(takd)直接称赞“Amazing work”,表达高度认可。
负面或质疑观点
- 评论2(johnbarron)讽刺性建议,若亚马逊不收购该公司,CEO应被解雇,暗示其商业价值或技术潜力被低估。
- 评论4(GiffertonThe3rd)对视频中机器人三次尝试才完成任务的细节表示不安,质疑其新颖性:“I have not seen such resolving before. Is it new or am I way out of the loop?”
- 评论6(flufluflufluffy)批评表述中“less disentangled representations”的用词,认为其复杂化概念,不利于现实世界理解:“Only an LLM would use a less disentangled representation... when trying to explain to people in the real world”。
平衡性总结:评论整体认可技术突破(如世界模型提取),但对实际表现(如机器人操作效率)和表述清晰度存在争议。正面观点强调创新路径,负面观点关注细节与沟通问题。