Flux 3 X Mimic:视频-动作模型的下一代
FLUX 3的早期版本,我们新的多模态基础模型,现在正在机器人上运行。我们给予模仿机器人对FLUX 3的提前访问。他们在机器人学习和部署方面的优势,加上模型的世界知识和BFL的基础模型专业知识,产生了FLUX-mimic:视频-动作模型的下一代。FLUX 1和FLUX 2生成图像。FLUX 3扩展到多模态,并联合生成音频视觉内容——同时,提供FLUX-mimic的基础:一个与模仿合作开发的视频-动作模型,运行在经过测试和部署的Audi机器人上。乍一看,生成令人信服的视觉内容和控制机器人似乎没有太多共同之处。一个需要生成像素,另一个则需要理解当你触摸和操控物理世界时,它是如何反应的。如果一个模型同时做这两件事,那么它从来都不单单是一个内容创作模型。它是一个如何理解世界行为的模型,而内容创作只是它能做的事情之一。这就是FLUX 3。视频是艰难的部分,FLUX 3是一个模型,最初在图像、视频和音频之间进行联合训练。该训练中最具挑战性的部分——占总计算成本的95%以上——是视频预测。为了生成真实的视频,一个模型不得不学习接触、运动、重量、因果关系;如果其中任何一项错误,它看起来就是错误的。学习准确呈现世界意味着理解世界的行为。相对而言,音频是较简单的模态。与视频相比,维度较低且细节较少,它在720p带音频的视频中所占令牌比例不到0.5%。一旦模型完成了学习视频理解的艰难工作,它将学习视频和音频之间的因果关系,以预测与嘴唇运动同步的语音和与导致这些物理事件的音频效果同步的音频。动作遵循相同的形状:一个机器人状态的低维表示,与视觉观察紧密结合。动作、音频和视频帧都是单一基础物理现实的部分表示。在模型对视频和音频背后的物理过程进行学习后,动作预测并不是一个新的出发点——它只是对它已经建模的现实的另一种视角。一个单一主干,如果这一框架是正确的,那么教FLUX 3预测动作不应该产生持久的成本:我们预计会有一个简短的扰动阶段,因为模型必须学习动作空间的结构并对其内部世界表示进行对齐,然后才能恢复到全性能。这正是我们观察到的。在一次大规模训练中,我们将动作预测添加到课程中,并观察其对视频生成质量的影响。在模型开始融入新的动作模态时,文本到视频和图像到视频的人类评分最初下降了多达10%。在3500步后,模型在视频生成任务上恢复了先前的全部质量,同时还预测动作。每个系列都在添加动作预测之前规范到其自身质量。分数越高越好。模型必须将动作整合到其输入和输出中——但这样做并没有使其能力永久受损。它仅仅是需要学习这一新模态如何与其现有的世界模型相关。一旦弄清楚这一点,现有能力的性能惩罚就消失了。视频生成和动作预测不需要单独的基础。相同的主干承载了两者。这使得物理人工智能成为黑森林实验室路线图的自然延伸,而不是方向的改变。内容创作是我们的多模态FLUX 3主干用图像、视频和音频所做的。物理人工智能是它用动作所做的事情。一个基础模型,视觉智能为核心,支持两类应用。我们没有构建一个单独的基础模型。我们专注于艰难的事情:构建一个理解世界的模型。在其中行动就是这种理解所能实现的。实验室到现实:FLUX-mimic 当我们将FLUX 3主干指向真实的自动化任务和真实的生产线时,会发生什么?这是模仿和BFL创建FLUX-mimic以回答的问题。模仿公司构建自己的机器人,拥有机器人学习、灵巧操纵和生产部署方面的专业知识;BFL构建视觉基础模型,拥有多模态训练和建模专业知识。我们共同构建了一个适应行业要求并整合到模仿的全栈部署系统中的下一代通用操纵模型。FLUX-mimic是一个基于FLUX 3主干的视频-动作模型。解码学习到的世界模型,我们的论点是FLUX 3必须学习一个世界的内部表示,才能生成视频。FLUX-mimic遵循这一论点,并从FLUX主干学习的世界表示中解码动作。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡