小米机器人1
突破数据屏障。通过无体现预训练扩展机器人政策模型。语言和视觉中的基础模型通过遵循经验缩放法则不断推进前沿:能力与数据、参数和计算相关联。机器人技术一直错过了这一点。大规模、高质量的数据难以获得,而这种稀缺性比其他任何因素都更限制了政策模型的扩展范围。在真正的大规模训练下,机器人能够做什么仍然在很大程度上是一个悬而未决的问题。我们迈出了解决这一问题的一步。小米机器人1结合了大规模的无体现(UMI)预训练与少量真实机器人数据的后训练阶段。我们研究模型在扩展时的行为。数据 一切小米机器人1可以做到的事情都源于数据。在预训练中,我们使用了10万小时的无体现(UMI)轨迹,覆盖超过1700个场景(家庭、商业场所、工业地点和户外空间),涵盖了多种任务。我们开发了一个可扩展的自动标注管道,该管道首先将轨迹分割为固定长度段,然后用场景状态转变的语言描述对每个段进行注释。在后训练中,我们利用了跨体现数据集,其中包含内部机器人数据、过滤的开源机器人数据和一组高质量的UMI数据。对于内部数据,我们在实际家庭中收集了超过7200小时的真实机器人数据,涵盖整理沙发、整理鞋柜和收拾厨房用具等任务。UMI数据由时间段和指令提示手动注释,这与在预训练数据中使用的自动标注状态转变描述有所不同。方法 遵循LLMs的训练范式,小米机器人1的训练分为两个阶段:预训练和后训练。第一阶段从大规模UMI数据中学习行动生成的通用表征,而后训练阶段则使模型与真实机器人体现和遵循指令的能力对齐。预训练关注广度:让模型尽可能多地接触真实世界。我们使用上述描述的无体现UMI数据,它跨越多种环境和任务。在这种规模上,手动标注是不可行的。因此,我们建立了一个由强大的视觉语言模型驱动的自动注释管道。长视频被分割为固定长度的剪辑,VLM描述每个剪辑中抓手和相互作用对象的状态转变。其结果是一个大型的真实世界操纵轨迹语料库,每个轨迹都有精确的语言描述进行注释。这些允许模型学习推动场景朝向语言描述的状态转变的行动生成。一个鼓舞人心的发现是,预训练显示出良好的缩放行为:随着数据和模型大小的增长,验证行动错误率稳步下降。后训练旨在将从预训练中获得的强大行动生成能力与真实机器人体现和自然语言指令遵循进行对齐,主要包括两个方面。体现对齐使用高质量的跨体现真实机器人数据将一般的行动生成能力映射到实际机器人上。指令对齐则使模型从“根据场景状态转变的描述生成行动”转变为“理解自然语言指令并直接执行”。在后训练之后,小米机器人1可以开箱即用,执行各种真实世界中的移动操纵任务。我们在看不见的环境下对后训练模型进行评估,看看预训练的缩放行为是否能够转移到后训练后的真实机器人性能。答案是肯定的。随着我们增加预训练数据的量和模型规模,真实机器人的成功率稳步而可预测地上升。也就是说,较强的预训练模型会带来更好的真实机器人性能。缩放收益没有饱和的迹象:后训练后的真实机器人成功率随着模型在预训练期间消费更多数据或扩展而不断提高。应用 在后训练之后,小米机器人1可以作为下游应用的强大机器人基础模型。我们在两个互补的下游设置中使用小米机器人1。高效适应新任务使模型能够从每个任务几小时的数据中专注于全新的、极其复杂的真实机器人任务。模拟基准考察其在强调泛化的主流套件中的能力。小米机器人1可以以高数据效率学习新任务。该模型从每个任务仅需几小时的真实机器人演示中即可学习诸如手机打包、打印机加墨、洗衣装载和箱子打包等任务。每个任务平均不到10小时的演示,它已经达到了75%的整体成功率,几乎是相同条件下π 0.5基线(40%)的两倍。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡