变形金刚:用于运动条件机器人共同设计的统一模型
变形金刚 Huy Ha , Karen Liu , Shuran Song 并非所有机器人都是平等的——但如果你可以为特定任务设计一个呢?我们提出了变形金刚,这是一种统一模型,正是如此:给它一个操作演示,它就会生成一个完整的机器人——每个连杆、关节、电机和惯性属性——为该运动优化。我们为 ALOHA 2 双手操作平台制造了这样一个设计,用于布料投掷;与原始设计相比,它将追踪误差减少了 73%,最大关节速度减少了 30%。这个结果背后是一个在 RoboTokens 数据集上训练的扩散变换器,这是一种对机器人体现、状态和动作的统一标记化。相同的架构跨越了体现空间(轮式双手、四足动物、人形机器人)和使用案例(体现生成、跨体现控制)。它不是针对一个奖励函数过拟合的动态模型,而是一个动态模型,其与奖励无关的预测在推理时被转换为特定于奖励的价值预测,然后用于通过我们称之为动态自我引导的过程来引导体现扩散。跨越三个设计空间的实验展示了未见奖励和轨迹的零样本优化,提升了性能和运行时间,相比于进化基准。技术摘要视频一个 17 分钟的演示——或者滚动查看图形和说明版本。对于给定的操作任务,什么是最好的机器人?机器人的体现决定了它能做好哪些任务。我们投入了大量精力让机器人更智能——更大数据集、更好的算法、更强的策略架构——但糟糕的体现甚至可以阻碍伟大的策略。你可以收集全世界的投掷数据,但如果机器人的形状远非最佳,它可能会自己投掷,而不是投掷球。所以让我们将问题明确化。给定一个目标末端执行器运动和一个奖励函数,我们希望为该任务生成一个完整的机器人体现——我们所说的完整,是指每个连杆、关节、电机和惯性属性,加上驱动整个系统的控制器。我们称之为运动条件的机器人共同设计。一个随机程序生成的机器人尝试目标运动:在完成之前就跌倒了 🙃 演示、生成、验证 我们的框架将机器人共同设计重新框架为一个三步过程:你演示所需的末端执行器运动(例如,来自 UMI 3 的人类演示),我们的模型生成一个优化的体现,相同的模型通过直接控制它来验证设计。相同的网络扮演着三种角色——生成器、评论者和跨体现控制器——通过对一种统一的机器人标记化共同训练。三步,一个模型。给定目标末端执行器运动(例如,人类演示)和用户定义的奖励,变形金刚生成一个完整的机器人——几何形状、运动学、惯性、电机——然后控制该机器人追踪运动。没有单独的优化器、评论者或控制器管道。论文分为三个部分:统一的机器人表示(RoboTokens)、统一的架构(变形金刚)和统一的训练目标(动态自我引导)。到架构部分时,你有时间理解这个双关语 🥸 第 1 部分 RoboTokens 统一的机器人表示 每个机器人都变成一个类型标记序列。蓝色标记编码体现(连杆、关节、电机);橙色标记编码动态(状态和动作)。相同的标记器可以处理四足动物、人形或灵巧手——没有针对每个机器人的适配器——因此一个模型可以学习所有这些。如果我们希望一个模型共同设计任何机器人,网络需要具有跨越每个体现的共享词汇。RoboTokens 就是该词汇:用于每个连杆、关节、电机、状态和动作的类型标记——组织成一个单一序列描述机器人的体现(时间不变)及其动态(时间变化)。RoboTokens 具有以下关键设计目标:完整性。一个 RoboToken 序列捕捉刚性关节机器人所有的内容:5 种体现标记类型(连杆、固定关节、旋转/滑动关节、球关节、电机)以及状态和动作标记。灵活性。标记通过 ID 相互引用——一个关节标记知道它连接的两个连杆标记——因此相同的格式可以处理一个 6 自由度的手臂或一个 35 自由度的双足机器人。一致性。标记器规范化冗余的空间偏移,并将惯性/变换数据存储在单一框架中,减少模型必须学习的方差。可扩展性。新增标记类型不会改变架构——我们通过指向相关的末端执行器和时间步 ID 添加目标末端执行器姿态标记用于轨迹跟踪,且不需要重新标记其余机器人的部分。可优化性。与 MJCF 等自回归文本格式不同,扩散的连续值 RoboTokens 既提供了全局可控性(后期标记影响早期标记在去噪步骤中)又具有可微分性——这两个要素需要...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡