返回

文章详情

谷歌揭示了双子星机器人2.0,承诺改进灵活性和安全性

Ars Technica2026年7月30日 17:58

跳到内容 停止、合作并倾听 双子星机器人2包括三个模型,但目前只有一个公开可用。 图片来源:谷歌 由谷歌的双子星AI模型驱动的机器人现在更具能力。随着双子星机器人2的首发,这些物理机器人现在能够完成更复杂的任务,持续分析变化的环境,并与其他机器人协作。这得益于三种新的子模型,其中之一今天开始向开发者公开。多年来,机器人的奔跑、舞蹈和后空翻视频一直是互联网的主旋律,但这些机器被编程来执行这些非常狭窄的任务。双子星机器人的目标是创造一个通用机器人,能够完成任何人类能够做的事情。谷歌DeepMind科学家有时称之为“物理AGI”。本质上,你告诉机器人该做什么,它就会去做。随着2.0版的发布,谷歌表示其机器人AI可以控制整个类人机器人,具备更好的灵活性,即便是对复杂的人形手机构也如此。双子星机器人2将全身智能带入机器人。这始于双子星机器人ER 2,一个升级的“具身推理”模型,DeepMind声称这是比之前的1.6版本的显著飞跃。它与双子星实时API集成,使开发者有机会体验这一所谓的飞跃。双子星机器人ER 2被称为视觉语言模型(VLM)。它被设计用来理解指令和周围的世界。此处的重大升级是ER 2可以处理来自机器人摄像头的实时视频流,使得系统能够在机器人从一个步骤移动到下一个步骤时跟踪进展。谷歌指出,双子星机器人ER 2可以以近60%的准确率对视频帧的完整性进行分类。这仍远非完美,但它比1.6版本或其他竞争AI模型的视觉理解能力要好得多。双子星机器人ER 2对世界的理解胜过其他模型,但差距不大。 图片来源:谷歌 在视频流中找到特定时刻对于正确完成任务也是关键。当你让机器人倒咖啡时,你当然希望它知道何时停止倒。ER 2显然在这方面表现更好,识别关键时刻的准确率接近90%。当机器人执行多步骤任务时,具身推理模型使它们能够实时理解失败。系统可以尝试再次执行该单一步骤,而不是返回到起点。例如,如果机器人试图捡起的球滚走或某人移动了一个容器,机器人可以仅仅调整其手的位置和动作。新的具身推理版本也是谷歌DeepMind升级的机器人AI能够协作的原因。视频演示显示,Apptronik的阿波罗2和更简单的Franka F3 Duo在任务中协同工作,而不会互相干扰。尽管测试机器人仍然无法与人类的速度或优雅相媲美,但视频演示中包含大量机器人实时操作的画面,它们似乎比过去的测试更具自信。 双子星机器人2中的多机器人协作。 理解只是第一步——让机器人在物理世界中移动是另一个模型的范畴。在绘制任务图后,视觉语言模型将任务交给一个升级的视觉-语言-动作模型,简单称为双子星机器人2。这个AI模型以其他生成系统创建文本或图像的方式从这些指令生成机器人动作。还有一个称为双子星机器人设备端2的低延迟离线版本。这些模型目前仅限于少数测试人员使用。谷歌还在波士顿动力的硬件上测试双子星机器人2。谷歌表示,新的动作模型更加准确和高效。即便是较小的设备端版本,也可以通过仅仅几个小时的动作数据或大约200个示例来适应新的机器人设计。 遏制机器人末日 目前对于AI幻觉的问题已经众所周知,但当AI具有与人类共享空间的物理体现时,错误带来的潜在危害可能会更大。随着双子星机器人每次的发布,谷歌DeepMind一直强调它对这一风险的重视。根据DeepMind的说法,双子星机器人中的每一层都包含“传统的物理安全措施和强大的AI安全框架”。随着双子星机器人2的发布,推出了一种新的安全基准,称为ASIMOV-Agentic。该测试评估模型在各种安全因素上的表现。它可以评估一个具身推理代理是否会拒绝来自VLA的不安全工具调用。它还可以确定某项任务是否可以安全完成,以及...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡