返回

文章详情

人工智能的下一个进化是从你的游戏技能中学习

Wired2026年9月28日 09:00

只需旋转摇杆、挤压扳机和按下几个按钮,即使是一个不熟练的玩家也能穿越3D视频游戏环境。一家英国初创公司正押注于这些简单的序列中蕴含丰富的信息,可以用来训练新的人工智能模型。AI行业的一些角落越来越相信,大型语言模型最终将受到其无法导航物理世界的限制。大型语言模型(LLMs)仅在文字上训练,可能不适合驾驶自动驾驶车辆、操控机器人手臂或执行任何需要灵活性和精确性的动作。为了弥补这个缺陷,包括李飞飞和扬·勒昆在内的一批知名研究人员将精力集中在另一类人工智能上:世界模型。为了流利掌握现实世界物理,世界模型需要在视觉和动作数据的结合上进行训练。在灵巧操控一个机器人手臂之前,一个模型可能需要在工厂车间的视频录制上进行训练,还需要获得如何握紧物体、操纵时施加多大的扭力等信息。但与训练在海量文本上的LLMs不同,没有类似的材料可以用于世界模型实验室。萨里大学人工智能副教授朱夏天说:“对于世界模型,你需要因果关系。”他说:“在互联网上,我们几乎没有这种类型的数据。”一家由勒昆顾问指导的英国初创公司Worldmodeldata正试图通过将控制器输入和视频游戏工作室收集的其他数据——这种废弃产品数量庞大——包装成世界模型的训练数据集来解决这一问题。一些公司,如General Intuition和Niantic,已经在收集自己平台上的视频游戏数据来构建模型。但Worldmodeldata自我推销为一个策展人,整理和组织数据,使实验室免于与大量游戏工作室签署单独协议。“有数百万个优秀的游戏,它们越来越像真实世界,” Worldmodeldata的首席执行官Rhea Loucas告诉《连线》杂志。“我们为什么不利用视频游戏中的丰富、多样的经验来教AI呢?”尽管该假设尚未得到充分检验,研究人员基本上在假设世界模型的性能将随着其训练数据集的规模而提高,这与LLMs的情况相似。这意味着合适训练数据的短缺是进展中最大的瓶颈之一。一些实验室试图通过在测试环境中将传感器附加到人类和机器人来手动生成自己的数据。但这种方法只能产生少量数据,并且不考虑模型在野外可能遇到的极端情况。“你可以支付人们演示捡放任务。但仅靠重复不会捕捉到你让机器操作的世界的混乱,”风险投资公司Khosla Ventures的合伙人Nicole Fraenkel说,她投资了General Intuition。Worldmodeldata的理论是,从视频游戏环境中收集的数据——与玩家采取的动作配对的3D空间视觉表现——在数量上是可用的,并且足够多样,以捕捉所有重要的边缘情况。“边缘情况才是需要正确抓住的,”Fraenkel说。“在汽车、飞机、无人机、工厂叉车或自主四足机器人上的错误代价非常高。”Worldmodeldata表示,它已从各种流行视频游戏背后的工作室获得了近百万小时的数据许可证,尽管Loucas拒绝透露这些工作室的名称。未来,该初创公司还计划创建补偿个人玩家的途径。Loucas认为,视频游戏数据最终将构成世界模型的大部分训练材料,随后可以使用特定于某个现实世界环境或任务的数据进行优化。“这可能会导致世界模型的GPT时刻——使它们真正有用”,Loucas声称。然而,并非所有人对视频游戏数据都抱有同样的乐观态度。英伟达发布的软件家族针对其芯片进行了优化,并更喜欢使用其专门设计的自定义引擎,以模拟现实世界物理作为其AI的基础。英伟达的世界模型开发负责人刘名宇表示,训练于视频游戏输入的模型不太可能在需要精细运动控制的任务上表现良好,比如景物的精细操作。这是因为视频游戏物理通常表现得很怪异,开发人员为了创造现实感的幻觉而采取了捷径——一个角色低下手来从桌子上取苹果——而没有编码细节:每个手指施加的压力,以防止苹果从他们的掌握中滑落。“我在使用视频游戏数据进行操作方面会更谨慎,”刘说。“视频游戏物理无法完美复现现场操作中所需的复杂性。”

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡