返回

文章详情

Using synthetic data for AI training is 'a big mistake,' says AI pioneer Rich Sutton

使用合成数据进行人工智能训练是个“重大错误”,人工智能先驱理查德·萨顿表示

Business Insider2026年8月19日 05:49

理查德·萨顿表示,合成数据并不是扩大人工智能规模的解决方案。商业电讯/AP 理查德·萨顿帮助开创了当前人工智能繁荣背后的技术。现在,他认为大型科技公司推动人工智能持续发展的做法完全错误。在本周二发布的红杉资本播客的一集中,这位加拿大计算机科学家和图灵奖获得者表示,人工智能行业因其对合成训练数据的依赖而走上了错误的道路。“这简直是个重大错误,”他在被问及是否可以使用合成数据来保持大型语言模型的扩展时表示。“也许这是下一个重大教训。”合成数据是由算法或人工智能模型人工生成的信息,而不是从原始的、真实世界的来源收集的。由于人工智能公司在互联网上寻求新的训练数据来源,合成数据的吸引力越来越大。例子包括用于自动驾驶训练的计算机生成的汽车图像或用于人工智能欺诈检测的虚假银行记录。在某种程度上,大型科技公司与萨顿达成了共识。科技巨头们正愈发极端地努力寻找更多真实的数据。OpenAI公开寻求那些在线上不易获得的大规模、专有数据集,以帮助训练其人工智能模型。本周早些时候,谷歌同意支付1000万美元购买破产的精神航空公司(Spirit Airlines)内部数据和软件,突显了专有的、真实世界信息在人工智能训练中的日益重要性。在周二的播客中,萨顿表示,制造的数据并不能替代真实数据。他说,人类行为就是一个这样的例子。“我们没有办法用合成数据来模拟其他人的思维,”他说。他更倾向于真实的体验数据:人工智能代理通过与其真实环境的互动来获取的信息,观察所发生的事情,并从后果中不断学习。“你无法从合成数据中了解无人机将如何与物理世界中的环境互动,”萨顿说,并补充说,机器人的电动机中存在摩擦和磨损等变量。“世界是无比复杂的,任何对它的模拟都是微不足道的。”这现在已成为一家初创公司的理念。上个月,萨顿和他的前学生库拉姆·贾维德(Khurram Javed)推出了Oak Lab。这家初创公司正在开发旨在通过自身经验不断学习的代理,而不是主要依赖于大型预编译的数据集。Oak Lab尚未披露任何融资轮或投资者。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡