孩子们超越了人工智能——我们仍然不知道为什么
大型语言模型需要比儿童更多的数据才能学习语言。理解原因可能帮助我们创建更高效的模型——并揭示更多关于发展中思维的信息。2026年8月24日 赛尔曼设计人们已经交流了至少十万年,尽我们所知。在这段时间里,世界上只有一个东西能流利地学习人类语言:一个人类孩子。现在有两个。ChatGPT发布仅四年后,我们中的许多人现在理所当然地认为可以与手机或计算机自然交谈。像Claude、DeepSeek和OpenAI的GPT模型这样的LLM可以流利且灵活地假装成真人。但是,透过计算的帷幕一看,就会发现一个问题:教计算机使用人类语言仍然需要不人道的数量的数据。一个LLM可以轻松处理比一个人掌握母语所经历的单词数量多出十万倍——比儿童在通常开始掌握语言的第一年听到的还多。斯坦福大学的认知科学家迈克尔·C·弗兰克说:“最近的进展令人惊叹,But我们仍然需要烧掉一片森林,刮去所有人类知识的全部总和,以重现这个在我们起居室中一年内发生的里程碑。” 这种儿童和机器之间的巨大差距被称为数据效率差距。这引发了一个引人入胜的问题,对于认知科学家和人工智能模型的设计者来说,是一项挑战:孩子们是如何仍然超越有史以来最复杂的语言机器的?寻找答案对人工智能研究和认知科学都有重大影响。在过去的十年里,语言模型主要通过变得更大而变得更好。Meta的开放权重LLM Llama 3.1于两年前发布,在预训练中处理了15万亿个标记(类似单词的语言块)——这是训练模型的主要步骤发生在为特定任务进行微调之前,例如作为聊天机器人。乔治城大学的认知科学家兼语言学家伊桑·戈特利布·威尔科克斯表示,前沿模型可以在十倍的数据上进行预训练。但可用于培训的互联网资源是有限的,最终——可能在2030年代早期——轻松获得的数据来源可能会枯竭。儿童表明,可能有可能用更少的学习更多。少得多。一个在语言丰富的家庭中长大的儿童可能听到的词汇大约在一亿个左右。增加识字能力,年龄达到20岁时,可以将这个词汇量提高到大约三亿个。规模上的差异只能通过类比来随意表现。“Claude看到的是一个整个城市在一代人中所经历的语言量,”威尔科克斯说。如果你将用于训练现代LLM的所有单词打印出来,可以堆成一座高出国际空间站的堆。而人类儿童的1亿个词汇,堆起来仅为20米。而我们可以用更少的来满足需求。通过逆向工程儿童学习的方式,科学家们希望能够创建更数据高效的AI模型,这对有效地在视频上训练AI以及创建服务少数语言社区的聊天机器人等方方面面都有用。在机器模型中测试人类学习的假设也可能解决关于语言和儿童发育思维的悬而未决的问题。我们是天生就有语言本能,还是原则上可能一个孩子完全通过经验学习语言?我们处理语言的方式是我们生物学的特性,还是总有一些反映语言使用和学习的普遍限制? 主要元素大多数人只有在尝试在儿童后学习一门新语言时才意识到语言是困难的。过去的完成时、卷舌音和鼻音元音、属格、短语动词、语法性的阳性桌子和阴性的勺子——这些都是成年人语言学习者的痛苦工具。然而,学习母语通常是毫不费力的。幼儿通常在听到大约1000万个单词后开始产生语法正确的句子,或者在高端可达到3000万个。“这简直是神奇的,”弗兰克说。“如果你在3000万个单词上训练GPT-2,你得到的是一个无意义的生成器;而不是得到一个孩子。”婴儿到底是如何做到这一点的仍然是一个谜。研究人员对孩子们在不同发展阶段学习和使用语言的知识了解很多,但仍有很多未知之处。或许最令人持续关注的问题是,为什么婴儿能学习语言。人类语言的句法——将单词组合成句子的规则——包括递归、嵌套结构,使我们能够用有限的词汇并组合成无限的思想。这似乎像…
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡