这些初创公司正在追逐下一个大型语言模型的重大突破
《麻省理工科技评论》的《未来会怎样》系列从各个行业、趋势和技术中展望未来,提供初步的洞察。您可以在这里阅读更多内容。早在2017年夏天,谷歌的人工智能研究人员发表了一篇名为《注意力是你所需要的一切》的论文,文中描述了一种新的神经网络类型,称为变换器。这种变换器在处理长数据序列,特别是文本方面表现出色。九年过去了,变换器已经成为市场上每一个大型语言模型内部的引擎。“整个人工智能行业都是建立在变换器之上的,”人工智能初创公司Subquadratic的联合创始人兼首席执行官贾斯廷·丹杰尔说。“它们是计算机科学历史上最重要的创新之一,改变了世界。”但变换器开始显示出它们的年龄。大型语言模型(LLMs)最近的一些进展,如所谓的推理模型的开发及其同时处理大量输入的能力,并不是对这一核心技术的完美扩展,而是对一些基本缺陷的修补。越来越多的科学家和工程师开始询问接下来会发生什么。大型语言模型不会消失,但构建它们的方式正在发生变化。(《麻省理工科技评论》在今年关于人工智能的重要事项10个列表中将这一未来一代模型称为LLMs+)进入了一波希望推动这一蓬勃发展技术边界的初创公司。其中一些无疑会失败,但他们有更多的机会去尝试,且失去的代价远低于今天行业领先公司的代价。首先,问题是所在。变换器的关键强项在于一种称为稠密注意力的机制,它通过一系列数字编码文本块的含义。这个过程涉及将文本中每个单词(或称为token的单词部分)与其他所有单词进行相乘对比。稠密注意力可以以惊人的准确性捕捉文本的意义。但是,随着文本长度的增加,处理它所需的计算次数迅速增加。一篇大约10,000个单词的文档可能需要变换器执行5000万次乘法运算。 这是大型语言模型消耗如此巨大计算能力的主要原因。成本是巨大的。OpenAI预计今年将花费500亿美元用于计算,公司的总裁格雷戈·布洛克曼披露。此外,国际能源署预测,到2030年,数据中心消耗的电力总量将翻倍。而且,变换器在许多最新模型旨在实现的功能上面临困难。由于其逐字处理文本的方式,变换器不擅长同时跟踪大量信息(换句话说,它们的上下文窗口不能太大)。然而,如果大型语言模型要完成更复杂的任务,它们需要处理更多的数据:整整一个文档库,整个代码库,或者在智能体的情况下,来自其他大型语言模型的输出。至于推理模型,它们通过在一种称为“思维链”的草稿纸上为自己写便条,然后再把它们读回来来工作,这又增加了所需掌握的数据量。随着大型语言模型变得越来越大、越来越好,变换器逐渐成为瓶颈。这项技术的关键强项如今已成为限制。以下是解决变换器问题的四个新想法——这些创新可能会永远改变大型语言模型,使其更快、大大提高效率,甚至(也许)变得更加智能。01:重新思考注意力。使大型语言模型更快、更便宜的显而易见的方法是直接解决问题,改变注意力的工作方式。用稀疏注意力机制取代稠密注意力机制,该机制仅对文本块中部分单词对进行计算,而不是所有单词对,可以大幅减少大型语言模型所需的计算量。多年来,研究人员提出了大量稀疏注意力机制。问题是,它们都不如稠密注意力在捕捉意义方面表现得好。不过,这种情况可能有所改变。总部位于迈阿密的初创公司Subquadratic声称它发明了第一种与顶级主流大型语言模型在一些任务上(包括搜索和编码)对比的稀疏注意力机制。这个说法非常庞大(业内有些人对此仍持怀疑态度)。Subquadratic表示,其模型SubQ通过即时判断每段文本哪些单词重要,哪些不重要。公司还声称已有数千人注册了其候补名单,并计划尽快广泛推出该模型。与此同时,总部位于旧金山的初创公司Manifest AI则从另一个角度解决问题。它没有改变注意力的工作方式,而是将其替换为另一种机制。它开发了一种名为“电力保留”的机制,该机制仅存储与特定任务相关的重要信息,并确保大型语言模型所需跟踪的数据量不会急剧增加。注意力机制迫使大型语言模型...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡