人工智能尚未准备好研究自己
‘AI科学家’早期应用的一个方面是研究人工智能本身。图源:La Pico de Gallo/Getty 人工智能在自身的研究中取得了飞跃,找到使现有算法更智能的方法,或者编写新的算法。但根据7月底在预印本服务器arXiv上发布的一项研究,计算机尚未准备好取代它们的创造者。“我认为全自动化的开放式研究在当前并不在视野之内,”新泽西普林斯顿大学的计算机科学家、该预印本的共同作者Sayash Kapoor表示。完全自动化科学过程的努力,从创意生成到论文的书写和自我评估,主要由东京索卡纳人工智能公司的一组团队首次提出。该团队于2024年推出了他们名为AI科学家的系统,并在3月在《自然》杂志上发布了改进版的结果。AI科学家被委派研究机器学习中的陷阱。它产生的三篇论文被提交到一个会议的研讨会进行同行评审,其中一篇的得分足够高而被接受。然而,Kapoor指出,同行评审并不是评估论文质量的可靠方式,特别是在人工智能研究中。更普遍地说,一些研究人员质疑从创意生成到出版自动化AI研究是否能产生真正的突破,认为这在优化现有技术方面更有优势。为了对人工智能提出更高的标准,Kapoor和他的同事创建了一项新的挑战,称为阴影评估。首先,他们选择了两篇提交到今年神经信息处理系统会议的论文。然后,他们要求一款人工智能工具根据每篇论文中的研究问题进行研究并撰写论文,并请原作者仔细审查其产出。这个想法是这些作者在深入研究产出方面会比忙碌的同行评审者拥有更多的专业知识和投入。该团队通过“利用”大型语言模型Claude Opus 4.8,在改编的代理系统OpenClaw中构建了其人工智能系统,然后将其包装在一个包含一般指令和检查进度的方法的更广泛的“支架”中。这个支架为模型提供了一系列工具,包括创建子代理的能力并访问互联网、软件库、运行实验所需的计算处理器和模拟同行评审的软件。对于每篇论文,AI系统有六天和3,000美元的计算积分。跟随第一篇论文的一般研究方向,Kapoor的团队要求该系统设计一种对聊天机器人个性进行精确控制的方法。镜像第二篇论文,它必须为某种类型的神经网络设计一个故障检测器。作者们对系统在研究工程工作上的成功感到惊讶。它能够在几天内运行数百个实验,而不会陷入无法解决的错误循环。它还进行了扎实的文献综述,并提出了一些小发现。它也能捕捉到自己的虚假声明(有时称为幻觉),并没有试图走捷径(或“奖励黑客”),尽管作者们之前预测过。然而,AI系统在其被分配的两个任务中大多失败,从原论文的作者那里获得了2/6和1/6的总体评分。它失败的典型方式是选择几个假设进行探索,但过早地固定在一个上,当其方法不起作用时没有足够向后追溯。随后的自我评审并没有足够消极,因此系统坚持最初的选择,逐渐缩小其主张,直到说出很少有趣的内容。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡