一位Anthropic研究人员刚刚向我们展示了自我改进的人工智能
用其他人工智能模型训练人工智能模型已经成为neolabs的一个非常受欢迎的目标——现在,Anthropic研究员项目中的一位研究人员为我们提供了实践中可能的早期视角。在周五,Anthropic发布了一篇新论文,标题为“自动化研究人员可以可靠地减轻对齐失败”,详细阐述了人工智能系统如何能够可靠地提高模型在一组对齐基准测试中的表现。当给定特定不对齐行为的10个基准时,自动化系统能够在每一个测试上提高表现,而不会降低整体表现。该系统由Anthropic研究员Chen Yueh-Han领导,复制了传统研究方法的许多部分。每个自动化系统搜索可用的文献,提出一种方法,并使用该方法训练模型30分钟,逐渐在几次迭代中提高基准。有效的方法被保留,而无效的方法被丢弃,从而使系统能够快速且大规模地运作。“总体而言,这些结果提供了早期证据表明自动化对齐后训练在短期内可能变得可行,”论文中写道。这篇论文是递归自我改进的一步,许多人认为这将是人工智能进展的下一个重要步骤。如果模型能够改善自身的对齐训练,那就有可能更广泛地改善训练实践——在那时,人类人工智能研究人员可能很快会变得过时。论文并不回避这个想法,明确将自动化对齐研究人员(AAR)与其人类对应者进行比较。“最好的AAR方法平均在六小时内超过经验丰富的人类提出的方案,”论文中写道。“人类指导的研究方向不会导致更强的表现。”如果还有人对此不信服,论文中甚至提供了成本比较。“一个AAR的API推理成本大约为每小时4美元,而我们支付给人类研究人员的费用为每小时150美元。”公正地说,论文也指出了这种方法的一些局限性。自动化系统仅在基准反映实际对齐目标的情况下有效,即便如此,在建立和维护这些基准方面仍需进行大量工作——更不用说维护和扩展自动化研究人员所引用的文献。当您通过我们文章中的链接进行购买时,我们可能会赚取少量佣金。这不会影响我们的编辑独立性。Russell Brandom自2012年以来一直在报道科技行业,专注于平台政策和新兴技术。他曾在The Verge和Rest of World工作,并为Wired、The Awl和麻省理工学院的技术评论撰写过文章。他可以通过邮件russell.brandom@techcrunch.com或在Signal上联系412-401-5489。查看个人简历
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡