返回

文章详情

在67美分的ARC-AGI-1上获得44%的折扣

Hacker News2026年9月1日 09:52

我用5090的设备在1.5小时内从头训练了一个小型变换器,超越了许多大型语言模型,并且表现与TRM/HRM相当。这是我之前模型的升级版,速度更快、更好、更便宜,仍然是开源的。此外,在ARC-2上得到了7%的评分。在Twitter上的讨论,GitHub上的代码,在ARC-1公共评估中的表现。我只对进行类似的测试时间训练的模型进行比较。这是关于ARC-AGI系列工作的第三篇博客。之前:博客2,博客1。很多人认为之前的结果是不可能的。它引起了顶尖研究人员的关注,并在X上广泛传播。例如:Lucas Beyer、Jeremy Howard、Rohan Anil的讨论,以及许多其他人的评论。为什么要做这个工作?我认为样本效率是当今人工智能中最重要的问题,我想解决它。这个工作的意图是(1)在限制于变换器/现代深度学习方法时寻找样本效率的极限,(2)降低成本,以便迭代过程更快速和便宜。ARC是测试这一点的绝佳基准:在高维空间中只有很少的样本(仅1000个难题),这是一个元学习基准,每个难题使用不同的规则,包含一些共同的概念。所需的先验知识非常少:评估集所需的每个概念都出现在训练集中。人类解决起来非常容易,对于甚至是资源有限的人工智能研究者也很容易接触。基准仍然没有饱和(对于数据效率,忽略大型语言模型和使用大量合成数据或人类归纳偏差的方法)。接下来,我将致力于新的研究思路来突破这些限制。我会尽量保持成本低廉,以便全世界的人都能参与。技术细节:它是如何工作的?整体方法与上次类似(完整的技术细节在这里),但我添加了许多升级。以下是该方法的快速总结:每个输入输出对被转换为一个标记序列。这些序列由一个小型变换器进行自回归训练。这是在测试时对训练集和评估集难题从头开始完成的(测试标签隐藏)。为了实现跨任务学习,为每个难题分配了一个单独的添加嵌入(学习的)。由于每个序列都有两个2D网格,因此使用3D RoPE嵌入学习位置。序列通过颜色和二面角置换进行增强。在推理过程中,测试输入被增强,逆增强应用于生成的输出。提交两个最常见的输出(AAIVR)。与上次相比的变化:主要目标是找到改进架构/算法以提高模型的样本效率。分数的大幅提升主要由于现代架构(使用SwiGlu代替GELU,使用RMSnorm而非layernorm等)。数据多样性增加,数据混洗更好,扩展到:4层增加到8层。成本的最大降低则是由于:大幅减少的增强(更高的样本效率!),AdamW -> Normuon闪存注意力与变长训练 + 推理的灵活注意力内核。一个重大变化是我不再训练输入标记了。这意味着损失函数只包含输出标记(这使得该方法成为监督式的)。这样的效果稍微好一点,从40%提升到44%,但我不明白为什么。也许是模型容量有限。我还通过添加来自ARC-2的非重叠任务增加了训练数据。我非常小心地进行了这项操作以确保没有泄漏。如果你不喜欢这额外的数据,可以将其去除,仍然会得分~40%,但计算量约需要加倍。上下文:ARC-2包含773个ARC-1难题和347个新难题。ARC-1的大多数评估难题是重复的,因此如果你简单地在ARC-2上进行训练,这就是数据泄漏,会得分100%。我通过仔细过滤掉773个重复的难题(确保没有泄漏)来避免这一点。还有许多其他变化带来了性能或速度的增量改进。完整的变化列表可以在这里找到。有趣的行为:既然我不再对输入进行训练,这种方法现在是监督式的。奇怪的是,测试损失变得更差,但分数却提升了!而且更加稳定,得分的变化更小。如今很多人正在通过在小数据集上争取最低的验证损失来研究样本效率。我认为这很好,但这指出了这种方法中的一个失败模式。我确实认为这种无监督风格的训练在某些场景中会更好,我正在评估这一点。在NorMuon之前,我尝试了普通的Muon。显然,它训练得比AdamW快得多,但损失(和得分)在最后会徘徊,而不是收敛。我发现此时将动量和/或学习率大幅降低有助于,但我不想进行这样的手动调整。当我切换到NorMuon时,问题消失了。消融:对性能的最大贡献似乎是良好的表征(3D RoPE + 每个任务的嵌入)。移除3D RoPE或每个任务的嵌入会造成大幅下降。输入训练表现稍微差一点-> ~39%。将训练集限制为仅包含ARC-1+ConceptARC。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡