探究建模:在 K 个猜测中训练最佳
网站: https://explorative-modeling.github.io/ GitHub: https://github.com/alexiglad/XM 摘要:我们引入了探究建模,这是一种新的生成建模范式,作为添加到现有生成模型的第三个预训练轴,并且也使得端到端生成成为可能。增加探索单调地改善了图像、视频和语言中的现有模型,而收益随着规模增长(数据的 7%→36%,参数的 13%→23%)。具体而言,探究模型(XMs)实现了 6.2 倍的样本效率、4.1 倍的浮点运算效率和 47% 更好的参数效率。探索还使得扩展泛化成为可能,并扩大了现有模型的端到端特性。作为端到端生成模型,XMs 在控制任务上可与扩散模型匹敌,而推理计算量降低了多达 256 倍。 让我先问一个听起来简单的问题。如果我要求一个模型“生成一只狗”,那么有多少个正确答案呢?结果发现有很多……可能有数十亿张我们可以算作狗的图像。那么如果我们训练一个神经网络直接预测狗图像,会发生什么?模型在训练期间会看到成千上万种不同的有效狗,而与它们最接近的单一预测是它们的平均值。这就是模型学习输出的内容,而成千上万只狗的平均值看起来与狗毫无关系,它只是一个棕色的模糊图像。 真实的狗来自数据 → 模型的预测 图 1:训练模型直接预测图像会给你它们的平均值,一个棕色的模糊。这就是为什么直接回归在生成建模中不起作用。为了让这一点具体化,让我们玩一个游戏。我将向下面的靶子扔飞镖,每个飞镖会随机落在某个环上。你的工作是猜测我下一个飞镖会落在哪里,离得越远,分数就越差。 图 2:我们的游戏靶子。那么你应该猜在哪里呢?事实证明,最小化错误的猜测正好是靶心的中间。 我们训练了一个模型来玩这个游戏,果然,它每次都猜测中间(这是这里的最佳预测)! 图 3:一个模型在玩我们的游戏(蓝色)猜测了靶心。可是这太糟糕了……靶心几乎从来不是飞镖实际落下的地方。“最佳”猜测是一个飞镖从未落下过的地方。这就是生成建模的核心问题。当一个预测有很多有效答案时,最佳的单一预测就是它们的平均值,而数据的平均值通常是一个坏答案,看起来与真实数据毫无关系。 而这个问题并不是靶子或狗特有的,它出现在任何类型的数据中。当我们训练一个模型直接生成三堆二维点时,它预测的是它们中间的一个点;而当我们训练一个文本模型时,它能说的只是“the”。 真实数据 模型预测 图 4:直接预测在任何数据类型上都会崩溃到平均值。但等等。ChatGPT写出连贯的文本,图像模型生成出非常惊人的图像。显然,这个问题以某种方式得到解决,对吗?确实如此,今天的每个可扩展生成模型都通过在训练过程中将生成过程分解为多个小步骤来以相同的方式解决它,因此每个步骤大致具有一个正确答案。当一个步骤有一个正确答案时,就没有任何东西需要平均,模糊现象消失了。让我们看看这如何运作。 自回归模型(如 LLMs)一次预测一个片段,这在我们的游戏中意味着从不一次性猜测飞镖的确切位置。相反,你首先只猜测飞镖落在左侧还是右侧,然后根据这一点来猜测上下。在你知道飞镖落在最右边后,它可能只有几个地方。 步骤 1:选择一个左右位置 步骤 2:根据左右选择上下 图 5:自回归一次预测一个序列元素。在我们的游戏中,一旦选择了左右位置,上下预测只有两个小点可以选择。 扩散模型的做法则不同。它们从纯粹的随机噪声开始,向数据迈出数百个小步。在早期阶段,它们的猜测仍可能成为任何飞镖,但每一步都能缩小可能性,因此没有单一步骤会面对很多有效答案。 开始:可以成为任何飞镖 部分:剩余区域较少 接近最后:被固定图 6:扩散从噪声到数据采取小步骤。蓝色显示模型的猜测(紫色)可能仍会变成的飞镖,而随着每一步缩小。 事实证明,这基本上是现代生成模型的工作方式,通过将生成过程分解为可以很好预测的小块。这包括 LLM、图像和视频模型,甚至是像 MeanFlow 和一致性模型这样的新型少步模型。我们将将生成过程分解的想法称为分解生成。这种分解生成的方法有效,但出于几个原因也很邪恶。首先,模型是在单一步骤上进行训练的,然而……
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡