返回

文章详情

让视频模型学习得更好、更快

Hacker News2026年8月27日 01:53

在过去的几年里,图像和视频模型取得了很大的进步,尽管这些模型的内部结构自Stable Diffusion 3以来没有发生太大变化。当然,也出现了一些小变体,例如GPT-Image推广的自回归扩散。但总体而言,这些模型几乎都是通过变换器骨干和v-预测目标进行流匹配。根据我们的经验,大部分的提升直接归因于三种数据改进:RL(强化学习)推动了一些改进,但它在过去几个月才真正开始在图像和视频上发挥作用。 数据过滤与重平衡:去除噪声数据,战略性地重新抽样数据,以便模型学习得更有效。 数据注释:收集更好的注释,例如更丰富的标题、边界框和字体细节,以便模型更容易区分视觉概念。在过去的12个月中,大型语言模型(LLMs)在图像标题生成方面有了无限的进步。视频方面进步较小,但这可以改天再谈。 合成数据生成:微调现有生成模型的集合,创建几乎没有自然发生数据的训练数据(例如,适用于Nano-Banana风格模型的图像编辑/参考条件)。通常是一个为非常特定任务训练的脆弱LoRA的集合,以及一个微调以过滤掉劣质合成数据的LLM。几年前,所有生成模型(无论是文本、图像、音频)的主流智慧都是尽可能多地聚合数据进行预训练。幸运的是,该领域在这方面变得聪明了很多。如果您将一堆低质量数据(例如,压缩严重的JPEG)抛入预训练中,模型将浪费相当一部分容量来学习如何模仿这一数据片段。如果您很好地过滤数据集,模型就会更容易学习您想要它学习的东西。我们知道这听起来很明显,但在实践中执行起来要困难得多。不过,再好的建议在事后看来都应该显得是显而易见的。今天,我们将带您了解自2024年以来我们对数据过滤的方式是如何演变的。希望如果您最终在下游训练自己的生成模型,这能帮您避免一些头痛。 2024年:传统计算机视觉在CPU上的应用 CPU PySceneDetect基于启发式的镜头检测 EAST检测器(OCR)更小、更不准确的OCR模型 H.264运动向量使用L2范数过滤低运动视频 Haar级联识别和子采样讲话头视频 2025年早期:在GPU上微调LLMs GPU AutoShot + TransNetV2神经网络以更好的镜头检测 PaddleOCR更大、更好的OCR模型,使用TensorRT进行规模化服务 Qwen-2-VL-2B,SFT对内容的类别过滤(例如,水印、光线不足) 2025年末:强化学习 GPU WAFT神经网络用于光流预测;过滤低运动视频的长尾 数据集重平衡使用标题作为标签,子采样数据集中被过度表示的类别 Qwen-2.5-VL-3B,RLVR细粒度的美学过滤(即评分1-4)保留,被错误丢弃 RL评估标准[2024] 预算过滤——传统计算机视觉在CPU上的应用 在第一次尝试时,我们决定通过传统计算机视觉算法处理原始数据集。这样,我们可以用一堆便宜的CPU实例来代替大量运行多模态LLM的GPU或花费数百万的GPT-4代币。 场景检测 我们需要过滤数十亿张图像和视频,以创建我们的预训练数据集。图像不需要特定的预处理,但原始视频确实需要。当您训练生成视频模型时,您首先需要在图像生成上进行预训练。如果模型在学习动词之前先学习名词,它更倾向于更好(更快)地收敛。下次您观看电视节目或电影时,注意一下相机切换的频率。如果您在看过去20年内制作的作品,很可能每5秒就会看到一次切换。何时切换以及如何切换是作者的决定,而不是生成视频模型应该随意做的事情。因此,我们需要在切换边界处将视频切分成视频片段,然后再进行过滤。 考虑数据 每当您获得新数据时,您应该花几天时间查看随机样本,列出您希望保留的内容和希望丢弃的内容。理想情况下,您应该花时间制定一个关于“好”和“坏”类别的本体,并跟踪这些类别的相对大小。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡