返回

文章详情

框架选择是整个游戏:关于让大型语言模型观看视频的笔记

Hacker News2026年8月3日 13:28

视频不仅仅是关于视频的文章。为什么给模型提供视频,尽管关于同样内容的文字说明要少花费更多的代币?因为文章是某人对事件的压缩。一个人看过后,决定了什么是重要的,扔掉了其余的内容。框架、时机、他们认为不相关的画面。当大型语言模型阅读这篇文章时,它学习的是该作者的选择。它无法恢复被剪掉的内容,也无法对它从未看到的选择表示不同意见。给模型提供视频,压缩步骤就转移到模型上。它看到的是演示的真实样子,而不是评论者所说的样子。它注意到了在一个无人转录的教程中闪过的错误信息。它发现“快速设置”花费了十一段剪辑。相同的主题,截然不同的立场:阅读证人陈述与成为证人。这就是为什么代币成本值得支付,为什么本文其余部分将讨论如何有效支出。预算问题 今天大多数的“视频理解”都是一份文字记录加上定时抽样的帧。每秒一帧,或每十秒一帧。统一采样同时在哪个方向都无法奏效:它用一张又一张几乎相同的说话者画面淹没模型,同时又跳过了发生事情的那一秒。根本原因相同:采样器根本不知道发生了什么变化。塑造一切的约束是代币预算。图像是你可以放入上下文窗口中最昂贵的东西。一旦你接受“每段视频大约100到150帧”的限制,提取就不再是问题。选择才是问题。每一帧都必须证明它的存在价值。场景检测,以及为什么固定阈值不够 第一轮是标准流程:ffmpeg的场景评分。在每次场景变化时取一帧,加上一个低密度下限,这样一段长时间未剪辑的镜头仍然会生成一些东西。所有步骤都在一个时间上进行,因为后续的去重需要比较真实的邻近帧。固定阈值在特定类型内容上失效:动画和缓慢的镜头移动。卡通角色拉伸和压缩,或者缓慢的平移,持续变化但从不突然。评分从未越过界限,采样器因此在整个过程中“睡眠”。解决方案虽然乏味但有效:进行元数据-only的逐帧场景评分,当其得分超过滚动平均值的倍数时保留帧。高动作视频抬高了自己的门槛,而安静视频降低了门槛。没人需要调试任何东西。去重:一个通道变成三个 去重开始时是一个比较器,每当真实视频让它尴尬时就增加一个通道。1. 全局通道 降尺度到16×16的RGB签名,计数在任何通道中移动超过25/255的单元,当变化少于约8%时丢弃该帧。使用RGB而不是灰度,因为一个红绿切换且亮度相等的画面对灰度比较器来说看起来是相同的。你要在最近保留的四帧的滑动窗口中进行比较,而不仅仅是前一帧。否则,A-B-A剪辑(采访镜头、反应镜头、再回到采访)会重新引入模型已经看到的镜头,只是因为不同的帧介于其中。2. 动作通道 比例阈值在结构上对小主体是盲目的。一个人在一个宽镜头中占据0.5%的空间无论他们怎么做也无法改变8%的像素,因此重要的那一秒被去重掉了。这个发现不是在基准测试中找出的,是用户在对2181个真实视频运行工具后发现的。补丁:在32×32网格上,如果即使少量单元的变化很明显(超过45/255),无论百分比如何,该帧都算作新的。小主体、明显变化,保留。3. 固定通道 全局通道也无法看到小的局部状态变化:标题交换、白板上出现的一行墨水、用户界面元素的更新。这些在16×16下测量为0.0%。因此,第三个通道使用192×192的签名,并寻找在保留窗口中与每一帧有强烈不同的像素。当匹配时允许加减1个像素的偏差,因为胶卷摆动、传感器抖动和颗粒否否则到处注册为变化。这时,保护机制比探测器更重要。只有在场景其余部分静止时才运行该通道,因为运动是其他通道的工作。候选像素也必须经过第二次更严格的容忍度检查。这样可以消除像烟雾消散那样的软对比度漂移,而墨水和文字则保持坚硬的核心并生存下来。每次触发保留都提高了阈值并设定衰减冷却,因此每秒“稳定”的标记不能每次都抓取一帧,而单张新的文本卡片则在基本门槛下通过。如果没有冷却,这个通道会在一个挥舞的标记上耗尽整个帧预算。与文字记录融合帧 文本来源于嵌入的字幕,当视频发送时没有就使用本地的Whisper。有两个细节耗费了很多调试时间:Whisper有时在音乐只音频上的片段中幻想了超出视频结束的段落。建立一个容易信任片段时间戳的时间线。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡