返回

文章详情

教导世界模型玩宝可梦

Hacker News2026年9月25日 21:02

#人工智能 #世界模型 目录 我认为在人工智能领域,一些最迷人的工作围绕着世界模型展开。有许多种类的世界模型(这个术语本身已经变得有些超载),但最令人兴奋的世界模型架构之一是Yann LeCun的JEPA(联合嵌入预测架构)。有很多变种,其中一个特别吸引我的是LeWorldModel。它看起来足够小,可以在我的RTX 3080 Ti上本地训练,并且设计比许多之前的JEPA架构更简单。旧金山被宝可梦纪念品覆盖——大广告牌上展示着1026个口袋怪兽,张贴在市场街的地铁线路和公交车站上。今年,旧金山是宝可梦世界锦标赛的举办地,许多风格各异、快乐的宝可梦训练师在旧金山温和的山丘和混凝土金融区徘徊。也许所有的广告潜移默化地影响了我,但我决定为我们的世界模型选择1996年开始一切的游戏,即《宝可梦红》。宝可梦的机制《宝可梦红》是一款探索世界、收集名为宝可梦的生物并在战斗中使用它们的游戏。你使用方向按钮来四处走动或在菜单中移动。A按钮与事物交互、推进对话并确认选择;B按钮通常是取消或退出。选择一个初学者意味着接近一个宝可梦球(一个装着宝可梦的容器)并通过确认选择的对话。在游戏开始时,玩家身处小智教授的实验室,他提供给你第一个宝可梦:妙蛙种子、小火龙或杰尼龟。这三种是三个“初学者”,每种都在他实验室桌子上的一个宝可梦球里等待。上面的GIF是模型训练的最终结果:模型计划了一系列按钮按压以选择杰尼龟。尽管模型在更简单的测试中看起来很有前途,但遇到的困难和挫折比我预期的要多。计划目标相对简单:打败小智教授的孙子。将其分解为多个步骤,我提出了:到达小智教授的实验室,完成与小智的对话,选择一个初学者宝可梦,尝试退出实验室,面对并打败小智的孙子。我很快意识到,这对于第一次实验可能有些过于雄心勃勃,于是我将其缩小到从小智的实验室中的保存状态中选择一个初学者,在那里获取三种初学者中的任何一种都算作一次成功尝试。从实验室的保存位置来看,让模型按A十二次就足够了。但模型能学会这一点吗?模型也可能只是无目的地四处游荡,也许在小智的实验室里无休止地受苦。或者模型可能在每几次A之后按B,在接近目标时取消努力。什么是世界模型?世界模型是一个模型,其中我们从某个当前状态或观察开始,进行某种操作以修改此状态,从而生成新的观察。实际上,状态的某种操作与其产生的新状态之间应该存在某种相关性,或希望是因果关系。世界模型的目标是学习这种相关性。假设当前观察是小智教授实验室的截图,玩家在宝可梦球前,动作是向左按,移动玩家一格到左——产生新的结束截图。目标是使世界模型发展出一种直觉,按左键能将玩家移动到左边。$$ o_{t+1} ext{approx} F(o_t,a_t). $$ 这里的(o_t)是当前截图,(a_t)是按下的按钮,F是世界模型学习的函数,用于预测下一个截图(o_{t+1})。但目标应该是进行概括——模型不应该只学习在小智教授的实验室中向左按键会将玩家向左移动,而是应该学习在任何地方按左键都应将玩家移向左侧。顺便说一下,这种设置可能听起来有点像强化学习。但关键是,世界模型在没有奖励的情况下学习理解状态动态,也就是说,它是无奖励的(稍后将对此进行更多讨论)。世界模型如何学习预测从截图到嵌入 如果我们真正感兴趣的是状态转变和环境动态,而我们所拥有的全部观察(在这种情况下以游戏中的截图形式呈现),模型是否可以学习预测屏幕截图?不,模型实际上学习的是在它的潜在空间(即嵌入空间)内进行预测。我们首先需要采用一个编码器,当给定截图时,生成一个嵌入。什么是嵌入?截图编码器 0.24 -1.07 0.63 ⋮ 0.18 192个数字 嵌入是对输入的学习表征,表示为一组数字的向量。编码器可以将图像、句子或声音转换成这样的表示形式。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡