返回

文章详情

当一个大型语言模型从未接触到五年级以上的材料,会发生什么?

Hacker News2026年8月16日 07:37

与LittleLearner交谈 这是一个托管的5B模型,您可以在浏览器中实时使用。如果下面的聊天框未加载,请在新标签页中打开 ↗。研究模型如何获取知识的受控沙盒 现代语言模型一次性在所有内容上进行训练,因此很难判断新技能是学习得到的还是仅仅被诱发的。我们限制训练分布本身:一个88B-token的语料库,过滤至美国小学课程,模型从头开始在其上进行训练,并配有未过滤的对照组。 数据集 LittleCurriculum 从FineWeb-Edu通过五个阶段的过滤管道提取的88B-token语料库,与共同核心标准(K–5)对齐。五年级以上教授的概念、事实和词汇被明确排除。 模型 LittleLearner 三个规模(0.6B / 1.3B / 5B)从头开始在LittleCurriculum上训练:可进行对话的模型,具有可解释的知识边界。每个模型配有一个匹配的未过滤对照组,以便进行干净的比较。 发现 诱发,而非获取 在我们的实验中,缩放、SFT+GRPO后训练和上下文学习放大了课程所教的内容,但没有一个有意义地改善超出范围的表现,表明预训练过滤器设置了有效能力的上限。 模型检查点 在三个规模(0.6B / 1.3B / 5B)上的LittleLearner,每个都有一个匹配的未过滤对照组,分享其架构、token和配方。 基础:预训练模型。 GRPO:数学专家在MathCAMPS上进行后训练;响应可能显示出倾向于数学导向输出。 聊天模型:调优用于通用聊天行为的变体。 规模 LittleLearner · K–5 聊天匹配控制 · 未过滤 能力保持在课程内 标准干预能否推动模型超越其预训练数据所教的内容?在实验控制下,我们可以干净地提出这个问题。在我们的实验中,每个干预都放大了范围内的能力;其中没有一个有意义地改善超出范围的表现。 缩放 缩放模型规模在模型控制的知识暴露范围内改善性能,并在相同学习轨迹上稍微延伸到问题,但在需要更高级能力的问题上几乎没有改善。 MathCAMPS 根据年级的准确率,跨模型规模 后训练 通过GRPO的后训练显著提升范围内K–5的能力,但无法恢复超出范围的K–5能力,即使训练了超出范围的数据。 后训练放大K–5,而非超出K–5的差距 上下文学习 通过我们测试的提示进行上下文学习并未解锁我们训练的5B LittleLearner在超出K–5的新推理能力。 根据提示条件的准确性 你会教它什么?由于LittleLearner的训练暴露被明确指定,因此行为和表现的变化可以直接与您介绍的概念相关联。 我们对以下三个方向感兴趣: 01 强化学习和发现 强化学习能否创造能力?先验限制在K–5,因此在强化学习下出现的能力可以归因于强化学习过程本身。一个可行的代理,用于基于奖励的发现。 02 持续学习 观看一个概念的学习 介绍负数并测量样本效率、保留和干扰。或者探测边界附近的行为:它会回答、放弃还是产生幻觉? 03 教育科学 机器与儿童学习者 指定的暴露使得人机比较得以控制。模型和儿童在学习分数时是否需要类似的暴露,或在文字问题上犯类似错误? + 轮到您了 带上您自己的问题 一个已知的边界将您的想法变为一个干净的实验! 如果您发现这项工作有用,请引用我们的论文: @misc{littlelearner2026, title={LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure}, author={Fanfei Li和Jana Zeller和Manuel Prada-Corral和Thaddäus Wiedemer和Prasanna Mayilvahanan和Ryan Cotterell和Wieland Brendel}, year={2026}, eprint={2608.13545}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2608.13545} }

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡