大型语言模型中的突现内省意识
查看 PDF HTML(实验性)摘要:我们研究大型语言模型是否可以对其内部状态进行内省。仅通过对话很难回答这个问题,因为真正的内省无法与虚构区分开来。在这里,我们通过将已知概念的表征注入模型的激活状态,来解决这一挑战,并测量这些操作对模型自我报告状态的影响。我们发现,在某些情况下,模型能够注意到注入概念的存在并准确识别它们。模型展示了回忆先前内部表征的能力,并能够将它们与原始文本输入区分开来。显著的是,我们发现某些模型可以利用其回忆先前意图的能力来区分其自身输出与人工预填充内容。在所有这些实验中,Claude Opus 4 和 4.1 是我们测试的最强大模型,通常表现出最强的内省意识;然而,各模型之间的趋势复杂且对训练后策略敏感。最后,我们探讨模型是否能够明确控制其内部表征,发现模型在被指示或激励去 "思考" 一个概念时能够调节其激活状态。总体而言,我们的结果表明,当前的语言模型在一定程度上具备对其自身内部状态的功能性内省意识。我们强调,现今模型的这种能力高度不可靠且依赖于上下文;然而,随着模型能力的进一步改进,这种能力可能会继续发展。主题:计算与语言 (cs.CL);人工智能 (cs.AI) 引用为:arXiv:2601.01828 [cs.CL](或 arXiv:2601.01828v1 [cs.CL] 版本) https://doi.org/10.48550/arXiv.2601.01828 arXiv 发布的 DOI 通过 DataCite 提交历史:来自:Jack Lindsey [查看电子邮件] [v1] 2026年1月5日周一 06:47:41 UTC (33,806 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡