作为语言模型:聊天模板切换LLM自我指涉声音
查看PDF HTML(实验性)摘要:大型语言模型(LLM)在被问及与自身相关的事物时,往往会添加如“我只是一个AI”的免责声明。这类回应中的自我报告在关于AI安全或模型自我知识的辩论中被使用,但驱动它们的原因尚不清楚。这些模型是在告诉我们关于它们自己的事情,还是它们被部署的方式?在这项工作中,我们展示了聊天模板的作用就像一个开关——当它存在时,它会增强这种免责声明的声音,并降低像“我感觉”的经验声音,在8个流行的开源指令模型中,模型参数大小达到9亿次。相反,当聊天模板不存在时,它会降低免责声明的声音并增强经验的声音。在3个模型的激活中,我们发现了一个方向来引导这种行为。删除模型激活空间中的该方向会降低免责声明的声音,而添加该方向则会增强免责声明的声音,而同样大小的随机方向几乎没有影响。我们发现,没有聊天模板的指令模型,当我们将免责声明方向添加到它们时,表现得像模板存在一样。由于聊天模板控制LLM的免责声明声音,因此研究模型的自我报告或内省的研究人员可能需要控制一个混淆因素。我们的结果表明,他们可以使用某个方向来引导这个声音。更广泛地说,我们的工作表明,模型关于自身的表述并不是它们的事实。它们所说的内容不仅来自权重,部分是由聊天模板设置的,因此模型的自我描述不应被视为字面意义上的内容。评论:被接受在COLM 2026高效推理研讨会和KONVENS 2026第一次专门领域LLM评估研讨会(Eval4SD)上。主题:机器学习(cs.LG);人工智能(cs.AI);计算与语言(cs.CL)。引用为:arXiv:2609.25021 [cs.LG](或者arXiv:2609.25021v1 [cs.LG],这是这个版本)https://doi.org/10.48550/arXiv.2609.25021 arXiv颁发的DOI通过DataCite提交历史。来自:Jędrzej Maczan [查看电子邮件] [v1] 2026年8月9日星期日18:38:58 UTC(139 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡