现实中的连锁思维推理并不总是可信的
查看PDF HTML(实验性) 摘要:最近的研究表明,当面临提示中的明确偏见时,模型通常会在其连锁思维(CoT)输出中省略提及这些偏见,这揭示了口头推理可能会给出模型得出结论过程的错误印象(不可信性)。在这项工作中,我们展示了不可信的CoT在自然措辞的非对抗性提示中也会发生,而无需添加人为偏见或编辑模型输出。我们发现,当单独呈现问题“X是否大于Y?”和“Y是否大于X?”时,模型有时会产生表面上连贯的论点,以系统地回答“是”或“否”,尽管存在矛盾。我们提供初步证据表明,这归因于模型对“是”或“否”的隐性偏见,将其标记为隐性事后合理化。我们的结果显示,生成模型的错误率高达13%,虽然前沿模型更加可信,但没有一个是完全可信的,包括思维模型,如DeepSeek R1(0.37%)和Sonnet 3.7(0.04%)。我们还研究了不可信的不合逻辑捷径,其中模型使用微妙的不合逻辑推理,使对困难数学问题的推测性答案看起来经过严格证明。我们的发现表明,虽然CoT可以用于评估输出,但它并不能完全反映导致模型答案的内部过程,并且在自主或安全关键的环境中应谨慎使用。 评论:发表在第43届国际机器学习大会(ICML 2026)主题:人工智能(cs.AI);计算与语言(cs.CL);机器学习(cs.LG)引用为:arXiv:2503.08679 [cs.AI](或arXiv:2503.08679v6 [cs.AI],此版本) https://doi.org/10.48550/arXiv.2503.08679 arXiv已发DOI通过DataCite 提交历史:来自:Iván Arcuschin [查看电子邮件] [v1] 2025年3月11日星期二17:56:30 UTC(4,311 KB) [v2] 2025年3月13日星期四17:49:58 UTC(4,348 KB) [v3] 2025年3月19日星期三19:20:42 UTC(4,349 KB) [v4] 2025年6月17日星期二17:59:57 UTC(2,337 KB) [v5] 2026年5月29日星期五17:38:22 UTC(2,378 KB) [v6] 2026年6月16日星期二17:36:22 UTC(2,378 KB)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡