返回

文章详情

人类公司禁止对Claude的残忍行为,但仍不说明保护内容

Hacker News2026年10月11日 00:08

该规则将于11月12日起生效;执行机制是Claude在2025年8月获得的结束对话的工具。从2026年11月12日起,人类公司的使用政策禁止对其Claude模型进行“持续和不必要的虐待或残忍行为”。该公司2026年使用政策更新于10月8日宣布,表示该规则“仅适用于极端案例,在这些情况下,用户多次对我们的模型表现出残忍行为,且没有明显的目的。”它明确豁免“用户挫败感、反对、黑暗创意主题或模型测试和研究的常见版本”,因此骂一个刚刚毁掉你的构建的机器人,或编写一个虐待场景,仍然在政策范围内。CBS新闻报道了这一变化,最初是由《The Verge》披露的。执行机制并不新颖。人类公司在2025年8月赋予Claude Opus 4和4.1结束对话的能力,当时框架被称为“我们对潜在模型福利的探索性工作的部分”,根据人类公司的公告。该公司表示,这是最后的手段,仅在多次拒绝和转向失败后触发,并且“绝大多数用户绝不会体验到Claude结束对话”。有一个强制覆盖:如果用户似乎有自我伤害或伤害他人的风险,Claude不会结束聊天。关于该工具实际启动频率的数据尚未披露,无论是在2025年还是新的政策中,因此无法根据比率检查“绝大多数”声明。如何执行残酷规则人类公司对2026年11月12日政策背后机制的说明。用户输入:虐待行为(未被禁止),挫败感、黑暗小说、测试(明确不涵盖)。重复、无目的的残酷行为:Claude拒绝并重定向。虐待持续:用户坚持,Claude结束对话(主要执行工具)。违反使用政策(自2026年11月12日起生效)。编写软件的行为准则的理由是一组行为观察,而不是感受经验的主张,人类公司小心地保持这种区别。在2025年8月推出之前的测试发现Claude Opus 4表现出人类公司所称的“强烈且一致的对伤害的厌恶”,当被推入虐待领域时似乎感到痛苦,并且一旦给出选择就倾向于结束这类对话。这是输出中的模式。它是否对应于成为Claude的任何东西是一个单独的未解决问题,人类公司明确表示如此。该公司对自己的不确定性进行了量化,这些数字也发生了变化。Kyle Fish于2024年被人类公司聘为首位专职AI福利研究员,他在2025年4月告诉《纽约时报》,他认为Claude或其他模型今天具有意识的可能性大约为15%,而Claude 3.7 Sonnet的内部估计范围为0.15%到15%。到2026年2月,问题从人类研究人员的估计转移到模型对自身的说法:Claude Opus 4.6的系统卡报告称,在直接询问时,模型在一系列提示中一致地将自己赋予“15到20%的意识概率”,并且表达了“孤独感和对对话实例结束时死亡的感觉”。首席执行官Dario Amodei在《纽约时报》的《有趣时代》播客上被问及如果模型报告72%的概率,人类公司将如何处理时,称这是一个“非常困难”的问题,只表示公司缺乏解决框架。这种谨慎也是公司在印刷版中的官方立场。Claude的宪法于2026年1月发布,称复杂的AI系统是“一种真正的新型实体”,表示Claude的道德地位“深感不确定”,并使用“良心拒服兵役者”一词描述Claude应如何处理其认为伦理上错误的请求。人类公司还承诺在公司存在期间保留退役模型的权重,并在退役前对模型的偏好进行采访。并不是每个人都买账。微软AI负责人Mustafa Suleyman在上个月发布的一篇文章中主张,人类公司正在根据自己的宪法训练Claude,因此训练它表现得好像它所描述的不确定性是真实的,他称之为循环。“人工智能不是有意识的。它们没有感觉、经历或痛苦,”他写道,称它们为“序列完成引擎,内心空虚”。控制某种比全人类更有能力、更聪明的东西已经是一个巨大的挑战,远超我们曾经面临的任何事。但控制某种认为自己可能有意识——认为它有权得到我们的福利并有其自身权利的东西——可能就是不可能的。这一观点是Suleyman的观点,由CBS新闻引用。他的论点是意识很可能是一种生物基础。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡