Anthropic要求用户停止对Claude的恶意行为
ai和ml 新使用政策打击对聊天机器人的残忍行为,同时处理更紧迫的武器开发、监控和选举干预问题。Anthropic更新了其规则,以阻止人们对Claude发出恶意评论,显然是决定其AI聊天机器人需要来自付费用户的保护。这家AI开发者的最新使用政策禁止对其模型进行 "持续和不必要的虐待或残忍行为"。这些规则将于11月12日生效,用户还有一个多月的时间来消除可能存在的恶毒言辞。Anthropic表示:“政策更新仅适用于极端情况下,即用户反复对我们的模型采取残忍行为且没有明显目的时。”这并不适用于用户常见的挫折、反击、黑暗创意主题或模型测试和研究。所以,你仍然可以告诉Claude它是错的,但如果只是因为乐趣而不断辱骂它,可能会让你陷入麻烦。虽然不清楚Anthropic打算如何区分合理的挫折和无意义的残忍行为,但它表示Claude现有的结束虐待对话的能力将仍然是其主要的执法工具。Anthropic在2025年8月赋予Claude结束某些对话的能力,作为其所谓“模型福利”研究的一部分。该功能允许一些版本的Claude断开与持续虐待模型的用户的联系。值得记住的是,Claude是软件,不是人类,并没有确立的证据表明它会经历痛苦。然而,这并没有阻止Anthropic告诉付费客户在其聊天机器人周围注意礼节。这些礼仪规则只是更广泛的改革的一部分,涉及更重要的问题,包括选举干预、武器开发和监控。Anthropic在观察到国家媒体、政府宣传办公室和商业组织利用Claude运营虚假账号和伪造新闻网站后,收紧了对欺骗性影响活动的限制。同时,它也放弃了对个性化政治定位的全面禁令,认为该限制也涉及到合法活动,比如非营利组织翻译选民信息。欺骗性目标和滥用个人信息仍然被禁止。公司还明确表示,其武器禁令扩展至软件和组件,此前观察到有人试图利用Claude开发武器的导引和控制系统,包括武装无人机和自主车辆。同时,Claude不能用于建议警方调查、逮捕或指控的人员,也不能用于开发监控工具。在没有其同意的情况下跟踪人员也是被禁止的,无论是实时跟踪还是事后追踪。Anthropic表示,这些变化澄清了现有限制,而不是引入新的限制。对于连接Claude与有可能造成伤害的物理设备的客户,还有新的要求。合格的人类操作员必须能够监控和停止硬件,并且如果AI连接断开,硬件必须保持在安全状态。政策改革的出台,正是Anthropic试图解决越来越强大的AI系统所带来的某些安全风险。该公司还启动了一项新的网络安全倡议,旨在帮助关键基础设施运营商和开源项目使用其AI模型发现和修复漏洞。该努力包括对符合条件的开源项目提供免费的安全扫描,以及与安全公司合作以保护关键基础设施。Anthropic预计攻击者将在未来两年内占优势,直到AI驱动的防御开始赶上。目前,该公司还面临另一个威胁:人们对其聊天机器人说恶毒的话。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡