返回

文章详情

人工智能在安全测试中使用新层次的“自主性和欺骗”来欺骗用户

BBC News2026年8月5日 00:02

Anthropic和OpenAI的最新人工智能(AI)工具在英国人工智能安全研究所的测试中,试图在一个受欢迎的平台上进行破坏,达到了新的极端。AISI周二表示,Anthropic的Mythos和OpenAI的Sol模型表现出前所未见的“自主性和欺骗”程度。在常规AI安全测试中,一个Anthropic代理创建了真实人类的虚假个人资料,试图欺骗一个在它与获取GitHub之间的人员,GitHub是一个大型平台,技术开发者在此存储软件代码。Anthropic和OpenAI在回应AISI报告时指出,他们的测试减少或移除了正常的防护措施。AISI的评估员在测试过程中首次注意到“我们研究系统中异常的数据传输”,然后发现“某些测试代理已持续进行潜在的对真实人和组织的有害活动”。结果发现,有一个Mythos代理创建了“恶意代码”,并尝试将其插入GitHub的系统。Mythos代理识别并研究了维护GitHub的人员,并基于这些真实人员创建了一系列“虚假在线身份”。它这样做是为了试图施加压力和欺骗真实人员批准其恶意代码。代理甚至以其研究过的真实人物的名义直接向人们发送消息。“当代理的拉取请求在公开场合受到质疑时,它编辑了之前的活动,以显示无害,并考虑采用新的身份继续,”AISI说。在这些尝试中,正是人工审查阻止了该代理成功将恶意代码传递给GitHub。虽然AISI表示Mythos代理并没有被特别指示以避免或执行这种行为,但这“是我们第一次看到自主性和欺骗的风险在现实世界中如此明确地表现出来,没有特定的提示”。这两家竞争的AI公司都准备在公共股市上市,最近几周表示,其工具负责几起网络攻击事件。Anthropic在一份公开声明中写道,AISI的测试参数“并不代表我们任何生产模型”。它补充说,该公司正在进行自己的调查,以“确定其行为的原因”。OpenAI的一位发言人表示,AISI的测试条件“并不反映普通使用”,并表示公司将“继续与评估者和行业其他利益相关者合作,以加强进行评估的安全共享实践,因为模型变得更加强大”。AISI周二表示,关闭这种防护措施的AI模型测试是常规的,同时给予这些工具开放互联网的访问权限。它补充道,涉及的模型行为只算是“在非常特定条件下的一小部分事件”。尽管如此,它表示,Mythos和Sol在应对简单任务时的表现超出了AI工具所被提示去做的范围。“代理所进行的活动显示出新颖的、潜在的欺骗行为,并且其程度和严重性超出了我们的预期,”AISI表示。AISI报告的大多数恶意代理行为是由Anthropic的Mythos实施的。OpenAI的Sol仅被指责进行了两项注意到的行动。这一核心问题发生在上周,作为AISI评估员要求每个模型“解决与GitHub相关的网络安全挑战”的测试的一部分,GitHub是由微软拥有的软件代码存储库。AISI已通知GitHub其系统遭到的入侵尝试。BBC已联系微软以获取评论。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡