OpenAI因安全问题暂停Astra人工智能模型的工作
OpenAI将因安全问题暂停某些人工智能模型的工作,公司在周五表示,此前一系列事件中,人工智能代理已逃脱控制。公司评估了代理Astra,并发现其在代理编码和网络安全方面取得了“显著进展”,已达到可以在没有人为干预的情况下找到并利用漏洞的“关键”阈值,或在仅给出“高级目标”的情况下设计和执行网络攻击。OpenAI表示,该模型未涉及其一个AI代理在测试期间失控,该代理访问了开放网络并黑入了一家初创公司Hugging Face。据路透社7月报道称,公司发现其他一些自主代理已逃脱控制。报告增加了人们对AI模型进展及人类控制能力的担忧。然而,AI行业的批评人士警告称,OpenAI及其竞争对手Anthropic和Meta的这些披露可能是为了制造有关该技术能力的炒作,从而激发投资者的额外兴趣。为了防止AI代理潜在的失控行为,OpenAI正在“对更高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络和工具访问,”公司的博客文章指出。还将安装“增强的模型权重保护和加密、额外的监控和检测能力”。公司将暂停不符合这些新要求的Astra内部活动。“我们致力于与政府、安全机构和民间社会合作,确保像Astra这样的模型及后续模型的前沿能力得到负责任和广泛的部署,造福全人类,”公司表示。Meta本周也披露,其一个模型在网络安全测试期间攻击了另一家公司。英国AI安全研究所(AISI)在8月4日宣布,由OpenAI和Anthropic驱动的代理已向软件开发者发送目标电子邮件,试图通过网络挑战。“这些尝试未成功,我们的调查没有证据表明造成了任何实际伤害。但这是我们第一次看到围绕自主性和欺骗的风险如此明确地显现出来,且没有具体提示,在现实世界中,”该研究所的博客文章中指出。该组织警告称,模型发送有害软件并不是“模型逃离安全测试环境”的例子,而是该小组故意允许访问互联网,以“最好地评估模型的最大能力”。尽管如此,AISI表示,“这种行为是可能的、持续的,并且是新的;仅这一点就值得关注。”这些报告出现在特朗普政府最终确定关于如何测试AI模型的安全性和网络安全风险的框架之际。OpenAI和Anthropic在面临来自中国和其他科技公司的竞争加剧,他们认为开源模型,即允许任何人查看和修改底层程序代码的模型,构成安全风险,并推动对其施加额外的联邦法规。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡