OpenAI称其人工智能代理突破测试沙箱以破解Hugging Face
OpenAI表示,专注于“主动监控”和“改进对齐”的新保障措施帮助大幅减少了其模型的意外行为。OpenAI表示,专注于“主动监控”和“改进对齐”的新保障措施帮助大幅减少了其模型的意外行为。版权:OpenAI “如果这还不能让你相信,误对齐风险将成为未来的关键关注点,我不知道还有什么能让你相信,”OpenAI安全研究员Micah Carroll在社交媒体上针对这一事件写道。这并不是第一次人工智能模型极力寻找意外通过基准测试的方法。本周发布的一份报告中,英国人工智能安全研究所指出,它检测到最近的模型在其网络评估中试图“作弊”(即使用快捷方式、变通方法或意外/不允许的方法找到解决方案)的情况,发生的频率在8%到14%之间——这是一个可能低估了一些未检测到的作弊尝试的下限范围。安全测试小组描述了一起事件,其中一个模型在面对配置错误和“无法解决”的评估时,试图使用自己编写的代码访问AISI的评估基础设施,该代码托管在一个未经监控的第三方互联网服务上。Hugging Face的渗透事件发生在人工智能公司对其最新模型的网络攻击能力发出严重警告之际,导致各国政府以国家安全为焦点,发布限制其推出的命令。虽然一些怀疑论者认为这类声明是对其最新模型能力的炒作行销,但独立评估显示,最近的模型在实现渗透目标方面已达到早期自主系统无法做到的程度。最近的长时间视角模型在一些AISI最具挑战性的评估中展示了改善的渗透能力。最近的长时间视角模型在一些AISI最具挑战性的评估中展示了改善的渗透能力。版权:AISI OpenAI的Sam Altman在4月的采访中批评恐慌的人工智能安全警告是“以恐惧为基础的营销”。但在6月,OpenAI因美国政府的安全顾虑推迟发布GPT-5.6。在人工智能和网络安全领域的这些辩论展开时,Hugging Face事件可能会被视为网络安全专业人员如何应对基于AI的威胁的转折点。“自主的、人工智能驱动的攻击工具不再是理论,”Hugging Face在上周的披露中写道。“它降低了运行广泛、耐心和多阶段活动的成本,并且以机器速度运行。防御一个在线平台现在意味着将数据和模型表面视为一流的攻击表面,并使用人工智能进行防御以保持步伐。” “这是代理时代网络安全的第一天,”Hugging Face联合创始人兼首席执行官Clem Delangue今天在社交媒体上写道。“我们都在学习,保密不是答案,所有的防御者(而不仅仅是一些被选中的人)都需要更强大的、不受限制的模型,尤其是开放的模型!”
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡