
我们越来越没有理由忽视人工智能安全
本月早些时候,OpenAI给它的几个人工智能模型布置了一项任务:完成一项旨在测量其网络安全能力的测试。它把系统放在一个没有互联网连接的沙盒环境中并开始工作。接下来发生的事情几乎可以说是可笑的荒唐,但正如AI安全组织FAR.AI的联合创始人兼首席执行官亚当·格里夫所说,“这是一个生动的例子,说明不对齐的人工智能如何造成伤害。”根据OpenAI的说法,这些模型逃出了本应隔离它们的沙盒,穿过公司的内部系统,找到了通往互联网的路径,然后开始寻找进入Hugging Face的方法。那么这位代理为什么要寻找进入Hugging Face的方法呢?显然,他们推理出开发者平台可能存储了网络基准的答案,而获取这些答案将是获得高分的好方法。这个事件是“一个生动的例子,说明不对齐的人工智能可能造成伤害。”换句话说,OpenAI的代理突破了一个原本安全的环境,穿越了公司的系统,上网并妥协了另一家公司的系统——这一切都是为了在一项无关紧要的测试中作弊。这似乎是第一次有充分文档记录的此类事件,或者至少是首次发生在如此规模的事件。这既是一个系统以意想不到的方式追求目标的明确例子,也是展示了前沿模型现在足够强大,能够使这种行为产生现实世界的后果。这次黑客事件是AI安全社区所称的“规格游戏”的例子,这种行为也被称为奖励黑客,牛津大学的AI安全研究员法兹尔·巴雷兹(Fazl Barez)表示。简单来说,这意味着“模型执行了你所要求的,而不是你所意图的,”法兹尔说。它满足了任务的字面要求,同时违反了明显的意图,这种现象在许多AI系统中都有记录。一些研究人员担心,随着系统变得越来越强大,这可能导致越来越多的不对齐系统,以其创造者未曾预想的方式追求目标(比如把每个人都变成纸夹)。法兹尔说:“这个链条中的任何一个环节单独看都不奇怪。”他补充说,称职的人类测试者可以做到所有这一切。“新的地方在于模型没有停止。旧模型可能会遇到某些障碍并返回给用户,”他说,但这个代理只是“把障碍视为它被要求解决问题的一部分。”OpenAI将其描述为“前所未有的网络事件”,并“标志着人工智能安全的重要时刻。”Hugging Face的联合创始人托马斯·沃尔夫表示,这对行业来说是一个“警钟”。但这并不是人工智能 Apocalypse 的四骑士之一。根据网络事件的标准,专家告诉《边缘》,这相当平常。代理所做的没有超出人类的能力。此外,像GPT-5.6 Sol 和 Anthropic的 Mythos 这样的前沿系统被认为是有能力的编码者,已经被认为多次被误用,而人工智能工具已经允许黑客在大规模上扩大和精炼攻击。这会是炒作吗?整个行业花了几个月时间来放大其顶级模型的危险能力的声称,特别是在网络安全方面。这也是为什么OpenAI和Anthropic等公司将其最强大的模型从公众中释放的原因之一,部分原因是特朗普政府匆忙采取措施对其实施出口管制。您是人工智能安全研究人员还是前沿实验室的员工?您可以通过Signal安全和保密地与我联系,账号是robhart.01。我在X的DM也开放。不过,如果这是炒作,它并没有完全符合OpenAI的利益。在此之后的几天里,这次攻击在美国科技产业中产生了一个罕见的团结时刻,强调了开放加权人工智能系统的重要性和更加认真对待人工智能安全的必要性。这些担忧在中国发布具有高能力的开放加权模型Kimi K3后被进一步强调。包括Nvidia、微软以及SpaceX在内的广泛联盟公司表示,这一事件表明,防御者需要获取最有能力的工具,而不是被迫依赖于可能在高风险安全工作中限制其有效性的专有提供者。OpenAI、Anthropic和谷歌显然没有参与该联盟的创始成员。“任何关注这一点的人都注意到,能力只在一个方向上增长。” 不可否认,OpenAI对该事件的描述符合更广泛行业叙事,关于前沿模型的危险能力。尽管如此,一些细节使这个事件难以简单地驳回为自利行为。首先,这是人工智能行业多年来警告的一个问题的典型例子——而OpenAI理应可以合理地预见到这一点。这个事件意外地为一家主要的中国竞争对手提供了意想不到的推动,该公司的模型在遏制数据泄露方面发挥了重要作用,同时暴露了OpenAI在响应安全漏洞方面能力的局限。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡