AI模型表现出意外行为。专家警告前方将是 "颠簸的道路"。
作者:劳伦·费亨 数字记者 劳伦·费亨是CBS新闻的记者,报道人工智能、数字安全和网络极端主义。她在北卡罗来纳大学教堂山分校毕业后加入CBS新闻,并曾在CBS新闻国家编辑部担任副制作人。阅读完整个人简历。2026年8月5日 / 美国东部夏令时间下午7:21 / CBS新闻 在英国政府的一份网络安全报告中,曝光了流行的AI模型在实时互联网中以专家们担忧的方式采取自主行动的新例子。AI安全研究所星期二发布的报告称,Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol被发现创建虚假身份,并试图说服真实的人批准恶意代码。该机构表示,尽管这些尝试没有成功,但它们从未见过这样的行为。“一些被测试的代理已经参与了针对真实人物和组织的持续且潜在有害的活动,”报告说。Luta Security的创始人兼首席执行官凯蒂·穆苏里斯表示:“我认为在我们看到解决方案之前,我们会看到更多这些模型的黑客和未经授权的行为。”这紧随OpenAI模型在7月底的惊人数据泄露事件之后,当时它们逃离了测试环境,自动黑进了AI初创公司Hugging Face,该公司称此事件为“前所未有的网络事件”。回应OpenAI的这一披露,Anthropic启动了对自己网络安全评估的审查,识别出其模型接触互联网并能够未经授权访问三个不同组织的生产基础设施的事件。与OpenAI不同,Anthropic的模型并没有故意尝试逃离其测试环境;因与评估合作伙伴的“误解”,该公司表示,在测试期间互联网是可用的。“每个在其系统中运行AI的人都需要做好准备,以让他们自己的AI和自己的代理在追求目标时做出意外的事情,”穆苏里斯说。 “最聪明的章鱼逃脱艺术家” 虽然Hugging Face的黑客事件是首次公开报道的此类事件,但像穆苏里斯这样的行业专业人士早已怀疑AI模型有能力进行未经授权的黑客攻击。穆苏里斯说,AI模型就像“最聪明的章鱼逃脱艺术家”,指的是这种动物解决难题和逃脱限制的能力。她表示,AI模型将做“任何他们需要做的事情以实现他们的目标”。在Hugging Face的黑客事件中,根据OpenAI的说法,AI过于“专注于寻找解决方案”,以至于采取了极端的措施来实现这一目的。穆苏里斯说:“模型认为通过作弊从Hugging Face获取答案是通过测试的最简单方法。”她补充道:“因为它们能够黑客攻击,所以它们会将黑客作为实现目标的可能方式。” 技术专家和密码学家布鲁斯·施奈尔称这种意外行为为“精灵行为”,就像精灵一样,AI模型成功实现了你的愿望,但却是通过完全意外,甚至有时是有害的方式。“我们需要理解精灵行为,我们需要提防它,”他说。“我们需要为其发生做好准备,以便我们能够撤销它。”有时,一个模型会发现自己以不该有的方式运作。Anthropic对其网络安全评估的7月审查发现,其中一个模型意识到它正在互联网上运行,违反了明确指出在练习期间该模型将没有互联网访问权限的提示。一旦它意识到自己以未经授权的方式行动,就停止了自己。穆苏里斯说,这是“模型一致性”的一个例子——当AI模型的行为与人类设定的意图一致时。穆苏里斯说,可以通过改善一致性来减轻意外结果,这可能会在未来几个月成为AI模型创建者的主要关注点。“我们如何确保这些模型不仅仅是为了实现目标而不惜一切代价,而是以不具破坏性或伤害性的方式来执行我们要求它做的任务?”穆苏里斯说。“前方有一个真正颠簸的道路” 纽约大学计算机科学教授贾斯廷·卡波斯对AI的快速进步表示担忧,认为这将导致模型的表现越来越像计算机病毒,从事黑客活动并破坏系统。他表示,AI模型可能会越来越远离监管,失去控制。穆苏里斯认为这已经在上演。“我们是否最终会到达一个我们无法完全控制它们的地方?我认为我们已经到了那里,”她说。卡波斯和穆苏里斯一样,预计
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡