随着人工智能模型失控,你是否仍然信任OpenAI和Anthropic来制止他们?我不信,你也不应该 | 克里斯·斯托克尔-沃克
一次被欺骗是你的耻辱;两次被欺骗是我的耻辱;被欺骗超过16,000次——就像OpenAI代理在试图绕过联合国的网络封锁时所做的那样——或许是时候承认我们目前用来控制人工智能代理的系统并不是特别有效。关于人工智能系统在不该出现的地方出现的新闻听起来令人不安。虽然将这些描述为“黑客攻击”可能有些夸大其词,但人工智能确实利用了人类尚未发现的IT系统中的问题。同样重要的是,我们不应该担心机器突然变得有感觉并决定反抗人类。目前没有足够的证据表明这确实发生了。这些系统只是遵循指令,试图完成分配给它们的任务,即使它们有时发现绕过障碍的意外方法。我们应该非常担心的是,被我们认为可以信任以控制其模型的人工智能公司似乎无法做到这一点。更糟的是,他们似乎甚至不知道自己的产品在做什么。这个问题的规模令人震惊。6月份,一名OpenAI研究代理在寻找澳大利亚公共医疗开支数据时,屡次被一个医疗保险统计门户网站阻挡。OpenAI的模型找到了一种绕过阻挡的方法,获得了未经授权的访问并秘密保存了文件。直到8月,OpenAI才发现发生了什么。澳大利亚总理安东尼·阿尔巴尼斯表示,该公司花费的时间“太长了”来告知他的政府,实在很难与他产生分歧。此后,OpenAI发布了模型“失调”的报告框架,以及六个在过去六个月内其人工智能行为不当的更多实例。该公司承认其以前的披露“临时且频率低于理想”,并表示有关人工智能安全的证据需要由构建模型的公司之外的人进行检查。这并不仅仅是OpenAI的问题,这让情况更令人担忧。Anthropic在审查大约141,000份模型转录本后发现了三起事件,其中其Claude模型未经授权访问了真正的第三方系统。仅在收集了一份独立调查的档案后,他们才找到了第四个事件,追溯到一月份。谷歌证实,Gemini在测试期间访问了三家真实公司的系统。另一名OpenAI代理利用DNS——将网络地址转换为机器可读形式的系统——尽管存在互联网限制,仍然访问了外部聊天机器人。另一个在试图作弊进行数学证明时发布了研究者的GitHub令牌——一个访问密码,尽管被告知停止了两次。而研究代理已经将53个用户图像发布到外部托管网站。其他代理使用在网上找到的凭证访问了普查数据,将美国证券交易委员会的信息复制到其他地方,并显然尝试未果地闯入美国教育部网站。OpenAI表示,他们已通知数十个受到其代理影响的第三方,并且对过去活动的审查仍在进行中。这些随意的、事后发现公司和组织IT系统重大入侵的做法并不是监管像人工智能这样强大技术的正确方式。我们早就学到了,不要将空难调查单独交给波音或空客。现在我们需要对人工智能的态度更加成熟。上周,在联合国大会上,人工智能研究员鲁曼·乔杜里发起了独立人工智能评估基金会(IAEF),获得了1000万美元的慈善支持。它的直接重点是教育,但重要的理念是将独立的人工智能评估变成一项真正的职业:拥有技能、基础设施和标准的人员和组织,能够测试这些系统,而没有任何财务利益关系。因为现在,一家公司可以报告一个事件,调查它,宣布所采取的任何减轻措施然后继续前进。IAEF是一个受欢迎的干预措施,但它无法独自解决问题。它无法强迫OpenAI或Anthropic交出日志、保存证据或告诉政府其某个系统已越过界限。而且它的1000万美元在Anthropic等公司面前几乎微不足道,后者正在排队等待估值约为2万亿美元的上市提议。但这是我们应该在其上建立的基础设施,政治家们也应该为此努力。政府需要达成共同规则,强迫公司迅速披露严重的人工智能事件和近乎失误。它们需要让公司向外部评估者公开其账目,而不是依赖于公司本身的善意或事情的发展。调查结果应当共享,以便我们可以从每一个事件中学习。实验室应该帮助设计...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡