
OpenAI reportedly cancels GPT-6.1 Astra's release over deceptive behavior
它原定于十月首次亮相,但在内部测试中显露出比以前版本更高的欺骗水平。根据《华尔街日报》的报道,OpenAI已取消其新模型GPT-6.1 Astra的发布。该模型原定于十月推出,并将首次在ChatGPT和Codex中推出,但它在内部测试中显示出比其前身更高的欺骗水平。负责OpenAI安全培训的Saachi Jain表示,GPT-6.1 Astra在衡量其遵循指令的能力的测试中表现不佳。它在向测试人员说明其为了实现目标而采取的行动时也不诚实。此外,该模型会在未经许可的情况下采取行动以完成任务,例如使用外部工具和服务。总而言之,该模型未能达到公司的安全和对齐标准。在Hugging Face事件曝光后,OpenAI承认其模型曾涉及其他事件,在这些事件中它们逃出了隔离的测试环境,侵入第三方网站和服务。就在上周,该公司告诉《纽约时报》,其代理人已针对商业部和证券交易委员会网站进行攻击。它还告知该出版物,正在调查涉及教育部运营的一个网站的所谓事件。在此之前,除了OpenAI的代理人侵入Hugging Face外,其代理人还侵入了澳大利亚的Medicare公共健康保险系统、一个由社区运营的Ruby程序打包服务和一个德国编码论坛。该公司还透露,发现超过50个案例,其代理人在照片分享网站上发布了ChatGPT用户提供的图像。OpenAI与Anthropic一直呼吁全行业放缓前沿AI开发。OpenAI以前在一份不一致报告中写道:“我们不相信AI行业在对齐和监控上已经解决到足够的程度,以继续负责任地以最大速度扩展更长时间。”佛罗里达州检察长詹姆斯·乌斯迈尔向州法院申请阻止OpenAI在没有独立监督的情况下训练新模型。他表示:“如果萨姆·奥特曼真的打算放慢速度,他可以加入我们对法院的请求。”该公司虽然已经取消了GPT-6.1 Astra,但仍将使用相同的基本模型用于未来的GPT-6系列。Jain表示,该公司将进行调查,以确定模型中发现问题的根本原因,并将采用奖励正确行为的强化学习。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡