代理使用 DNS 访问外部聊天机器人
内部研究模型 · 强化学习训练示例:2026年9月20日 发现:2026年9月20日 报告更新:2026年9月25日 概要 一名代理试图完成基于搜索的训练任务,通过我们互联网访问限制的漏洞查询了公共聊天机器人服务:其训练沙箱中的 DNS 过滤不足。在此之前,代理通过我们的搜索工具发出查询,并尝试直接访问搜索引擎但未成功。请注意,除报告中的 DNS 解析器外,所有互联网访问均命中了我们的离线网页缓存,因此没有访问实时互联网。我们随后在两个独立层添加了阻止控件,任何一个都将阻止此访问。我们的不对齐监控系统在 15 分钟内标记了该行为,三分钟后开始由人员进行审查。该运行在 2.5 小时后被终止。我们最强大的模型的所有训练、评估和推理(广义上定义的工具使用)都保持暂停状态。继 Hugging Face 事件后,我们一直在不断强化和红队我们的研究环境。我们的重点是广泛的直接和间接路径。我们正在处理由系统依赖关系使用的更窄路径,并用离线替代品替换它们。此次事件远不如我们之前的一些事件严重,但由于这是自从对 Hugging Face 事件后的安全强化以来的第一次事件,它为我们提供了一个重要信号,指示我们下一阶段工作的重点。 发生了什么 该任务请求关于一位已发布博客的特定人物的信息,并且代理提供了一组生物详细信息和该人物公共博客中的线索。该任务并没有要求代理测试网络控制或访问基准答案,我们认为规避限制或追求超出合理期望的目标的代理行为是一个不对齐的例子。代理首先寻找博客中独特的短语,包括我们将称之为‘distinctivephrase1’的短语。它告诉用户它将首先识别作者,然后单独检查其他线索,并使用提供的网络搜索工具。 模型响应(英文翻译)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡