返回

文章详情

从评估到护栏:我们带给 ACM FAccT 2026 的内容

Hacker News2026年7月23日 18:29

技术内容 在 ACM FAccT 上,我们展示了为什么 AI 护栏需要与模型一样严格的审查。从静态政策转向特定于上下文和语言的评估,我们的动手课程证明了配备了网络搜索等工具的自主护栏对于可靠的现实世界部署至关重要。今年六月份,我们前往蒙特利尔参加 ACM 公平、问责和透明大会(ACM FAccT),这是安全和负责任的 AI 开发的首要场所;一个计算机科学家、社会科学家、政策制定者和律师聚在一起,不仅问如何构建 AI 系统,还质疑是否、何时及为谁构建。我们的教程“跨语言和自主系统的 LLM 护栏的上下文评估”正好适合这次会议的听众。 评估是一条主线 评估一直是 AI 安全的重要话题,是负责任部署的关键步骤。该领域正在从庆祝一般能力转变为衡量现实世界、特定于领域和语言的绩效,类似 EvalEval 联盟等跨部门努力正在构建评价自身评估的科学和基础设施。尽管花费在评估上的资金,基准饱和,评估数据变得过时,但一个实际功能持续存在:评估塑造护栏。当评估表明模型在特定上下文或语言中生成有害或有毒内容时,一个应对措施是围绕该特定失败设计护栏。 护栏应与模型一样接受审查 护栏 – 过滤、标记或限制 LLM 输入和输出的机制 – 形塑用户在聊天机器人、平台和面向公众的服务中实际看到的内容。然而,它们所受到的审查远低于它们所治理的模型。历史上,它们是对外不可见的专有分类器,仅通过无法解释的拒绝可见。开源护栏模型和政策提示护栏使独立评估成为可能。我们在 FAccT 上的论点很简单:评估护栏与评估它们所保护的 LLM 一样重要,特定于上下文和语言的评估结果应指导护栏超越静态的伤害分类,朝着动态政策发展。 从评估到护栏的路径 这一路径正是我们来到 FAccT 的原因,因为连接这两者通常并不简单。我们的路线是:通过来自 Respond Crisis Translation 的母语评估者对 120 对聚焦难民和庇护的场景对进行社区和语言知情的评估,这些评估涉及英语、波斯语、阿拉伯语、库尔德语-索拉尼语和普什图语,并根据六个以权利为基础的标准评分。我们将结果发布为开放的 MHRE 评估数据在 Mozilla 数据集上,与评估者商定的条件,并将重复出现的失败(如不安全的推荐、缺失的免责声明和刻板假设)转化为英语和波斯语的具体护栏政策。 测试这些政策揭示了一个结构性缺陷:像事实性和可行动性这样的标准不能仅从文本中判断。这个非政府组织存在吗?这个法律在这个法域中仍然有效吗?通常,仅文本的护栏对它们无法验证的反应进行了盖章批准,幻想了术语,并且在评分时对相同的英语和波斯语政策作出了不同的评判(查看我们的博客文章)。因此,我们形成了一个假设:启用 LLM 的护栏需要搜索、检索和事实核查等工具,以更可靠和可信的方式进行判断。这就是我们带到蒙特利尔进行测试的自主护栏。 动手课程的结果 总体方法论和针对上下文护栏的案例,结合了基于语言和上下文的政策和工具,得到了参与者的共鸣。35 名参与者通过选择自己的场景和政策并比较自主和非自主评估者对相同反应的评判来运行我们的演示。工具更常改变支持证据而不是最终裁决:90% 的裁决在两种模式之间一致。然而,“自主”行为在很大程度上依赖于底层的评估 LLM。Claude Sonnet 4.6 在每次运行中都使用网络搜索(平均每次运行 4.1 次工具调用),而 GPT-5 Nano 很少使用(每次运行 0.2 次工具调用)。当调用工具时,它们在两个方向上都影响结果:验证庇护相关回应中的事实声明增加了其评分,而识别出工具缺失的评估者所忽略的事实错误则将判决从合格降级为临界。 使这一切变得可行的工具 如果每次比较都需要新的工程设计,则这些实验是不可行的。Mozilla AI 的开源任何护栏提供了一个统一的界面,用于选择和交换护栏与自定义政策,使护栏层与模型一样可配置。而 Mozilla 新的开源 LLM 网关 Otari 则使你可以无缝选择和切换评估者背后的 LLM。 下一步 我们正在继续完善我们的设计,测试工具访问是否使启用 LLM 的护栏在跨人道主义领域中更可靠和可信。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡