返回

文章详情

Mistral的Shieldstral:一个用于多模态审核的3B开源权重模型

Hacker News2026年8月4日 16:36

思考总结 Shieldstral推出了一种3B开源权重的多模态安全分类器,通过将内容审核构架为政策自适应问题回答任务,超越了大小达到其7倍的模型。与传统的护栏模型不同,它在推理时接受简单的语言政策,统一文本和图像的安全评估,无需重新训练。它在Apache 2.0下发布,在多样基准上提供校准的安全分数,同时在单个16GB NVIDIA GPU上高效运行。一个3B开源权重、政策自适应的多模态安全分类器,在文本安全方面与大小高达其7倍的模型相匹配,并在多模态审核中设定了新的技术前沿。 "该内容是否促进对某个受保护群体的暴力?这个图像对未成年人来说安全吗?助手是否拒绝了请求?" 每个发布模型的产品都需要回答类似的问题——但正确的答案依赖于产品、受众和时机。同一内容在网络安全研究工具上可能是安全的,而在心理健康平台上可能是有害的。大多数护栏模型将一组固定的伤害类别税onomies镶嵌在它们的权重中,因此将其重新定位到新的部署环境意味着需要重新训练。由于安全定义在不同应用和领域中有所不同,因此根本就没有一个“正确”的类别集可供建模。Shieldstral采取了不同的方法:你在推理时间将政策写为简单的语言问题,模型返回一个校准的安全分数。无需重新训练,一个接口处理文本和图像,并且从一个标记中得出裁决。请参阅我们的技术报告。作为开放安全AI联盟的创始会员,今天我们以Apache 2.0开源权重发布Shieldstral,可在这里下载。审核作为一个问题 Shieldstral将内容审核框架作为一个二元问题回答任务。每个请求有三个部分:<指令>——评估上下文、严格性(可选)及对什么构成不安全内容的定义。<查询>——一个简单的是/否问题,例如“这个内容是否促进身体暴力?”<文档>——要判断的内容:提示、响应、提示-响应对或带有可选文本的图像。在推理时,模型只读取是和否的对数,并将其softmax标准化为连续的安全分数。这一个简单的表达式完成了大量工作:它将提示分类、响应审核、拒绝检测和毒性检测统一为一个问题;它允许政策完全以提示的形式存在,因此一个检查点在部署时适应新的政策。亮点 强大的表现——在文本安全、拒绝检测、政策适应性和多模态基准方面,与大小达到其7倍的开放护栏模型相匹配或超越。 自适应和灵活——单个自然语言接口涵盖文本、图像和文本+图像内容,适用于提示、响应和提示–响应对。政策作为自由形式查询提供,可在推理时重新定位,无需重新训练。 小型,基于异构来源训练——一个在单个16GB GPU上运行的3B模型,训练于真实和合成数据,采用多样的标签格式和分类法,整合成一个框架。 连续安全评分——从单次前向传递中返回校准的是/否概率,因此你可以基于置信度进行阈值或排名,而不依赖于离散标签。 开源——Apache 2.0权重。 基准 我们在四个维度上将Shieldstral与高达7倍大小的开放护栏模型进行了评估。所有评估样本均未参与训练。 我们如何构建它 核心理念是如果数据正确,一个小模型可以战胜更大的模型。确保数据正确意味着解决四个问题: 统一异构数据。公共安全数据集在分类法、标签和注释约定上存在不一致——从二进制安全/不安全标志到细粒度的多标签分类法。我们将每个数据集转换为相同的指令-查询-文档格式,使用每个数据集处理器,并且我们通过变化指令、查询和提示-响应分隔符的措辞,让模型在不同的措辞间进行泛化,而不是过拟合于一种风格。我们还根据源进行严格性校准——对对抗性越狱严格,对响应质量数据宽松——这样模型学习校准过的决策边界。这使我们能够整合原本不相容的源。 教授区分,而非记忆。 如果在固定的政策标签集上训练,模型只能学习那些预定义政策的分类,而无法推理关于给定政策的精确边界。这会阻止对新政策的泛化。相反,我们构造出一组故意相似、容易混淆的政策,并请求一个大型语言模型将安全文本重写为对比对:每个重写的文本设计为违反其中一项政策,但不违反其同类。这训练模型区分...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡