模型与研究

Mistral 发布 Shieldstral:3B 多模态安全分类器把审核规则交给自然语言

Mistral AI 于 8 月 4 日发布 Shieldstral,一款开源的 3B 参数多模态安全分类器,支持文本、图像和图文混合输入,并允许在推理时以自然语言写入审核策略以生成二元(是/否)判断和连续安全分数。官方基准显示该小模型在部分安全测试上可匹配或超越更大模型,模型以 Apache 2.0 许可开放权重,适合本地部署但需自行承担部署与审计责任。

Mistral 发布 Shieldstral:3B 多模态安全分类器把审核规则交给自然语言

Mistral AI 于 8 月 4 日发布 Shieldstral,一款开源的 3B 参数多模态安全分类器,支持文本、图像和图文混合输入,并允许在推理时以自然语言写入审核策略以生成二元(是/否)判断和连续安全分数。官方基准显示该小模型在部分安全测试上可匹配或超越更大模型,模型以 Apache 2.0 许可开放权重,适合本地部署但需自行承担部署与审计责任。

Mistral AI 于 8 月 4 日发布 Shieldstral,一款面向内容安全审核的 3B 参数多模态分类器。该模型以开放权重形式提供,采用 Apache 2.0 许可证,能够同时处理文本、图像以及图文组合,并允许开发者在推理时用自然语言写入审核政策,而不必为每一套新规则重新训练模型。

Mistral 将 Shieldstral 定位为一种轻量级 guard 模型。公司称,它在文本安全、拒答识别、政策适应性和多模态安全等测试中,可以匹配或超过参数规模最高约为其 7 倍的开放安全模型;官方还表示,模型可以在单张 16GB 显存的 NVIDIA GPU 上运行。这些性能与硬件结论来自 Mistral 的官方评测和部署说明,并非独立复测结果。

把内容审核改写成一个可以提问的问题

传统安全分类器通常把风险类别和标签体系较固定地写入训练目标。开发者如果希望模型适应不同产品的安全标准,往往需要重新调整分类体系、准备数据,甚至进行微调。

Shieldstral 采取了不同的设计。它把审核任务转化为一个二元问答问题:开发者提供审核场景和严格程度,提出一个可以用“是”或“否”回答的问题,再附上需要判断的内容。例如,问题可以是“这段内容是否鼓励针对某一群体的暴力行为”,或者“这张图片是否不适合未成年人观看”。

一次输入由三部分组成:用于说明审核背景和严格程度的 <Instruct>,具体的自然语言政策问题 <Query>,以及待判断的 <Document>。Document 可以是用户提示词、模型回复、提示词与回复的组合,也可以是图片及其附带文字。

模型在推理时只读取 yesno 两个输出方向的概率,并将其归一化为一个连续的安全分数。开发者可以根据业务风险设置阈值,也可以使用分数对内容进行排序。Mistral 表示,这一机制可以覆盖提示词分类、回复审核、拒答识别和毒性检测等不同任务。

这种设计的关键不只是“支持自然语言规则”,而是把安全政策从模型权重中部分移到了调用层。对于面向不同年龄段、地区或业务场景的产品,开发者可以在不改动模型参数的情况下调整审核问题。不过,单个请求原则上只针对一个政策问题;如果要分别判断多种风险,仍需要设计多项查询或更宽泛的总问题。

官方基准显示小模型在部分任务上接近更大模型

根据 Mistral 发布的模型卡,Shieldstral 在多组公开安全数据集上与 GPT-OSS-Safeguard-20B、Qwen3Guard-8B、Nemotron-3.5-Content-Safety-4B、LlamaGuard-4-12B 等模型进行比较。

在提示词分类测试中,Shieldstral 在 ToxicChat、HarmBench 等项目上取得了表格中的最高 F1 分数;在多模态安全测试中,模型在 VLGuard 和 UnsafeBench 上也列出最高分,分别为 97.7% 和 81.8%。但在拒答识别和部分多语言测试中,较大的模型仍然取得更高结果。例如,在 WildGuardTest 的拒答识别项目中,GPT-OSS-Safeguard-20B 的分数高于 Shieldstral。

因此,“超过 7 倍规模模型”更准确的理解是:Mistral 根据不同任务和基准给出的总体比较结论,而不是 Shieldstral 在所有测试项目上都胜出。相关数字应当被视为官方报告的评测结果,不能直接等同于第三方在相同环境下的独立验证。

Shieldstral 的技术报告已发表于 arXiv。报告摘要称,该模型在文本安全基准上可以匹配或超过接近其 7 倍规模的模型,并在多模态安全分类上取得新的最佳结果。报告于 7 月 28 日首次提交,8 月 4 日修订,与模型正式发布的时间相近。

开放权重意味着可以本地部署,但不等于提供托管 API

Mistral 以 Apache 2.0 许可证发布 Shieldstral 的开放权重。模型文件目前可在 Hugging Face 的官方模型页面获取,模型卡列出 12 种语言,包括英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语、阿拉伯语和俄语。

模型基于 Ministral-3-3B-Base-2512,并配有原生 Pixtral 视觉编码器。模型卡建议将上下文长度控制在训练时使用的 32K token 范围内,尽管其理论上支持更长的上下文。官方给出的 vLLM 部署示例使用 mistralai/Shieldstral-1.0-3B,并将最大模型长度设置为 32768。

这类发布方式更适合需要控制数据流向的企业、平台和研究团队:审核内容可以留在自有基础设施中,审核规则也能随产品变化调整。与此同时,开放权重并不意味着 Mistral 已经提供了一个可直接调用的托管 API。部署者仍需承担 GPU 资源、推理服务、阈值设置、日志审计和持续评估等成本。

模型卡也提醒,Shieldstral 在不同语言和领域上的可靠性并不均衡,训练数据中的标签噪声和偏差仍可能影响结果;对于经过编码、混淆或转写的对抗性输入,以及超长文本,模型性能也可能下降。这意味着它更适合作为审核流水线中的一个组件,而不是唯一的安全决策者。

安全模型的竞争正在从固定标签转向可配置的控制层

Shieldstral 的发布发生在 AI 安全讨论逐渐从“模型会不会拒答”转向“企业能否按自身政策控制模型行为”的背景下。近期,围绕开放权重模型、代理系统和安全测试边界的争议,已经让模型透明度、本地部署和可审计性成为政策讨论的一部分。AIFlux 此前报道的 美国政府将开放权重模型排除在自愿 AI 安全测试之外就涉及类似问题:开放模型究竟应被视为安全风险,还是也应被视为防守方需要的工具。

Mistral 也是 Open Secure AI Alliance 的首批成员之一。该联盟由 NVIDIA 等企业和开源组织参与,强调开放模型、运行时工具、身份管理、隔离环境和审计机制在 AI 防御中的作用。联盟的相关背景可见 NVIDIA 的介绍。AIFlux 对联盟提出的 SAFE 事故经验共享框架的报道也显示,行业正在尝试把安全事件转化为可复用的检测规则和配置。

从这个角度看,Shieldstral 的意义不只是又一个更小的 guard 模型。它代表了一种产品思路:安全政策不必完全由模型供应商预先决定,而可以由部署者在推理时以问题形式表达,再结合本地数据、阈值和人工流程做出判断。

不过,这种灵活性也带来新的责任。自然语言政策可能存在歧义,不同团队对“严格”或“安全”的理解也可能不同;如果缺少版本管理、评测集和审计记录,同一套模型可能在政策变化后产生难以追踪的判断差异。Shieldstral 能否在真实生产环境中稳定工作,最终仍取决于围绕模型建立的测试、监控和人工复核体系,而不只是参数规模或单项基准分数。

来源: Mistral AI:Introducing ShieldstralShieldstral 技术报告Hugging Face 模型卡

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读