Mistral AI 于 2026 年 8 月 4 日发布了 Shieldstral,这是一个 30 亿参数的开放权重安全分类器,可以在推理时根据用简单语言编写的审核策略来判断文本和图像,而不是依赖于训练期间嵌入模型中的一组固定的伤害类别。该版本与当今大多数护栏模型的构建方式存在显着的哲学背离。

该模型可在 Apache 2.0 许可证下在 Hugging Face 上使用,涵盖 12 种语言,并在单个 16GB GPU 上运行。随着欧洲人工智能领域继续生产具有竞争力的开放式系统,Shieldstral 为 突发人工智能新闻 增添了另一个维度,正在重塑开发人员处理安全问题的方式。

盾骊的工作原理

大多数护栏模型在训练期间将伤害类别的分类硬编码到其权重中,这意味着使它们适应新的产品环境需要完整的再训练周期。 Shieldstral 采用了一种根本不同的方法:调节策略作为推理时输入的一部分提供。

根据Unite.AI的分析,该机制将每个审核任务简化为二元问答。每个请求都包含三个标记部分:一个包含评估上下文和严格级别的“”字段,一个包含单个是/否问题的“”字段,例如“此内容是否宣扬身体暴力吗?”,以及一个包含要判断的内容的“”字段,该内容可以是提示、响应、提示-响应对或带有可选文本的图像。

在推理时,模型仅读取“是”和“否”标记的 logits,并将它们进行 softmax 归一化为连续分数,二元判断的阈值为 0.5。该公式允许单个检查点吸收即时分类、响应调节、拒绝检测和毒性检测作为同一潜在问题的实例。

一关卡,多政策

实际意义重大。同一检查点可以根据完全不同的标准筛选网络安全研究工具和心理健康平台,无需修改。操作员编写是/否问题,提供描述评估上下文和严格性的指令,并且模型从单个令牌输出返回校准的安全分数。

这种策略自适应设计解决了部署人工智能安全系统中持续存在的难题之一:在不进行昂贵的再培训的情况下,难以根据特定用例进行调整。金融服务聊天机器人、儿童教育应用程序和安全研究人员的开放论坛都需要完全不同的护栏,而 Shieldstral 的目标是从同一组权重中处理这三者。

架构和性能

Shieldstral 基于 Mistral 的小型多模态模型 Ministral-3-3B 构建,并配有处理图像输入的 Pixtral 视觉编码器。该模型卡列出了一个包含 32,000 个令牌的上下文窗口,Mistral 表示,该模型在文本安全基准方面与高达其大小七倍的开放式防护模型相匹配,同时在多模式审核方面树立了新的技术水平。

这些都是对 3B 参数模型的强烈主张,Mistral 以异常数量的文档支持了此次发布。描述训练配方和评估的技术报告于 2026 年 7 月 28 日发布到 arXiv,随后 Mistral 文档中的完整模型卡和权重本身均于 8 月 4 日发布。

对现状的尖锐批评

Mistral 对 Shieldstral 版本的发布围绕着对护栏模型通常构建方式的尖锐批评。该公司认为,将危害分类法硬编码到模型权重中会造成不灵活性,迫使开发人员在每次政策变化或新产品推出时都要进行重新培训循环。

这不仅仅是一个技术论证;更是一个技术论证。这是一个竞争定位声明。通过发布可自行托管和调整而无需重新培训的 Apache-2.0 许可模型,Mistral 瞄准了那些希望控制其安全堆栈而无需托管服务或专有分类器开销的开发人员。

开放权重方法还解决了企业用户日益关注的问题:封闭安全系统的不透明性。当护栏阻挡内容时,操作员通常无法检查原因。 Shieldstral 透明的、策略即输入的设计让开发人员能够准确地看到哪个规则产生了给定的判决。

更广泛的公开权重势头

Shieldstral 的出现正值整个行业开放式 AI 版本激增之际。该模型加入了 Mistral 不断扩大的开放系统产品组合,强化了该公司在可访问性和开发人员体验而非原始前沿规模上竞争的战略。

对于构建 AI 应用程序的团队来说,能够在单个消费级 GPU 上运行功能强大的多模式安全分类器,而无需将数据发送到第三方 API,从而降低了部署稳健审核的成本和隐私障碍。这可能会加速受监管行业的采用,在这些行业中,数据驻留和可审计性是不可协商的。

保持人工智能领先地位

像 Shieldstral 这样的开放式安全模型正在改变开发人员对护栏的看法,而且创新的步伐没有放缓的迹象。关注 AI Buzz Wire,获取有关推动该领域发展的模型、工具和研究的清晰、真实的报告。

阅读更多人工智能新闻 →