返回全部动态

Mistral AI发布Shieldstral:3B小模型重构AI安全审核范式

原标题:拆解 Mistral AI 新项目Shieldstral,看 3B 小模型如何重构 AI 安全审核范式

雷峰网 AI科技评论模型发布质量 77

AI 摘要

Mistral AI 于2026年8月4日发布Shieldstral,一款3B参数的多模态安全分类器,支持通过自然语言自定义审核规则,统一审核文本、图片及图文混合内容。该模型采用三层设计,将审核任务转化为Yes/No判断,通过对比式训练和合成数据提升规则匹配能力,在多个基准上超越更大参数模型。Shieldstral降低了部署门槛,展示了小模型在垂直场景中的潜力。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨樊天骄 编辑丨郑佳美 2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。 与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。 它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。 在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。 因此,本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。 01 传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。 但企业真正需要判断的往往不是这个内容属于什么类别,而是按


发布时间:2026-08-17 17:02
抓取时间:2026-08-17 19:21
来源机构:雷峰网
阅读原文leiphone.com