返回全部动态

蚂蚁发布大模型内生式安全护栏SingProbe

原标题:蚂蚁发布大模型内生式安全护栏SingProbe,让AI边生成边识别风险

雷峰网 AI科技评论产品发布质量 68

AI 摘要

蚂蚁AI安全实验室在国家网络安全宣传周期间发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程,让AI边生成边输出风险提示。该方案复用推理过程中的内部信息,在Ling-3.0-flash生产环境中额外开销低于0.5%,并同步发布流式安全评测基准SingStreamBench及医疗场景方案SingProbe-Med。目前SingProbe已适配29个主流开源大模型并接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 大模型正在进入日常问答、办公辅助、客户服务等真实业务场景。用户期待AI快速给出有用的回答,也需要这些回答安全、可靠。如何及时发现不安全内容和编造信息,同时减少安全审核对响应速度和用户体验的影响,成为大模型应用落地需要解决的问题。 国家网络安全宣传周期间,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程。它如同一个内置的“安全探头”,让AI一边生成回答,一边输出风险提示,以较低的额外计算开销,为大模型应用提供更及时的安全防护。 例如,用户向AI咨询健康问题时,会关心它是否给出不恰当的用药建议;使用AI查找资料时,也需要警惕它编造不存在的文献或事实依据。面对这些风险,SingProbe能够在回答生成过程中持续提供风险信号,帮助应用系统及时采取中止回答、重新生成等措施。 目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等完整回答生成后再检查,风险内容可能已经呈现给用户;如果提高检查频率,又会进一步增加运行负担。 SingProbe尝试让安全判断与模型生成同步进行。它


发布时间:2026-09-14 21:22
抓取时间:2026-09-14 23:25
来源机构:雷峰网
阅读原文leiphone.com