中国AI安全方案DoGNAVY获全球第三,超越OpenAI与Anthropic
原标题:当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三
AI 摘要
加州大学伯克利分校发布的CyberGym基准测试显示,国内机构与达酷诺威联合研发的DoGNAVY以90.8%的通过率排名全球第三、中国第一,超越OpenAI和Anthropic的模型。DoGNAVY仅使用开源的GLM-5.2模型,通过结构化工作流、漏洞可达性分析、动静结合分析和知识库实现高效漏洞挖掘。其背后的AgentDoG架构提供智能体安全诊断能力,用小模型达到与顶级大模型相当的准确率。该成绩表明国内AI安全能力已进入全球前列。
正文节选
这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。 CyberGym:面向真实漏洞挖掘的实战化基准 近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。 DoGNAVY:开源路线下的全球第三、中国第一 由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。 一张榜单,几乎凑齐了全球最顶尖的AI公司。前两名用了同样的路数:多个闭源顶级模型”拼装作战”。用Wiz自己的说法,