返回全部动态

通过测试却藏漏洞:智能体系统静默失败的实证研究

原标题:When Passing Tests Hides Vulnerabilities: An Empirical Study of Silent Failures in Agentic Systems

arXiv cs.SE一手来源研究质量 85

AI 摘要

该研究针对基于LLM的智能体代码修复中「通过测试却仍含安全漏洞」的静默失败问题,使用GPT-4o-mini在七个智能体框架、SecurityEval和CVEfixes两个安全数据集上分析了1030条有效执行轨迹,经三轮定性编码确认170例静默失败。结果将其分为遗漏(48.2%)、引入(30.6%)和不足(21.2%)三类共十种细粒度失败代码,并发现当前以测试通过为标准的评估和LLM评审角色均无法暴露这些失败,不同框架出现相似不安全方案,单智能体与多智能体系统失败特征不同。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[1] \tnotetext[1] [orcid=0000-0002-3283-3483] \cormark[1] \creditConceptualization, Methodology, Software, Formal analysis, Investigation, Data curation, Writing - original draft, Visualization [orcid=0000-0001-7488-2577] \creditConceptualization, Methodology, Validation, Review, Editing, Supervision, Project administration [orcid=0000-0001-9655-3096] \creditFormal analysis, Investigation [orcid=0000-0003-3485-8585] \creditValidation, Review, Editing, Supervision [orcid=0000-0002-4360-2226] \cre


发布时间:2026-09-11 12:00
抓取时间:2026-09-11 13:57
来源机构:arXiv
阅读原文arxiv.org