AgentGuard:从异常编码智能体轨迹学习执行护栏
原标题:AgentGuard: Learning Execution Guardrails from Anomalous Coding-Agent Trajectories
AI 摘要
约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.7%升至35.0%,同时指出过度拒绝是主要局限。
正文节选
AgentGuard: Learning Execution Guardrails from Anomalous Coding-Agent Trajectories Abstract AI coding agents increasingly rely on execution harnesses to interact with repositories and external tools. However, task success does not guarantee reliable execution. Agents may still modify unrelated files, rewrite tests, issue unsafe commands, or ignore failed validations, motivating behavioral guardrails for reliable execution. We present AgentGuard, an instruction-level guardrail framework that lear