NeuronFuzz:利用安全神经元引导模糊测试评估大语言模型安全性
原标题:NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
AI 摘要
NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移至开源和专有模型。
正文节选
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation Abstract Safety evaluation is critical for assessing whether aligned Large Language Models (LLMs) remain robust against jailbreak attacks. Existing automated testing methods, however, largely rely on response-level feedback: each candidate prompt typically requires generating a target-model response to evaluate its attack effectiveness. This process is expensive and, more importantly, provides only sparse guidance on strongly ali