OpenAI GPT-6 Astra 减少幻觉但仍易受隐藏提示注入攻击
原标题:OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
AI 摘要
OpenAI 的新模型 GPT-6 Astra 相比前代 GPT-5.6 Sol 减少了幻觉,并阻止了 99.99% 的直接提示注入攻击。然而,在间接提示注入测试中,Astra 的失败率从 27% 降至 8.5%,但仍高于 Claude Opus 5 的 4.8%。安全公司 Gray Swan 的测试显示,Astra 在多次对话中仍可能被诱导产生有害响应,表明其安全性仍不足以支持完全可靠的 AI 代理部署。
正文节选
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections Key Points - OpenAI's new model GPT-6 Astra hallucinates less than its predecessor GPT-5.6 Sol and blocks 99.99 percent of direct prompt injection attacks. - Astra also resists jailbreaks more effectively, but persistent attackers can still get a problematic response about one in three tries over multiple conversation rounds. - For indirect prompt injections hidden inside documents the AI reads, Astra's fai