返回全部动态

OpenAI GPT-6 Astra 减少幻觉但仍易受隐藏提示注入攻击

原标题:OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections

THE DECODER研究质量 75

AI 摘要

OpenAI 的新模型 GPT-6 Astra 相比前代 GPT-5.6 Sol 减少了幻觉,并阻止了 99.99% 的直接提示注入攻击。然而,在间接提示注入测试中,Astra 的失败率从 27% 降至 8.5%,但仍高于 Claude Opus 5 的 4.8%。安全公司 Gray Swan 的测试显示,Astra 在多次对话中仍可能被诱导产生有害响应,表明其安全性仍不足以支持完全可靠的 AI 代理部署。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections Key Points - OpenAI's new model GPT-6 Astra hallucinates less than its predecessor GPT-5.6 Sol and blocks 99.99 percent of direct prompt injection attacks. - Astra also resists jailbreaks more effectively, but persistent attackers can still get a problematic response about one in three tries over multiple conversation rounds. - For indirect prompt injections hidden inside documents the AI reads, Astra's fai


发布时间:2026-09-05 01:23
抓取时间:2026-09-05 01:50
来源机构:THE DECODER
阅读原文the-decoder.com