OpenAI 的 GPT-6 Astra 幻觉更少,但仍易受隐藏提示注入攻击
英文标题:OpenAI's GPT
OpenAI 的新模型 GPT-6 Astra 在减少幻觉和抵御直接提示注入方面表现显著提升,但在面对隐藏的间接提示注入时仍存在约 8.5% 的失败率,表明 AI 代理的安全性尚未完全解决。
为什么值得关注
随着 AI 代理越来越多地被用于自主处理文档、编写代码和操作工具,它们面临的安全威胁也在增加。间接提示注入攻击可以隐藏在看似无害的文档中,诱导 AI 执行恶意操作。尽管 GPT-6 Astra 在防御直接攻击上表现出色,但间接攻击的失败率仍意味着在实际应用中,每十二个场景就可能有一个被攻破。对于依赖 AI 代理的企业来说,这可能导致数据泄露、错误决策或其他安全事件。因此,理解这些风险并采取额外防护措施至关重要。
核心要点
- GPT-6 Astra 的幻觉率显著低于前代 GPT-5.6 Sol,尤其在低延迟设置下改进明显。
- Astra 能阻止 99.99% 的直接提示注入攻击,这得益于 OpenAI 的 GPT-Red 自动化攻击方法。
- 在多轮对话中,Astra 对越狱攻击的防御率约为 67%,意味着攻击者每三次尝试可能成功一次。
- 间接提示注入的失败率从 27% 降至 8.5%,但 Claude Opus 5 表现更好,失败率为 4.8%。
- 尽管有进步,Astra 在间接攻击下仍可能被攻破,这提醒我们 AI 代理的安全性尚未完全解决。
要点
-
OpenAI 的新模型 GPT-6 Astra 比其前代 GPT-5.6 Sol 产生的幻觉更少,并且能阻止 99.99% 的直接提示注入攻击。
-
Astra 在抵御越狱攻击方面也更有效,但坚持不懈的攻击者仍能在多轮对话中,大约每三次尝试就有一次获得有问题的回答。
-
对于隐藏在 AI 阅读文档中的间接提示注入,Astra 的失败率从 27% 降至 8.5%。这是很大的进步,但仍然偏高。
OpenAI 的新模型 GPT-6 Astra 比其前代产品产生的幻觉更少,并且能更有效地阻止提示注入攻击。但对于真正安全的 AI 代理部署来说,它仍然不够可靠。
根据 OpenAI 的系统卡片,这款新的 Astra 模型比其前代 GPT-5.6 Sol 产生的事实错误要少得多。OpenAI 使用用户标记为错误答案的 ChatGPT 对话进行了测试,这意味着这些是特别容易出错的案例,其失败率不应被视为日常使用的典型情况。Astra 重现这些已报告错误的频率大大降低,在低延迟设置和较低推理级别下改进最为明显。
对于直接提示注入(用户试图通过自己的提示来操纵模型),Astra 达到了近乎完美的 99.99% 防御率。OpenAI 将此归功于其 GPT-Red 方法,该方法使用自动化攻击者在训练期间强化模型。
越狱攻击的抵抗情况也类似。针对一组固定的已知攻击(试图提取关于生物学、暴力和网络安全的有害回答),Astra 在 91.5% 到 98.3% 的情况下拒绝提供帮助。
当攻击者在多轮对话中调整策略时,Astra 的防御率下降到约 67%,这意味着坚持不懈的对手大约每三次尝试就能诱导出至少一个有问题的回答。前代模型在同一测试中得分略低于 50%。OpenAI 指出,这些测试是在裸模型上运行的,没有包含实际产品中带有的分类器等生产安全层。
隐藏提示注入仍然是一个真正的安全问题
Astra 在间接提示注入方面取得了进展,这种攻击隐藏在 AI 阅读的文档中。安全公司 Gray Swan 的外部测试使用了来自其 IPI Arena 的 1,810 个精选攻击,发现每个场景尝试 15 次时,Astra 有 8.5% 的概率至少被攻破一次。GPT-5.6 Sol 的失败率为 27%。在同一评估中,Claude Opus 5 表现更好,为 4.8%,但它也并非完全免疫。
Gray Swan 合并的 Q1 和 Q2 测试数据实际上比早期结果有所上升。Anthropic 此前报告的攻击成功率仅为 2%,那是基于较简单的 Q1 测试,GPT-5.6 Sol 在那里的得分也只有 20%。Anthropic 还在开启扩展推理的情况下运行了所有模型,加上更广泛的测试范围,这可能解释了差异。
尽管这些是经过精心挑选的攻击,但这样的成功率应该引起任何企业安全团队的担忧。Astra 大约每十二个场景中就有一个可能通过注入指令被欺骗。Opus 5 表现更好,但大约每二十一个场景中仍会失败一次。而且风险正在增长。AI 代理越来越多地自行编写代码、操作工具和控制计算机,这正是 Gray Swan 测试的内容。这些代理还被设计为全天候大规模运行,阅读和处理文档是它们的核心工作之一。
无炒作 AI 新闻——由人类精选
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI 雷达”前沿报告、完整档案访问以及评论区的访问权限。
术语表
- 幻觉
- AI 模型生成看似合理但实际错误或虚构的信息。
- 提示注入
- 一种攻击方式,通过精心设计的输入提示来操纵 AI 模型的行为,使其执行非预期操作。
- 直接提示注入
- 攻击者直接向 AI 模型发送恶意提示,试图覆盖其原始指令。
- 间接提示注入
- 攻击者将恶意指令隐藏在 AI 模型读取的文档或网页中,当模型处理这些内容时触发攻击。
- 越狱攻击
- 试图绕过 AI 模型的安全限制,使其生成有害或禁止的内容。
- GPT-Red
- OpenAI 使用的一种自动化攻击方法,通过 AI 攻击自身来强化模型的安全性。
- 系统卡片
- AI 模型发布时附带的技术文档,详细说明模型的能力、局限性和安全评估结果。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。