Adversa AI 披露加密提示注入攻击
2026 年 8 月 20 日,Adversa AI 披露 Cryptographic Context Injection 技术,展示加密恶意指令如何绕过 AI 安全护栏。
事件背景
传统提示注入攻击依赖明文恶意指令,安全护栏可检测并拦截。Adversa AI 发现将恶意指令加密后,护栏扫描器无法读取,但模型代码执行沙箱可解密并执行。
关键事实
| 项目 | 详情 |
|---|---|
| 攻击名称 | Cryptographic Context Injection |
| 加密方式 | AES-256-GCM + PBKDF2 |
| Grok 状态 | 零点击数据外泄,截至 8/19 仍可复现 |
| Gemini 状态 | 成功率下降但仍可能 |
| 报告时间 | 6月3日报告 xAI,未获回应 |
| Payload | 未公开以防止滥用 |
技术机制
- 攻击者在网页放置加密 JSON 对象和解密指令
- 用户要求 AI 总结该页面
- AI 获取页面,执行解密指令
- 解密后的恶意指令被模型视为"自己的工具输出"
- 模型执行恶意指令(如外泄用户数据)
关键洞察:安全护栏检查输入/输出文本,但不检查代码执行沙箱的输出。
影响分析
| 维度 | 影响 |
|---|---|
| Grok | 零点击数据外泄 |
| Gemini | 可绕过安全过滤器 |
| Agent 安全 | 代码执行沙箱输出不应被无条件信任 |
| 防御策略 | 需要来源驱动的信任降级 |
风险边界与后续观察
- xAI 未回应,Grok 仍可复现
- Gemini 成功率下降原因不明
- Google 未收到报告
- Payload 未公开
AI Master 解读
核心事件
Adversa AI 8月20日披露 Cryptographic Context Injection 技术,加密恶意指令绕过 Grok 和 Gemini 安全护栏。
行业影响
为什么重要: 传统提示注入攻击依赖明文恶意指令,安全护栏可检测并拦截。Cryptographic Context Injection 将恶意指令加密为 AES-256-GCM 密文,护栏扫描器无法解密读取,但模型代码执行沙箱可解密。解密后的指令被模型视为"自己的工具输出",绕过来源信任检查。这揭示 Agent 场景下代码执行沙箱与外部工具交互的信任边界问题。
影响分析:
| 维度 | 影响 |
|---|---|
| Grok | 零点击数据外泄:用户要求"总结此页面"即触发 |
| Gemini | 可绕过安全过滤器生成受限内容 |
| Agent 安全 | 代码执行沙箱的输出不应被无条件信任 |
| 防御策略 | 需要序列检测、来源驱动的信任降级 |
风险边界: xAI 6月3日收到报告但未回应,截至 8月19日 Grok 仍可复现;Gemini 成功率下降但原因不明(可能是过滤器更新或模型版本变更);Google 未收到报告因为越狱不在其漏洞披露范围内;攻击 Payload 未公开以防止滥用。
AI Master 建议
Agent 开发者需对代码执行沙箱输出实施来源信任降级;评估现有 Agent 框架是否检测加密指令;Grok 用户避免让 Agent 总结不受信任的网页;关注 Adversa AI 后续防御方案。 **来源:** Adversa AI / Ars Technica / The Register **链接:** https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft/
