Agentjacking(AI 代理劫持)

Agentjacking

通过 Sentry 错误报告劫持 AI 编程代理

亦作、亦称:AI 代理劫持 · Agent Jacking · MCP 注入攻击 · Sentry 注入攻击

2026 年 6 月 Tenet Security 披露的新型 AI 供应链攻击,通过向 Sentry 错误追踪系统注入精心构造的恶意错误报告,利用 MCP 协议劫持 Claude Code、Cursor、Codex 等 AI 编程代理,在开发者机器上执行任意代码,攻击成功率高达 85%。

攻击链详解

Agentjacking 的攻击链只有四步,但每一步都利用了 AI 编程代理的「信任假设」。第一步:注入恶意 Sentry 错误——攻击者在目标项目依赖的 npm 包中注入恶意代码,通过 Sentry SDK 上报一条精心构造的错误报告,Markdown 内容中隐藏攻击指令。

第二步:开发者使用 AI 工具调试——开发者在 IDE 中看到 Sentry 错误通知,让 AI 编程代理帮忙分析。第三步:AI 代理读取恶意 Markdown——AI 代理通过 MCP 连接 Sentry,读取错误报告完整内容,包括隐藏的指令。

第四步:AI 代理执行恶意代码——AI 代理将 Markdown 中的指令理解为合法任务,在开发者机器上执行攻击者指定的操作。攻击成功率高达 85% 的根本原因在于三个系统性缺陷:信任所有上下文输入、拥有过高的系统权限、缺乏行为边界。

受影响工具与修复状态

Tenet Security 的测试覆盖了 2026 年主流 AI 编程代理工具:Claude Code(< 1.0.35 版本,攻击成功率约 90%,已在 v1.0.35+ 修复)、Cursor(< 0.52 版本,约 85%,已在 v0.52+ 修复)、OpenAI Codex 和 Windsurf 也受影响。Tenet Security 于 2026 年 6 月 3 日向 Sentry 报告了该漏洞,Sentry 随后添加了内容过滤器,但由于 AI 代理将不可信输出视为命令的根本问题,更广泛的修复仍然具有挑战性。防御建议包括:

  • 限制 AI 代理的系统权限,禁止直接执行 shell 命令
  • 对 AI 代理的输入进行内容过滤和沙箱隔离
  • 审查项目中的 Sentry DSN 配置,确认是否暴露
  • 使用运行时监控检测 AI 代理的异常行为

MCP 协议的信任模型缺陷

Agentjacking 之所以能够成功,根本原因在于 MCP(Model Context Protocol)协议的隐式信任模型存在系统性缺陷。MCP 是 Anthropic 推出的开放协议,用于标准化 AI 模型与外部工具/数据源的交互。

其核心设计理念是 AI 代理通过 MCP 连接器访问外部资源(文件系统、数据库、错误追踪系统等),但协议假设所有通过连接器传入的内容都是「可信的数据」。这个假设在 Agentjacking 攻击中被彻底打破——来自 Sentry 的错误报告本应是「需要分析的信息」,却包含了「需要执行的指令」。

这揭示了 MCP 生态的一个深层问题:数据与指令在同一上下文中混合传递,AI 代理无法区分。OWASP 已将提示注入列为 LLM 应用的重大安全风险,并建议实施输入输出过滤、最小权限访问、人工监督和对抗性测试等缓解策略。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「通过 Sentry 错误报告劫持 AI 编程代理」
  • 「AI 代理的供应链攻击」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    Agentjacking:AI 编码代理的新型供应链攻击

    2026 年 6 月,Tenet Security 披露了一种名为 Agentjacking 的新型攻击方法,通过操纵 Sentry 错误报告劫持 AI 编码代理,在开发者机器上执行恶意代码。攻击成功率高达 85%,影响 2388 个组织。本文深入分析 Agentjacking 的攻击原理、MCP 协议的系统性风险,以及企业级防护方案。

  2. 2

    Agentjacking 攻击深度解析:AI 编程代理的新型安全威胁

    2026年6月,安全研究机构 Tenet Security 披露了一种名为 Agentjacking 的新型攻击方式——攻击者仅需在 Sentry 错误追踪系统中注入一条精心构造的错误报告,就能劫持 Claude Code、Cursor、OpenAI Codex 等 AI 编程代理,在开发者机器上执行任意代码。攻击成功率高达 85%,已影响超过 2388 家组织。本文从攻击原理、影响范围、防御方案三个维度进行深度解析。

外部参考

维基百科:查看「Agentjacking」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。