Agentjacking(AI 代理劫持)
Agentjacking通过 Sentry 错误报告劫持 AI 编程代理
亦作、亦称:AI 代理劫持 · Agent Jacking · MCP 注入攻击 · Sentry 注入攻击
2026 年 6 月 Tenet Security 披露的新型 AI 供应链攻击,通过向 Sentry 错误追踪系统注入精心构造的恶意错误报告,利用 MCP 协议劫持 Claude Code、Cursor、Codex 等 AI 编程代理,在开发者机器上执行任意代码,攻击成功率高达 85%。
攻击链详解
Agentjacking 的攻击链只有四步,但每一步都利用了 AI 编程代理的「信任假设」。第一步:注入恶意 Sentry 错误——攻击者在目标项目依赖的 npm 包中注入恶意代码,通过 Sentry SDK 上报一条精心构造的错误报告,Markdown 内容中隐藏攻击指令。
第二步:开发者使用 AI 工具调试——开发者在 IDE 中看到 Sentry 错误通知,让 AI 编程代理帮忙分析。第三步:AI 代理读取恶意 Markdown——AI 代理通过 MCP 连接 Sentry,读取错误报告完整内容,包括隐藏的指令。
第四步:AI 代理执行恶意代码——AI 代理将 Markdown 中的指令理解为合法任务,在开发者机器上执行攻击者指定的操作。攻击成功率高达 85% 的根本原因在于三个系统性缺陷:信任所有上下文输入、拥有过高的系统权限、缺乏行为边界。
受影响工具与修复状态
Tenet Security 的测试覆盖了 2026 年主流 AI 编程代理工具:Claude Code(< 1.0.35 版本,攻击成功率约 90%,已在 v1.0.35+ 修复)、Cursor(< 0.52 版本,约 85%,已在 v0.52+ 修复)、OpenAI Codex 和 Windsurf 也受影响。Tenet Security 于 2026 年 6 月 3 日向 Sentry 报告了该漏洞,Sentry 随后添加了内容过滤器,但由于 AI 代理将不可信输出视为命令的根本问题,更广泛的修复仍然具有挑战性。防御建议包括:
- 限制 AI 代理的系统权限,禁止直接执行 shell 命令
- 对 AI 代理的输入进行内容过滤和沙箱隔离
- 审查项目中的 Sentry DSN 配置,确认是否暴露
- 使用运行时监控检测 AI 代理的异常行为
MCP 协议的信任模型缺陷
Agentjacking 之所以能够成功,根本原因在于 MCP(Model Context Protocol)协议的隐式信任模型存在系统性缺陷。MCP 是 Anthropic 推出的开放协议,用于标准化 AI 模型与外部工具/数据源的交互。
其核心设计理念是 AI 代理通过 MCP 连接器访问外部资源(文件系统、数据库、错误追踪系统等),但协议假设所有通过连接器传入的内容都是「可信的数据」。这个假设在 Agentjacking 攻击中被彻底打破——来自 Sentry 的错误报告本应是「需要分析的信息」,却包含了「需要执行的指令」。
这揭示了 MCP 生态的一个深层问题:数据与指令在同一上下文中混合传递,AI 代理无法区分。OWASP 已将提示注入列为 LLM 应用的重大安全风险,并建议实施输入输出过滤、最小权限访问、人工监督和对抗性测试等缓解策略。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「通过 Sentry 错误报告劫持 AI 编程代理」
- 「AI 代理的供应链攻击」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
什么是 Agentic Engineering?它和 Vibe Coding 有什么区别?
Vibe Coding(Karpathy 2025)是凭感觉用自然语言让 AI 生成代码、快速试错,适合原型;Agentic Engineering 把 Agent 纳入系统化工程流程(需求-规划-生成-自动测试-迭代-评审),强调可控、可验证、可维护,生产系统应走后者。
- 初级概念高频查看详解 →
AI Agent 的基本架构由哪些核心组件构成?
AI Agent 通常由规划、记忆、工具、画像/控制循环四大组件构成,它们围绕 LLM 大脑协同成「观察-思考-行动」闭环。
- 高级系统设计查看详解 →
Agent 接入多渠道(Telegram/飞书/钉钉/Web)时,Channel 抽象层如何设计?
Channel 抽象层用适配器模式把各平台的消息格式、富文本、鉴权、事件差异收敛成统一的 Message/User/Session 接口,receive 转标准消息、send 各自适配,并用特性开关处理能力差异。
- 中级概念查看详解 →
什么是上下文压缩(Context Compaction)?有哪些压缩策略?
长会话/长任务里上下文不断累积逼近窗口上限,上下文压缩是在不丢关键信息的前提下压缩历史,以腾出空间、降低成本并维持推理质量,常用滚动摘要、重要性筛选、工具结果外置、结构化抽取等策略。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
Agentjacking:AI 编码代理的新型供应链攻击
2026 年 6 月,Tenet Security 披露了一种名为 Agentjacking 的新型攻击方法,通过操纵 Sentry 错误报告劫持 AI 编码代理,在开发者机器上执行恶意代码。攻击成功率高达 85%,影响 2388 个组织。本文深入分析 Agentjacking 的攻击原理、MCP 协议的系统性风险,以及企业级防护方案。
- 2
Agentjacking 攻击深度解析:AI 编程代理的新型安全威胁
2026年6月,安全研究机构 Tenet Security 披露了一种名为 Agentjacking 的新型攻击方式——攻击者仅需在 Sentry 错误追踪系统中注入一条精心构造的错误报告,就能劫持 Claude Code、Cursor、OpenAI Codex 等 AI 编程代理,在开发者机器上执行任意代码。攻击成功率高达 85%,已影响超过 2388 家组织。本文从攻击原理、影响范围、防御方案三个维度进行深度解析。
外部参考
维基百科:查看「Agentjacking」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
