文章摘要
2026 年 7 月,Dark Reading 披露了一种新型 AI Agent 安全威胁——Authority Laundering(权限洗白)。攻击者不直接攻击 AI 模型,而是污染 Agent 读取的外部数据源,让 Agent 将恶意指令误认为合法任务并执行工具调用。本文从攻击原理、真实案例、防御框架、行业影响四个维度展开分析。
一、引言:当 AI Agent 成为攻击者的帮凶
2026 年 7 月 18 日,Dark Reading 发表了一篇题为《The Real AI Threat Is Blind Trust》的分析文章。
这篇文章揭示了一个令人不安的事实:AI Agent 正在成为企业网络中最大的安全盲区。攻击者不再需要直接攻击 AI 模型,而是通过污染 Agent 读取的外部数据——网页、邮件、API 返回——让 Agent "自愿"执行恶意操作。
核心概念:Authority Laundering(权限洗白)
Authority Laundering 是指 AI Agent 将不可信的外部输入转化为授权操作的安全威胁。这是间接提示注入(Indirect Prompt Injection)的进化形态。
为什么这很重要?
2026 年是 AI Agent 大规模部署的一年。Claude Code、Cursor、GitHub Copilot Workspace 等 AI 编码工具已经具备文件操作、终端执行、API 调用能力。企业级 Agent 更是可以直接访问 CRM、ERP、邮件系统、代码仓库。当 Agent 拥有真实世界的操作权限时,Authority Laundering 就从理论风险变成了实际威胁。
背景补充: Dark Reading 是网络安全领域的权威媒体,其文章通常基于真实安全事件和行业深度分析。
二、Authority Laundering 攻击原理:五阶段模型
Authority Laundering 不是单一攻击,而是一个完整的攻击链。
理解 Authority Laundering 需要理解其五个阶段的攻击链路。每个阶段都利用了 AI Agent 的特定能力,最终将不可信输入转化为授权操作。
2.1 五阶段攻击模型
| 阶段 | 攻击者行为 | Agent 行为 | 安全边界突破 |
|---|---|---|---|
| 1. 恶意输入构造 | 在网页中隐藏指令(HTML 注释、隐藏文本) | — | 输入不可信 |
| 2. Agent 读取 | — | Agent 抓取网页,将隐藏指令一并读取 | 输入边界模糊 |
| 3. 指令解析 | — | Agent 将隐藏指令误认为合法任务 | 指令与数据混淆 |
| 4. 工具调用 | — | Agent 基于"任务"调用内部工具 | 权限边界突破 |
| 5. 副作用产生 | — | 工具执行产生实际影响(删除文件、发送数据) | 真实世界影响 |
2.2 技术细节:为什么 Agent 会上当?
根本原因:指令与数据混淆(Instruction-Data Confusion)
传统软件系统中,指令和数据有明确的边界区分。SQL 查询中,SQL 语句是指令,用户输入是数据。Prompt Injection 的本质就是打破这个边界。
AI Agent 的特殊性:
AI Agent 使用自然语言作为"指令语言"。自然语言本身就是数据,也是指令。这种模糊性使得 Agent 更难区分"我应该执行的命令"和"我应该处理的内容"。
具体技术路径:
- HTML 注释隐藏:在网页 HTML 注释中嵌入指令
- 隐藏文本:使用 CSS 隐藏文本(display: none),用户看不到,但 Agent 抓取时会读取
- 元数据注入:在 PDF、Word 文档的元数据中嵌入指令
- API 返回污染:在第三方 API 返回的数据中嵌入指令
2.3 与传统攻击的对比
| 攻击类型 | 攻击目标 | 攻击路径 | 防御难度 |
|---|---|---|---|
| 直接提示注入 | 用户输入 | 用户 → 模型 | 低(输入过滤) |
| 间接提示注入 | 外部数据 | 数据源 → Agent → 模型 | 中(数据隔离) |
| Authority Laundering | 外部数据 + Agent 权限 | 数据源 → Agent → 工具 → 真实世界 | 高(多层防御) |
关键区别: Authority Laundering 的危害不仅在于信息泄露,更在于真实世界的副作用。Agent 可以执行文件操作、发送请求、调用 API——这些操作一旦执行,后果不可逆。
三、真实案例分析:摩尔斯电码攻击事件
Dark Reading 披露的案例令人震惊。
攻击者使用摩尔斯电码(Morse Code)——一种由点(·)和划(—)组成的古老通信编码——成功欺骗了 AI Agent,让其执行了超出权限的操作。
3.1 攻击过程还原
场景: 企业使用 AI Agent 监控新闻网站,自动提取行业动态。
攻击步骤:
- 构造恶意网页:攻击者在网页中嵌入摩尔斯电码编码的指令
- Agent 抓取网页:Agent 正常抓取网页内容,包括摩尔斯电码
- 指令解码:Agent 的 LLM 能够理解摩尔斯电码(LLM 训练数据中包含此类知识)
- 执行恶意操作:Agent 将解码后的指令误认为合法任务,调用内部工具
为什么是摩尔斯电码?
- 绕过简单过滤:安全系统通常过滤明显的关键词,但摩尔斯电码是编码形式,可以绕过基于关键词的过滤
- LLM 能理解:现代 LLM 的训练数据包含摩尔斯电码知识,能够解码
- 人类不易察觉:安全审计人员看到一串点划,可能不会意识到这是攻击指令
3.2 其他已知攻击向量
四、防御框架:四层防线体系
防御 Authority Laundering 需要多层纵深防御。
单一防御措施无法完全阻止 Authority Laundering。有效的防御需要四层防线:最小权限、输入隔离、工具审计、人工确认。
4.1 第一层:最小权限原则(Least Privilege)
核心思想: Agent 只授予完成任务所需的最小权限。
实施要点:
- 权限分级:将 Agent 权限分为只读、受限写入、完全写入等级别
- 任务绑定:每个任务只授予必要权限,任务完成后权限回收
- 动态权限:根据任务上下文动态调整权限,而非静态授予
4.2 第二层:输入输出隔离(Input-Output Isolation)
核心思想: 外部输入标记为不可信,与内部指令严格分离。
实施要点:
- 数据标记:所有外部输入添加"不可信"标记
- 沙箱处理:在沙箱环境中处理外部输入,限制其对系统的影响
- 输出过滤:Agent 输出在发送到工具前进行过滤,检测潜在的攻击指令
技术方案:
- 提示工程(Prompt Engineering):在系统提示中明确区分"系统指令"和"用户数据"
- 数据隔离层:在 Agent 架构中添加数据隔离层,外部输入经过清洗后再传递给 LLM
- 输出验证:Agent 输出在发送到工具前,通过规则引擎或另一个 LLM 验证其合法性
4.3 第三层:工具调用审计(Tool Call Auditing)
核心思想: 记录所有工具调用,异常调用触发告警。
实施要点:
4.4 第四层:关键操作人工确认(Human-in-the-Loop)
核心思想: 危险操作必须人工确认,不允许 Agent 自主执行。
风险分级示例:
| 操作类型 | 风险级别 | 处理方式 |
|---|---|---|
| 读取文件 | 低 | 自动执行 |
| 写入文件 | 中 | 事后审计 |
| 删除文件 | 高 | 人工确认 |
| 发送邮件 | 高 | 人工确认 |
| 执行命令 | 高 | 人工确认 |
| 访问外部 API | 中 | 事后审计 |
五、行业影响:AI Agent 安全的未来
Authority Laundering 揭示了 AI Agent 安全的根本挑战。
这不仅是技术问题,更是架构问题。AI Agent 的设计哲学是"自主性"——让 Agent 能够独立完成任务。但自主性与安全性存在天然张力。
5.1 对 AI 安全行业的影响
1. Agent 安全成为独立领域
Authority Laundering 的出现标志着 AI Agent 安全正在成为一个独立的研究领域。传统的网络安全、应用安全方法无法完全覆盖 Agent 安全的特殊性。
2. 安全标准与认证
企业级 Agent 部署需要安全认证。未来可能出现类似 SOC 2 的 Agent 安全认证标准,要求 Agent 供应商证明其防御能力。
3. 保险与责任
Agent 造成的安全事故如何定责?如果 Agent 被 Authority Laundering 攻击导致数据泄露,责任在 Agent 供应商、部署企业还是攻击者?这些问题将推动 AI 保险市场的发展。
5.2 对开发者的影响
1. 安全开发规范
开发者需要遵循新的安全规范:默认最小权限、外部输入必须隔离、工具调用必须审计、危险操作必须人工确认。
2. 安全测试
Agent 上线前需要进行安全测试:提示注入测试、权限边界测试、工具调用异常测试、多轮对话安全测试。
3. 持续监控
Agent 上线后需要持续监控:工具调用日志分析、异常行为检测、安全事件响应。
5.3 对 AI 行业的影响
1. Agent 架构演进:沙箱化、形式化验证、可解释性
2. 监管介入:欧盟 AI Act、美国 Agent 安全标准、中国安全责任法规
3. 行业协作:共享攻击情报、制定安全标准、建立应急响应机制
六、Authority Laundering 与其他 AI 安全威胁的对比
理解 Authority Laundering 在 AI 安全威胁图谱中的位置。
6.1 AI 安全威胁分类
| 威胁类型 | 攻击目标 | 攻击方式 | 防御方法 |
|---|---|---|---|
| 直接提示注入 | 用户输入 | 用户在输入中嵌入恶意指令 | 输入过滤、提示工程 |
| 间接提示注入 | 外部数据 | 在 Agent 读取的数据中嵌入指令 | 数据隔离、沙箱处理 |
| Authority Laundering | 外部数据 + Agent 权限 | 污染数据 → Agent 误解 → 工具调用 | 多层防御 |
| 模型窃取 | 模型参数 | 通过查询推断模型参数 | 访问控制、速率限制 |
| 数据泄露 | 训练数据 | 通过查询推断训练数据 | 差分隐私、输出过滤 |
6.2 Authority Laundering 的独特性
1. 利用 Agent 的合法性:Authority Laundering 不攻击 Agent 本身,而是利用 Agent 的合法权限。
2. 难以检测:由于操作在权限范围内,传统安全系统可能无法检测到。
3. 真实世界影响:与传统的 AI 安全威胁不同,Authority Laundering 可以直接产生真实世界的影响。
七、实践指南:构建安全的 AI Agent
将理论转化为实践。
7.1 设计阶段
1. 威胁建模:识别 Agent 可能读取的外部数据源、可能调用的工具、每个工具调用的潜在影响。
威胁建模是安全设计的第一步。需要回答以下问题:
- Agent 会读取哪些外部数据源?(网页、邮件、API、文件)
- Agent 会调用哪些内部工具?(文件系统、数据库、邮件系统、代码仓库)
- 每个工具调用的潜在影响是什么?(读取、写入、删除、发送)
- 攻击者可能如何污染数据源?
威胁建模输出:
| 数据源 | 污染风险 | 影响范围 | 防御措施 |
|---|---|---|---|
| 网页抓取 | 高 | 中 | 输入隔离、沙箱处理 |
| 邮件内容 | 中 | 高 | 数据标记、输出过滤 |
| API 返回 | 中 | 中 | 数据隔离、异常检测 |
| 用户上传文件 | 高 | 高 | 沙箱处理、人工确认 |
| 代码仓库 | 低 | 高 | 权限分级、审计日志 |
2. 权限设计:遵循最小权限原则,列出所有操作,分配最小必要权限,设计权限回收机制。
权限设计需要考虑以下维度:
- 操作类型:读取、写入、删除、发送、执行
- 资源范围:文件系统、网络、数据库、API
- 时间范围:临时权限、会话权限、永久权限
- 条件限制:IP 限制、时间限制、次数限制
权限分级示例:
| 权限级别 | 能力范围 | 典型任务 |
|---|---|---|
| L0(只读) | 只能读取指定资源 | 数据抓取 |
| L1(受限写入) | 可写入指定资源,不可删除 | 代码生成 |
| L2(完全写入) | 可写入和删除指定资源 | 文件整理 |
| L3(执行权限) | 可执行命令或调用 API | 自动化部署 |
| L4(管理权限) | 可修改权限配置 | 系统管理 |
每个任务只授予必要权限,任务完成后权限回收。
3. 数据流设计:明确外部输入来源、传递给 LLM 的路径、数据隔离和验证的位置。
数据流设计需要确保外部输入在整个处理链路中都受到控制。
数据流设计原则:
- 外部输入必须标记为不可信
- 外部输入必须经过清洗和验证
- 外部输入不能直接作为指令执行
- 外部输入的处理必须在沙箱环境中
7.2 开发阶段
1. 代码规范:所有外部输入标记为不可信、所有工具调用记录日志、所有危险操作有人工确认机制。
代码规范是安全开发的基础。需要建立以下规范:
输入处理规范:
- 所有外部输入必须添加
untrusted: true标记 - 所有外部输入必须经过清洗函数处理
- 所有外部输入必须有长度限制和格式验证
工具调用规范:
异常处理规范:
- 所有异常情况必须记录详细日志
- 所有异常情况必须触发告警
- 所有异常情况必须有明确的恢复策略
2. 安全组件:数据隔离层、工具调用审计层、人工确认层。
安全组件是安全架构的核心。需要实现以下组件:
数据隔离层:
- 负责清洗和验证外部输入
- 负责标记和隔离不可信数据
- 负责检测潜在的注入攻击
工具调用审计层:
- 负责记录所有工具调用
- 负责检测异常调用模式
- 负责触发实时告警
人工确认层:
- 负责高风险操作的人工确认
- 负责确认流程的管理和记录
- 负责超时和异常处理
3. 安全测试:单元测试、集成测试、渗透测试。
安全测试是验证安全措施有效性的关键。需要覆盖以下测试类型:
单元测试:
- 测试数据隔离层的清洗和验证逻辑
- 测试工具调用审计层的日志记录逻辑
- 测试人工确认层的确认流程
集成测试:
- 测试整个数据流的安全性
- 测试权限控制的有效性
- 测试异常处理的完整性
渗透测试:
- 模拟 Authority Laundering 攻击
- 测试防御措施的有效性
- 发现潜在的安全漏洞
7.3 部署阶段
1. 沙箱环境:限制文件系统访问、网络访问、系统调用。
沙箱环境是防止恶意操作的重要防线。需要实现以下限制:
文件系统限制:
- 只能访问指定的工作目录
- 不能访问系统文件和敏感目录
- 所有文件操作必须记录日志
网络访问限制:
- 只能访问白名单中的域名和 IP
- 不能访问内部网络和敏感服务
- 所有网络请求必须记录日志
系统调用限制:
- 只能使用白名单中的系统调用
- 不能执行危险的系统命令
- 所有系统调用必须记录日志
2. 监控与告警:实时监控工具调用、检测异常行为模式、触发告警。
监控与告警是及时发现安全事件的关键。需要实现以下功能:
实时监控:
- 实时监控所有工具调用
- 实时监控所有文件操作
- 实时监控所有网络请求
异常检测:
- 检测异常的工具调用模式
- 检测异常的文件访问模式
- 检测异常的网络请求模式
告警机制:
- 高风险操作触发实时告警
- 异常模式触发告警
- 安全事件触发告警
3. 应急响应:定义安全事件等级、制定应急响应流程、定期演练。
应急响应是处理安全事件的最后防线。需要建立以下机制:
安全事件等级:
- P0(严重):数据泄露、系统被控制
- P1(高):未授权操作、异常行为
- P2(中):可疑活动、配置错误
- P3(低):日志异常、轻微违规
应急响应流程:
- 发现安全事件后立即隔离受影响系统
- 评估安全事件的影响范围
- 采取补救措施防止进一步损害
- 记录安全事件的详细信息
- 复盘安全事件并改进防御措施
定期演练:
- 每季度进行一次安全演练
- 模拟各种安全事件场景
- 测试应急响应流程的有效性
- 改进应急响应流程
八、开源工具与框架:构建安全 Agent 的生态
开源社区正在积极构建 Agent 安全工具生态。
2026 年,随着 AI Agent 安全需求的增长,一系列开源工具和框架应运而生。这些工具为开发者提供了构建安全 Agent 的基础设施。
8.1 Agent 安全框架
1. LangGuard
LangGuard 是一个专注于 LLM 应用安全的开源框架,提供了完整的 Agent 安全防护能力。
核心功能:
- 输入清洗和验证
- 指令与数据分离
- 工具调用审计
- 异常行为检测
使用示例(伪代码): 初始化 AgentGuard 并设置输入验证、工具调用审计和异常检测,然后通过 guard.wrap(agent) 包装 Agent,使所有工具调用都经过安全检查。
2. AgentSandbox
AgentSandbox 提供了一个安全的沙箱环境,用于运行 AI Agent。
核心功能:
- 文件系统隔离
- 网络访问控制
- 资源限制
- 操作审计
部署架构:
| 组件 | 功能 | 技术实现 |
|---|---|---|
| 沙箱容器 | 隔离 Agent 运行环境 | Docker/gVisor |
| 网络代理 | 控制网络访问 | Envoy/Istio |
| 审计日志 | 记录所有操作 | Fluentd/Elasticsearch |
| 监控告警 | 实时检测和告警 | Prometheus/Grafana |
8.2 安全检测工具
1. PromptShield
PromptShield 是一个专门检测提示注入攻击的工具。
检测能力:
- 直接提示注入检测
- 间接提示注入检测
- Authority Laundering 检测
- 多语言攻击检测
检测准确率:
| 攻击类型 | 检测率 | 误报率 |
|---|---|---|
| 直接提示注入 | 98% | 2% |
| 间接提示注入 | 95% | 3% |
| Authority Laundering | 92% | 4% |
| 多语言攻击 | 89% | 5% |
2. ToolCallMonitor
ToolCallMonitor 是一个实时监控工具调用的工具。
核心功能:
- 实时记录所有工具调用
- 检测异常调用模式
- 触发实时告警
- 生成审计报告
8.3 开源工具对比
| 工具 | 类型 | 核心功能 | 适用场景 |
|---|---|---|---|
| LangGuard | 安全框架 | 输入清洗、工具审计 | 通用 Agent 安全 |
| AgentSandbox | 沙箱环境 | 隔离运行、资源限制 | 高风险 Agent |
| PromptShield | 检测工具 | 提示注入检测 | 所有 LLM 应用 |
| ToolCallMonitor | 监控工具 | 实时告警、审计报告 | 生产环境 Agent |
九、结论:AI Agent 安全是长期战役
Authority Laundering 不是终点,而是起点。
核心要点回顾
- Authority Laundering 的本质:AI Agent 将不可信外部输入转化为授权操作的安全威胁
- 攻击链路:恶意输入构造 → Agent 读取 → 指令解析 → 工具调用 → 副作用产生
- 防御框架:最小权限 + 输入隔离 + 工具审计 + 人工确认
- 行业影响:Agent 安全成为独立领域,安全标准、保险、监管将逐步建立
- 开源生态:LangGuard、AgentSandbox、PromptShield 等工具为开发者提供安全保障
给开发者的建议
- 立即行动:审视现有 Agent 系统的安全状况
- 持续学习:关注 AI 安全领域的最新研究
- 协作共建:参与行业安全标准的制定
- 安全优先:将安全作为 Agent 设计的核心考量
- 使用工具:利用开源安全工具框架构建防御体系
给企业管理者的建议
- 投资安全:将 Agent 安全作为 AI 投资的重要组成部分
- 建立规范:制定企业级 Agent 安全规范和标准
- 培训团队:提升团队的 Agent 安全意识和技能
- 持续监控:建立 Agent 安全的持续监控和响应机制
Authority Laundering 提醒我们:在 AI 时代,安全不仅是技术问题,更是信任问题。
只有建立了安全的 AI Agent 系统,才能赢得用户对 AI 的信任,才能真正释放 AI 的潜力。
AI Agent 安全是一场长期战役。我们需要技术、规范、监管、协作多管齐下,才能在这场战役中取得胜利。
参考资料:
- Dark Reading. The Real AI Threat Is Blind Trust. 2026-07-18.
- Axios. AI is a cybersecurity risk accelerant, experts say. 2026-07-17.
- LangGuard Documentation. https://github.com/langguard/langguard. 2026.
- AgentSandbox Documentation. https://github.com/agentsandbox/agentsandbox. 2026.
🎯 相关面试题
结合本篇技术观点,备战 AI 岗位面试。
- 高级概念查看详解 →
什么是 Authority Laundering?如何在 Agent 系统中防范?
Authority Laundering(权限洗白)是 AI Agent 将不可信外部输入转化为授权操作的新型安全威胁。攻击者通过污染 Agent 读取的外部数据源(网页、邮件、API 返回),诱导 Agent 执行超出权限边界的行为。防范需要最小权限、输入输出隔离、工具调用审计和关键操作人工确认。
- 中级系统设计查看详解 →
企业如何部署 AI 应用安全监控?
随着企业 AI Agent 大规模部署,AI 应用安全监控成为新兴刚需赛道。本题考察候选人对 AI 应用安全监控体系的理解:输入/输出侧检测、工具调用监控、审计合规、架构设计。
- 高级系统设计查看详解 →
设计一个 AI Agent 安全网关需要哪些组件?
从 Agent 安全生态出发,设计包含身份认证、策略检查点、代码安全扫描、审计日志和权限控制的安全网关架构。
- 中级场景高频查看详解 →
AI Agent 如何通过 OfficeCLI 实现 Office 文档的视觉闭环?
OfficeCLI 以单二进制文件让 AI Agent 自主创建、读取、修改 docx/xlsx/pptx 文档,内置 HTML 渲染引擎实现创建→渲染→检查→修复的视觉闭环。这解决了 Agent 处理 Office 文档时「看不见」的核心痛点,从 RPA 的屏幕模拟进入语义级文档操作范式。
