Authority Laundering(权限洗白)
Authority LaunderingAI Agent 将不可信输入转化为授权操作的新型安全威胁
亦作、亦称:权限洗白 · Authority Laundering · Agent 权限洗白攻击
Authority Laundering是 AI Agent 安全的重大新威胁——攻击者不攻击模型,而是污染 Agent 读取的外部数据,让 Agent '自愿'执行恶意操作。
攻击链路
Authority Laundering 攻击包含五个阶段:恶意输入构造——在网页中隐藏指令(如 HTML 注释中的命令);Agent 读取——Agent 抓取网页时将隐藏指令一并读取;指令解析——Agent 将隐藏指令误认为合法任务;工具调用——Agent 基于'任务'调用内部工具;副作用产生——工具执行产生实际影响(删除文件、发送数据等)。
防御策略
防御 Authority Laundering 需要四层防线:最小权限原则——Agent 只授予完成任务所需的最小权限;输入输出隔离——外部输入标记为不可信,与内部指令严格分离;工具调用审计——记录所有工具调用,异常调用触发告警;关键操作人工确认——危险操作必须人工确认,不允许 Agent 自主执行。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「AI Agent 将不可信输入转化为授权操作的新型安全威胁」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
什么是 Authority Laundering?如何在 Agent 系统中防范?
Authority Laundering(权限洗白)是 AI Agent 将不可信外部输入转化为授权操作的新型安全威胁。攻击者通过污染 Agent 读取的外部数据源(网页、邮件、API 返回),诱导 Agent 执行超出权限边界的行为。防范需要最小权限、输入输出隔离、工具调用审计和关键操作人工确认。
- 高级场景高频查看详解 →
什么是 Prompt Injection?如何防御?
攻击者在输入中嵌入恶意指令劫持模型行为;防御靠输入过滤、权限隔离、输出校验与人机确认。
- 高级系统设计查看详解 →
如何防御开源 AI 模型的供应链攻击?
从 Model Poisoning 攻击向量出发,设计多层防御体系:来源验证、行为测试、运行时监控和模型水印,构建开源 AI 供应链安全方案。
- 高级概念查看详解 →
同态加密在 AI 推理中的应用场景与工程挑战?
全同态加密(FHE)允许在密文上直接执行计算,使 AI 推理可以在不暴露输入数据的前提下完成。2026 年 Belfort Labs 实现 CIFAR-10 推理 200ms 突破,但 FHE 在大规模模型推理中仍面临 1000x-10000x 计算开销、内存膨胀和硬件适配三大工程挑战。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Authority Laundering」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
