Adversarial Attack(对抗攻击)
Adversarial Attack给模型找茬
亦作、亦称:对抗攻击
对抗攻击(Adversarial Attack)通过精心构造的输入扰动使模型产生错误分类或有害输出,揭示神经网络决策边界脆弱性,是 AI 安全红队测试与鲁棒性研究的核心议题。
攻击类型
白盒攻击(FGSM、PGD)需梯度;黑盒攻击通过查询或迁移;LLM 时代扩展为越狱提示、提示注入、数据投毒等语义层攻击。
防御思路
对抗训练、输入净化、检测器过滤、RLHF 对齐、Guardrails 输出审查。无单一银弹,需纵深防御。
大模型场景
离散 token 空间使梯度攻击更难,但社会工程式 jailbreak 仍有效。企业部署需定期红队与自动化 adversarial benchmark。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「给模型找茬」
- 「骗过模型的输入」
- 「鲁棒性攻击」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是 AI Agent?它与大语言模型(LLM)的本质区别是什么?
AI Agent 是以 LLM 为大脑、能感知环境并自主规划、调用工具、多步执行并按反馈迭代以达成目标的系统;LLM 只是无状态的文本输入到输出函数。
- 中级概念查看详解 →
什么是 GPTCache?它如何帮助降低 AI 应用成本?
GPTCache 是面向 LLM 的语义缓存层,把"问题→回答"缓存,新请求先做语义相似度匹配,命中即返回缓存答案,从而省 token、降延迟、扛并发。
- 中级场景查看详解 →
智能工单分类系统中,AI 可参与哪些环节?技术选型思路是什么?
AI 可参与工单的自动分类打标、意图情绪识别、智能路由、相似聚合去重、知识推荐、回复草稿与 SLA 预警等环节。选型上高频固定类别用轻量分类模型、复杂少样本用 LLM,并可混合编排,配人工复核闭环。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
AI 模型安全:从 Mythos 漏洞挖掘事件看前沿模型的安全挑战
2026 年 4 月,Anthropic Claude Mythos 模型展现了前所未有的漏洞挖掘能力,引发了关于前沿 AI 模型安全性的深度讨论。本文系统梳理 AI 模型安全的核心概念、已知风险类型、防御策略和未来方向。
- 2
AI 安全:对抗攻击与防御
从对抗样本到鲁棒训练,理解 AI 系统的安全挑战
- 3
AI 红队测试工具全景:从开源框架到企业级平台
2026 年 AI 红队测试已从学术研究走向工程实践。本文系统梳理当前主流 AI 红队测试工具:从开源框架 Garak、Microsoft PyRIT、llm-guard 到企业级平台 Mindgard、Lakera、HiddenLayer,从攻击类型覆盖到自动化程度,从部署方式到合规支持,帮你选择适合团队的红队测试工具栈。
外部参考
维基百科:查看「Adversarial Attack」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
