Adversarial Attack(对抗攻击)

Adversarial Attack

给模型找茬

亦作、亦称:对抗攻击

对抗攻击(Adversarial Attack)通过精心构造的输入扰动使模型产生错误分类或有害输出,揭示神经网络决策边界脆弱性,是 AI 安全红队测试与鲁棒性研究的核心议题。

攻击类型

白盒攻击(FGSM、PGD)需梯度;黑盒攻击通过查询或迁移;LLM 时代扩展为越狱提示、提示注入、数据投毒等语义层攻击。

防御思路

对抗训练、输入净化、检测器过滤、RLHF 对齐、Guardrails 输出审查。无单一银弹,需纵深防御。

大模型场景

离散 token 空间使梯度攻击更难,但社会工程式 jailbreak 仍有效。企业部署需定期红队与自动化 adversarial benchmark。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「给模型找茬」
  • 「骗过模型的输入」
  • 「鲁棒性攻击」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    AI 模型安全:从 Mythos 漏洞挖掘事件看前沿模型的安全挑战

    2026 年 4 月,Anthropic Claude Mythos 模型展现了前所未有的漏洞挖掘能力,引发了关于前沿 AI 模型安全性的深度讨论。本文系统梳理 AI 模型安全的核心概念、已知风险类型、防御策略和未来方向。

  2. 2

    AI 安全:对抗攻击与防御

    从对抗样本到鲁棒训练,理解 AI 系统的安全挑战

  3. 3

    AI 红队测试工具全景:从开源框架到企业级平台

    2026 年 AI 红队测试已从学术研究走向工程实践。本文系统梳理当前主流 AI 红队测试工具:从开源框架 Garak、Microsoft PyRIT、llm-guard 到企业级平台 Mindgard、Lakera、HiddenLayer,从攻击类型覆盖到自动化程度,从部署方式到合规支持,帮你选择适合团队的红队测试工具栈。

外部参考

维基百科:查看「Adversarial Attack」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。