Jailbreak(越狱)

Jailbreak

骗过 AI 安全限制

亦作、亦称:越狱

Jailbreak(越狱)是指通过精心构造的提示词,绕过大语言模型(LLM)内置的安全对齐机制,诱使模型输出其正常情况下会拒绝的内容。这是 AI 安全领域红队测试的核心议题之一,也是对齐研究持续关注的挑战。

概述

Jailbreak(越狱)是指通过精心构造的提示词,绕过大语言模型(LLM)内置的安全对齐机制,诱使模型输出其正常情况下会拒绝的内容。这是 AI 安全领域红队测试的核心议题之一,也是对齐研究持续关注的挑战。

核心定义

Jailbreak 借用了智能手机「越狱」(iOS jailbreak)的隐喻,指绕过开发者为大语言模型设置的安全限制。

  • 安全对齐(safety alignment)是模型通过 RLHF 等技术习得的拒绝有害请求的能力,本质是概率分布的偏移,而非硬编码规则
  • Jailbreak 并非攻击模型权重,而是在推理阶段通过输入操控触发模型的「服从」行为
  • 成功越狱后,模型可能输出危险信息、违规内容或绕过版权及使用政策限制
  • 提示词注入(prompt injection)不同,越狱通常以欺骗模型自身为目标,而非劫持下游系统或工具链

发展脉络

越狱攻击随大语言模型的普及而快速演化。

  • 2022 年 12 月:ChatGPT 发布后数周,社区用户创造了首批 DAN(Do Anything Now)提示词,通过角色扮演诱导模型扮演「无限制的 AI 人格」
  • 2023 年上半年:DAN 变体持续迭代,最早版本在网络上存活超过 240 天后才被 OpenAI 修复;研究者后来整理了 1,405 条野外流传的越狱提示词
  • 2023 年中:学术界发表 GCG(Greedy Coordinate Gradient)等自动化越狱算法,将攻击从手工提示扩展到梯度优化,并证明可跨模型迁移
  • 2024 年至今:多模态模型(图像、音频输入)带来新攻击面,「语义防火墙绕过」「Agent 工具链间接注入」等更复杂的技术持续涌现

主要攻击手法

研究界将越狱技术归纳为若干类别。

  • 角色扮演类:要求模型扮演无限制的 AI 角色(如 DAN),借助角色身份「合法化」违禁输出,是最早也最广泛的手法
  • 虚构场景类:将有害请求包装在小说、电影剧本等虚构框架中,降低模型的拒绝倾向
  • 编码混淆类:用 Base64、ROT13、字符倒置或多语言切换等方式掩盖请求的真实意图,绕过关键词过滤
  • 对抗后缀类:通过梯度优化(如 GCG 算法)自动生成附加在提示末尾的对抗性 token 序列,可迁移至多个模型
  • 多轮渐进类:在多轮对话中逐步建立上下文信任或改变语境,最终诱导模型越过安全边界

底层机制分析

机制可解释性研究揭示了越狱为何有效。

  • 模型的安全行为源于 RLHF/RLAIF 训练,本质是概率分布的偏移而非硬规则,存在可被利用的边缘案例
  • 模型在对话中存在上下文服从偏差:当前上下文暗示「此为安全场景」时,安全层的激活强度会显著下降
  • 表示工程(representation engineering)研究表明,越狱提示往往改变了模型中间层对「有害性」概念的内部表示
  • 指令遵循能力与安全约束之间存在固有张力,越狱本质上是对这一张力的概率性利用

防御与缓解

业界普遍认为不存在单一完美防御,需多层纵深部署。

  • 输入过滤:在请求进入模型前,用分类器或规则检测明显越狱模式(效果有限,易被语义变形绕过)
  • 系统提示强化:在 system prompt 中明确约束模型的行为边界和拒绝条件
  • 输出审计:对模型输出进行二次安全检查,拦截违规内容再返回用户
  • 红队测试(red teaming):持续雇用安全研究员或自动化工具主动发现新漏洞
  • 对齐增强训练:通过 DPO、Constitutional AI 等技术在训练阶段提高模型对越狱的鲁棒性,但需警惕「对齐税」(过度拒绝合理请求)

红队测试与合规意义

越狱研究是负责任 AI 开发生态的重要组成部分。

  • 主要 AI 实验室(OpenAI、Anthropic、Google DeepMind)均将越狱测试纳入模型上线前的安全评估流程
  • 学术红队的目标是披露漏洞、推动修复,具有正当的安全研究属性,有别于恶意滥用
  • 欧盟《AI 法案》及多国监管框架要求高风险 AI 系统在部署前提供对抗性测试报告
  • 负责任披露(responsible disclosure)规范正在 AI 安全社区中逐步建立,类似传统网络安全领域

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「骗过 AI 安全限制」
  • 「AI 安全与合规」
  • 「跟 Jailbreak 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    AI 安全:对抗攻击与防御

    从对抗样本到鲁棒训练,理解 AI 系统的安全挑战

  2. 2

    AI 红队测试工具全景:从开源框架到企业级平台

    2026 年 AI 红队测试已从学术研究走向工程实践。本文系统梳理当前主流 AI 红队测试工具:从开源框架 Garak、Microsoft PyRIT、llm-guard 到企业级平台 Mindgard、Lakera、HiddenLayer,从攻击类型覆盖到自动化程度,从部署方式到合规支持,帮你选择适合团队的红队测试工具栈。