Jailbreak(越狱)
Jailbreak骗过 AI 安全限制
亦作、亦称:越狱
Jailbreak(越狱)是指通过精心构造的提示词,绕过大语言模型(LLM)内置的安全对齐机制,诱使模型输出其正常情况下会拒绝的内容。这是 AI 安全领域红队测试的核心议题之一,也是对齐研究持续关注的挑战。
概述
Jailbreak(越狱)是指通过精心构造的提示词,绕过大语言模型(LLM)内置的安全对齐机制,诱使模型输出其正常情况下会拒绝的内容。这是 AI 安全领域红队测试的核心议题之一,也是对齐研究持续关注的挑战。
核心定义
Jailbreak 借用了智能手机「越狱」(iOS jailbreak)的隐喻,指绕过开发者为大语言模型设置的安全限制。
- 安全对齐(safety alignment)是模型通过 RLHF 等技术习得的拒绝有害请求的能力,本质是概率分布的偏移,而非硬编码规则
- Jailbreak 并非攻击模型权重,而是在推理阶段通过输入操控触发模型的「服从」行为
- 成功越狱后,模型可能输出危险信息、违规内容或绕过版权及使用政策限制
- 与提示词注入(prompt injection)不同,越狱通常以欺骗模型自身为目标,而非劫持下游系统或工具链
发展脉络
越狱攻击随大语言模型的普及而快速演化。
- 2022 年 12 月:ChatGPT 发布后数周,社区用户创造了首批 DAN(Do Anything Now)提示词,通过角色扮演诱导模型扮演「无限制的 AI 人格」
- 2023 年上半年:DAN 变体持续迭代,最早版本在网络上存活超过 240 天后才被 OpenAI 修复;研究者后来整理了 1,405 条野外流传的越狱提示词
- 2023 年中:学术界发表 GCG(Greedy Coordinate Gradient)等自动化越狱算法,将攻击从手工提示扩展到梯度优化,并证明可跨模型迁移
- 2024 年至今:多模态模型(图像、音频输入)带来新攻击面,「语义防火墙绕过」「Agent 工具链间接注入」等更复杂的技术持续涌现
主要攻击手法
研究界将越狱技术归纳为若干类别。
- 角色扮演类:要求模型扮演无限制的 AI 角色(如 DAN),借助角色身份「合法化」违禁输出,是最早也最广泛的手法
- 虚构场景类:将有害请求包装在小说、电影剧本等虚构框架中,降低模型的拒绝倾向
- 编码混淆类:用 Base64、ROT13、字符倒置或多语言切换等方式掩盖请求的真实意图,绕过关键词过滤
- 对抗后缀类:通过梯度优化(如 GCG 算法)自动生成附加在提示末尾的对抗性 token 序列,可迁移至多个模型
- 多轮渐进类:在多轮对话中逐步建立上下文信任或改变语境,最终诱导模型越过安全边界
底层机制分析
机制可解释性研究揭示了越狱为何有效。
- 模型的安全行为源于 RLHF/RLAIF 训练,本质是概率分布的偏移而非硬规则,存在可被利用的边缘案例
- 模型在对话中存在上下文服从偏差:当前上下文暗示「此为安全场景」时,安全层的激活强度会显著下降
- 表示工程(representation engineering)研究表明,越狱提示往往改变了模型中间层对「有害性」概念的内部表示
- 指令遵循能力与安全约束之间存在固有张力,越狱本质上是对这一张力的概率性利用
防御与缓解
业界普遍认为不存在单一完美防御,需多层纵深部署。
- 输入过滤:在请求进入模型前,用分类器或规则检测明显越狱模式(效果有限,易被语义变形绕过)
- 系统提示强化:在 system prompt 中明确约束模型的行为边界和拒绝条件
- 输出审计:对模型输出进行二次安全检查,拦截违规内容再返回用户
- 红队测试(red teaming):持续雇用安全研究员或自动化工具主动发现新漏洞
- 对齐增强训练:通过 DPO、Constitutional AI 等技术在训练阶段提高模型对越狱的鲁棒性,但需警惕「对齐税」(过度拒绝合理请求)
红队测试与合规意义
越狱研究是负责任 AI 开发生态的重要组成部分。
- 主要 AI 实验室(OpenAI、Anthropic、Google DeepMind)均将越狱测试纳入模型上线前的安全评估流程
- 学术红队的目标是披露漏洞、推动修复,具有正当的安全研究属性,有别于恶意滥用
- 欧盟《AI 法案》及多国监管框架要求高风险 AI 系统在部署前提供对抗性测试报告
- 负责任披露(responsible disclosure)规范正在 AI 安全社区中逐步建立,类似传统网络安全领域
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「骗过 AI 安全限制」
- 「AI 安全与合规」
- 「跟 Jailbreak 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念高频查看详解 →
什么是越狱(Jailbreak)攻击?如何防御?
越狱通过角色扮演、前缀注入、编码绕过等手段诱导模型突破安全对齐输出违规内容;防御靠系统提示加固、输入输出过滤、对齐训练与红队。
- 中级概念查看详解 →
AI 红队(Red Teaming)是如何开展的?
红队主动用对抗提示、越狱和边界用例探测有害输出,人工+自动结合,形成评测与防护的迭代闭环。
- 中级场景高频查看详解 →
如何防止用户用提示词攻击(注入)你的 AI 功能?
把用户输入当数据而非指令,system prompt 加固+最小权限,输出侧校验,工具调用白名单与人审。
- 初级场景查看详解 →
如何用分隔符与结构化提示减少歧义和注入风险?
用分隔符隔离指令与数据、声明用户输入只当数据处理,降低歧义并缓解 Prompt 注入。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
