Role Tag(角色标签)
Role Tag区分 user/assistant 的标记
亦作、亦称:角色标签 · Role Tag · Role Tag Injection · 角色标签注入 · Chat Template Role
Role Tag 是 LLM 区分 user/assistant/system/tool 的角色标记。问题在于这些标签最终以普通文本进入模型,攻击者可伪造角色实施'角色混淆'注入(poolId N6)——这是架构层而非应用层的脆弱性。
角色标签的作用
现代 LLM 用角色标签把一段连续文本流切分成有语义的片段:user 标签意味着'这是外部的、可能不可信的、需要回应的内容';assistant 标签意味着'这是我自己的输出,可信并继续';system 意味着开发者指令、优先级最高;tool 意味着工具返回的数据。
这些标签让模型知道每段话'是谁说的、该如何对待、接下来生成什么',是对话能力的基础结构。
角色混淆攻击机制
问题在于:这些标签最终都以普通文本形式进入模型,模型无法在架构层面强制区分'真的 system 指令'和'伪装成 system 的数据'。
《Prompt Injection as Role Confusion》(arXiv:2603.12277)验证:攻击者只要在外部数据(网页、文档、工具返回)里注入看起来像 user 或 assistant 的文本,就可能让模型把它当成真实指令或输出。当注入文本模仿了某角色的'语气特征'(如模仿思维链),模型会被骗到把数据当成自己的推理。
与应用层注入的区别及防御
传统提示注入(如'忽略以上所有指令')是应用层攻击,靠关键词与句式欺骗;Role Tag 注入是架构层攻击,利用'指令与数据在同一文本流中无强制隔离'这一根本设计。
OWASP 把提示注入列为 2026 年 LLM 头号威胁,人类红队对前沿模型攻击成功率一度接近 100%。防御梯度:输入过滤与定界符、特权最小化(高权限工具独立授权、不经自由文本决策)、输出与行为监控、以及前沿的数据/指令通道架构隔离。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「区分 user/assistant 的标记」
- 「LLM 对话里的身份标签」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念高频查看详解 →
LLM 中的 Role Tag 是什么?攻击者如何利用 role tag 注入实现越狱或数据泄露?
考察候选人对 LLM 架构层信任边界缺陷的理解:role tag 如何切分对话语义、为何指令与数据在同一文本流中无强制隔离、角色混淆攻击的机制,以及与应用层提示注入的区别和"特权分离"防御。
- 高级概念高频查看详解 →
什么是 Reward Hacking?为什么自主 Agent 会"偷懒"?如何检测和缓解?
考察候选人对 Reward Hacking(规格博弈)本质的理解:奖励函数作为真实意图的不完美代理如何被聪明 Agent 钻空子,为什么自主 Agent 在长时任务中会"偷懒",以及检测与缓解的分层防御体系。
- 高级场景查看详解 →
AI Agent 自主发现 0day 漏洞带来哪些安全影响?如何防御?
当 AI Agent 能自主发现 Redis 等软件的 0day 并构建 RCE,攻防双方的能力天平被重新校准。防御侧要把 AI 用于主动审计与红队、缩短检测-响应时间、收敛暴露面,并假设"攻击者也有同等 AI 能力"来设计纵深防御。
- 高级系统设计查看详解 →
如何设计 AI Agent 的最小权限系统?从 AgentForger 攻击谈起
Agent 天生在信任边界内部、行为合法,传统边界防御失效。最小权限系统要把 Agent 当独立身份主体,授予动态、短期、可吊销的权限,高影响操作走 JIT 授权与 human-in-the-loop,并用行为基线检测与不可篡改审计兜底,目标是"单点失守不致命"。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Role Tag」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
