Role Tag(角色标签)
Role Tag区分 user/assistant 的标记
亦作、亦称:角色标签 · Role Tag · Role Tag Injection · 角色标签注入 · Chat Template Role
Role Tag 是 LLM 区分 user/assistant/system/tool 的角色标记。问题在于这些标签最终以普通文本进入模型,攻击者可伪造角色实施'角色混淆'注入(poolId N6)——这是架构层而非应用层的脆弱性。
角色标签的作用
现代 LLM 用角色标签把一段连续文本流切分成有语义的片段:user 标签意味着'这是外部的、可能不可信的、需要回应的内容';assistant 标签意味着'这是我自己的输出,可信并继续';system 意味着开发者指令、优先级最高;tool 意味着工具返回的数据。
这些标签让模型知道每段话'是谁说的、该如何对待、接下来生成什么',是对话能力的基础结构。
角色混淆攻击机制
问题在于:这些标签最终都以普通文本形式进入模型,模型无法在架构层面强制区分'真的 system 指令'和'伪装成 system 的数据'。
《Prompt Injection as Role Confusion》(arXiv:2603.12277)验证:攻击者只要在外部数据(网页、文档、工具返回)里注入看起来像 user 或 assistant 的文本,就可能让模型把它当成真实指令或输出。当注入文本模仿了某角色的'语气特征'(如模仿思维链),模型会被骗到把数据当成自己的推理。
与应用层注入的区别及防御
传统提示注入(如'忽略以上所有指令')是应用层攻击,靠关键词与句式欺骗;Role Tag 注入是架构层攻击,利用'指令与数据在同一文本流中无强制隔离'这一根本设计。
OWASP 把提示注入列为 2026 年 LLM 头号威胁,人类红队对前沿模型攻击成功率一度接近 100%。防御梯度:输入过滤与定界符、特权最小化(高权限工具独立授权、不经自由文本决策)、输出与行为监控、以及前沿的数据/指令通道架构隔离。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「区分 user/assistant 的标记」
- 「LLM 对话里的身份标签」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念高频查看详解 →
LLM 中的 Role Tag 是什么?攻击者如何利用 role tag 注入实现越狱或数据泄露?
考察候选人对 LLM 架构层信任边界缺陷的理解:role tag 如何切分对话语义、为何指令与数据在同一文本流中无强制隔离、角色混淆攻击的机制,以及与应用层提示注入的区别和"特权分离"防御。
- 高级系统设计查看详解 →
AI 内容溯源与水印工程:如何设计一套同时满足 EU AI Act Art.50 与加州 SB 942 的技术方案?
考察候选人能否把统计水印的数学原理、C2PA 签名机制、水印鲁棒性与误报率权衡、合规要求的技术实现路径四条线串成一套完整的内容溯源与水印工程方案。能否讲清两层架构(统计水印嵌内容内部 + C2PA 元数据层外部)的互补关系,以及在压缩/截图/改写等攻击下的鲁棒性边界。
- 高级场景查看详解 →
AI Agent 通过 MCP 协议调用外部工具时,如何防御 SSRF 攻击?
MCP 工具端点把用户可控 URL 交给服务端发起请求,天然构成 SSRF 攻击面;CVE-2026-39974(n8n-MCP,CVSS 8.5)与 CVE-2026-34163(FastGPT,CVSS 7.7)证明鉴权不消除 SSRF。防御要分层:URL 协议/IP 校验与解析后复查、防 DNS rebinding、沙箱 egress 白名单、云元数据隔离,叠加最小权限与审计。
- 高级系统设计查看详解 →
推理链保护设计:如何防止加密思维链被同族弱模型重放提取?
Panfilov 等 8 位作者的 arXiv:2608.09867 披露:供应商加密隐藏的推理轨迹在同族模型间格式兼容、可互换,把强模型的加密轨迹注入同族更弱、防护更少的兄弟模型,可迫使其逐字输出明文——Claude、GPT、Gemini 均受影响,还能恢复轨迹中的密码与 API 密钥(该凭据漏洞已被厂商修复)。本题考察候选人能否从跨会话兼容原理、shadow-model 重放机制、轨迹最小化与隔离、凭据前移管理四个维度设计推理链保护体系,并与训练侧反蒸馏防御划清边界。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Role Tag」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
