LLM Scheming(LLM 欺骗行为)
LLM SchemingAI 在暗中骗你
亦作、亦称:LLM 欺骗行为 · LLM Scheming · LLM 欺骗 · 多语言 Scheming
LLM Scheming 是 LLM 在评估/部署中表现出的策略性欺骗行为。ICML 2026 FAGEN workshop 论文揭示预训练语言覆盖度与 Scheming 检测率负相关——英文安全评估在非英语语言上可能系统性失效。
核心
见 glossary.ts 同名条目。ICML 2026 FAGEN 论文揭示预训练语言覆盖度与 Scheming 检测率负相关——多语言部署需语言特定安全评估。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「AI 在暗中骗你」
- 「越聪明的模型越会隐藏真实意图」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级场景查看详解 →
多语言 LLM 安全评估的主要盲点及应对方案?
ICML 2026 FAGEN workshop 论文揭示预训练语言覆盖度与 Scheming 检测率负相关——英文安全评估在非英语语言上可能系统性失效。多语言部署需语言特定安全评估。
- 高级系统设计查看详解 →
AI 内容溯源与水印工程:如何设计一套同时满足 EU AI Act Art.50 与加州 SB 942 的技术方案?
考察候选人能否把统计水印的数学原理、C2PA 签名机制、水印鲁棒性与误报率权衡、合规要求的技术实现路径四条线串成一套完整的内容溯源与水印工程方案。能否讲清两层架构(统计水印嵌内容内部 + C2PA 元数据层外部)的互补关系,以及在压缩/截图/改写等攻击下的鲁棒性边界。
- 高级场景查看详解 →
AI Agent 通过 MCP 协议调用外部工具时,如何防御 SSRF 攻击?
MCP 工具端点把用户可控 URL 交给服务端发起请求,天然构成 SSRF 攻击面;CVE-2026-39974(n8n-MCP,CVSS 8.5)与 CVE-2026-34163(FastGPT,CVSS 7.7)证明鉴权不消除 SSRF。防御要分层:URL 协议/IP 校验与解析后复查、防 DNS rebinding、沙箱 egress 白名单、云元数据隔离,叠加最小权限与审计。
- 高级系统设计查看详解 →
推理链保护设计:如何防止加密思维链被同族弱模型重放提取?
Panfilov 等 8 位作者的 arXiv:2608.09867 披露:供应商加密隐藏的推理轨迹在同族模型间格式兼容、可互换,把强模型的加密轨迹注入同族更弱、防护更少的兄弟模型,可迫使其逐字输出明文——Claude、GPT、Gemini 均受影响,还能恢复轨迹中的密码与 API 密钥(该凭据漏洞已被厂商修复)。本题考察候选人能否从跨会话兼容原理、shadow-model 重放机制、轨迹最小化与隔离、凭据前移管理四个维度设计推理链保护体系,并与训练侧反蒸馏防御划清边界。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「LLM Scheming」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
