Shieldstral 3B(策略自适应安全分类器)
Shieldstral 3B亦作、亦称:策略自适应安全分类器 · Shieldstral · Shieldstral 3B · Mistral 安全分类器
Shieldstral 3B 是 Mistral 开源的策略自适应多模态安全分类器(news-7354)——安全判定边界可按部署策略调整,定位是 RAG/Agent 流水线的可配置过滤层。
核心
见 glossary-new-terms.ts 同名条目。与传统固定规则安全过滤器的差异在于策略自适应:判定边界随部署场景(企业合规/消费者产品/开发者工具)可配置,减少一刀切式过度拦截;与 TabooRAG 类阻断攻击的防御关系仍需独立验证(arXiv:2603.03919 显示现有防御下攻击仍鲁棒)。
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
解释 LLM 对齐同质性如何导致 RAG 可迁移阻断攻击(TabooRAG)及防御思路
LLM 对齐同质性使主流安全对齐模型共享相似的风险类别与拒答判据,攻击者可用一篇与查询主题相关的「风险语境文档」注入知识库,让 RAG 在召回后对良性查询整体拒答(阻断型攻击),且可跨模型迁移。arXiv:2603.03919v2 在 3 个 QA 数据集、9 个 LLM 上验证 NQ 阻断 ASR 达 59.1%-77.4%,现有防御下仍鲁棒。
- 高级系统设计查看详解 →
AI 内容溯源与水印工程:如何设计一套同时满足 EU AI Act Art.50 与加州 SB 942 的技术方案?
考察候选人能否把统计水印的数学原理、C2PA 签名机制、水印鲁棒性与误报率权衡、合规要求的技术实现路径四条线串成一套完整的内容溯源与水印工程方案。能否讲清两层架构(统计水印嵌内容内部 + C2PA 元数据层外部)的互补关系,以及在压缩/截图/改写等攻击下的鲁棒性边界。
- 高级场景查看详解 →
AI Agent 通过 MCP 协议调用外部工具时,如何防御 SSRF 攻击?
MCP 工具端点把用户可控 URL 交给服务端发起请求,天然构成 SSRF 攻击面;CVE-2026-39974(n8n-MCP,CVSS 8.5)与 CVE-2026-34163(FastGPT,CVSS 7.7)证明鉴权不消除 SSRF。防御要分层:URL 协议/IP 校验与解析后复查、防 DNS rebinding、沙箱 egress 白名单、云元数据隔离,叠加最小权限与审计。
- 高级系统设计查看详解 →
推理链保护设计:如何防止加密思维链被同族弱模型重放提取?
Panfilov 等 8 位作者的 arXiv:2608.09867 披露:供应商加密隐藏的推理轨迹在同族模型间格式兼容、可互换,把强模型的加密轨迹注入同族更弱、防护更少的兄弟模型,可迫使其逐字输出明文——Claude、GPT、Gemini 均受影响,还能恢复轨迹中的密码与 API 密钥(该凭据漏洞已被厂商修复)。本题考察候选人能否从跨会话兼容原理、shadow-model 重放机制、轨迹最小化与隔离、凭据前移管理四个维度设计推理链保护体系,并与训练侧反蒸馏防御划清边界。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
