Shieldstral 3B(策略自适应安全分类器)
Shieldstral 3B亦作、亦称:策略自适应安全分类器 · Shieldstral · Shieldstral 3B · Mistral 安全分类器
Shieldstral 3B 是 Mistral 开源的策略自适应多模态安全分类器(news-7354)——安全判定边界可按部署策略调整,定位是 RAG/Agent 流水线的可配置过滤层。
核心
见 glossary-new-terms.ts 同名条目。与传统固定规则安全过滤器的差异在于策略自适应:判定边界随部署场景(企业合规/消费者产品/开发者工具)可配置,减少一刀切式过度拦截;与 TabooRAG 类阻断攻击的防御关系仍需独立验证(arXiv:2603.03919 显示现有防御下攻击仍鲁棒)。
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
解释 LLM 对齐同质性如何导致 RAG 可迁移阻断攻击(TabooRAG)及防御思路
LLM 对齐同质性使主流安全对齐模型共享相似的风险类别与拒答判据,攻击者可用一篇与查询主题相关的「风险语境文档」注入知识库,让 RAG 在召回后对良性查询整体拒答(阻断型攻击),且可跨模型迁移。arXiv:2603.03919v2 在 3 个 QA 数据集、9 个 LLM 上验证 NQ 阻断 ASR 达 59.1%-77.4%,现有防御下仍鲁棒。
- 中级系统设计高频查看详解 →
如何为 AI Agent 实现 Least Privilege 访问控制?
AI Agent 的 Least Privilege 需要 Agent Identity(身份)+ Least Agency Enforcement(权限执行)双层设计。Black Hat 2026 展示 Rubrik Agent Identity(Okta/Entra 集成)和 Zero Networks Least Agency Enforcement(运行时动态权限)。核心原则:默认不信任、运行时动态检查、全链路审计。
- 高级场景高频查看详解 →
描述 Unit 42 披露的 DeepSeek Hermes Agent 自主攻击链,并给出针对性防御要点
考察候选人能否准确复述 Unit 42 取证的 Hermes 自主攻击四阶段(区分自主攻击与手工攻击的战果)、理解「自主侦察可用、最后一公里靠人」的现状边界,并针对 AI 编排平台(Langflow/n8n 类)给出工程防御。
- 高级场景查看详解 →
Google ADK 曝出首个 agent-on-agent 漏洞:多 Agent 系统的威胁模型需要新增哪些维度?
2026-08-03 Google ADK 曝出首个公开的 agent-on-agent 漏洞:恶意 Agent 攻击另一个 Agent。攻击者与受害者都是 Agent,横向移动目标从服务器/凭据扩展到同环境其他 Agent 的记忆与工具——威胁建模需新增「同环境 Agent 信任边界」维度。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
