Bloom
Anthropic 开源的自动化行为评估框架,通过多代理编排生成评估场景并评分 LLM 的偏见、自我保护、政治倾向等行为。支持大规模并行评估。
🎯适用场景:自动化评估 LLM 的特定行为(偏见、自我保护等),降低 AI 安全评估成本
#AI 安全#行为评估#多代理#Anthropic
📊 仓库数据
Stars1,390
语言Python
上线2025/12/22
更新2026/8/21
✅ 优点
- •Anthropic 官方维护
- •多代理自动化评估
- •MIT 协议
- •支持多种行为类型
- •1,390 stars 社区认可
⚠️ 限制
- •自动化无法完全替代人工红队
- •评估场景质量影响结果
- •依赖 Anthropic 持续投入
