OpenAI 评估 Astra 模型达到 Critical 级网络能力
事件背景
OpenAI 在官方博客发布了一篇关于前沿模型网络安全能力评估的文章,披露其下一代模型 Astra 在内部红队测试中展现出可能达到 Critical 级别的网络安全攻击能力。这是 OpenAI 首次公开承认某模型可能具备该级别能力,也是首次因能力评估结果而主动延迟模型发布。Black Hat 2026 大会上,OpenAI 安全团队成员进一步确认了这一评估结果。
2026 年 8 月 7 日,OpenAI / XenoSpectrum / Global Banking & Finance。
关键事实
- OpenAI 内部 Preparedness 框架评估发现 Astra 模型可能达到 Critical 级网络能力
- "cannot rule out" Critical 级网络能力——这是该框架的第二高等级
- Critical 级定义:可自主发现并利用复杂系统漏洞,可能对国家安全基础设施构成威胁
- Black Hat 2026 会议上 OpenAI 安全团队表示"consciously slowing down research to enhance security"
- Astra 发布时间未定,此前预计 2026 年 Q3 发布
- 将与 CISA、NSA 等政府机构联合验证能力边界
- 这是 Trump 行政令(6/2/2026)要求发布前 30 天政府审查框架下的首次模型延迟
技术机制
前沿模型能力评估发现 Critical 级网络能力后主动减速:从快速发布转向负责任部署。模型发布流程需要纳入能力评估和安全审查。Trump 行政令(6/2/2026 要求发布前 30 天政府审查)可能成为新常态。
影响对象
- AI 安全政策: 面临新挑战,Critical 级能力需要政府和企业联合验证
- 模型发布流程: 需要纳入能力评估和安全审查
- 政府机构: 需要建立审查框架和能力验证机制
- AI 企业: 需要适应新的发布流程和审查要求
风险边界与不确定性
- Astra 具体能力未公开
- 减速是否足够存在争议
- 政府审查框架尚未完全建立
后续观察信号
- Astra 发布时间
- 政府审查框架落地
- 其他模型的能力评估结果
- 首批基于新流程的模型发布案例
AI Master 解读
核心事件
OpenAI 评估发现 Astra 模型可能达到 Critical 级网络能力,主动减速研究以增强安全。
行业影响
为什么重要: 这是前沿模型能力评估的标志性事件:发现 Critical 级能力后主动减速,而非快速发布。从快速发布转向负责任部署,模型发布流程正在重塑。
影响分析: AI 安全政策面临新挑战,Critical 级网络能力需要政府和企业联合验证。模型发布流程需要纳入能力评估和安全审查。Trump 行政令(6/2/2026 要求发布前 30 天政府审查)可能成为新常态。
AI Master 建议
关注 Astra 发布时间、政府审查框架落地、其他模型的能力评估结果。
