NVIDIA AVO 在 ARC-AGI-3 公开集获 100% RHAE 满分,Agent 架构 vs 裸模型能力差距显著
NVIDIA Agentic Variation Operators(AVO)在 ARC-AGI-3 公开集 25 个环境 183 个关卡中获 100.00 RHAE 满分,使用 Claude Opus 5 完成,仅 6,624 个环境动作(比 VISTA 的 7,542 少 12%)。底层 Opus 5 裸模型仅 30.2%,AVO 通过记忆系统+监督循环+迭代检查-规划-实现-评估架构实现 70% 提升。NVIDIA 明确标注这是公开集而非隐藏集,且对比实验并非受控消融。
NVIDIA AVO 在 ARC-AGI-3 公开集获 100% RHAE 满分
NVIDIA 于 2026 年 8 月 21 日发布博客报告其 Agentic Variation Operators(AVO)系统在 ARC-AGI-3 公开集 25 个环境 183 个关卡中获得 100.00 RHAE 满分。AVO 使用 Claude Opus 5 作为底层模型,仅用 6,624 个环境动作完成全部关卡,比 VISTA 系统的 7,542 个动作少约 12%。
事件背景
ARC-AGI-3 是交互式推理基准,Agent 进入陌生的游戏化环境,没有指令、明确规则或目标声明,必须通过交互探索、推断环境动态和目标,并在 progressively harder 的关卡中高效规划动作。基准使用 Relative Human Action Efficiency(RHAE)指标,结合任务完成度和相对于首次人类基线的每关动作效率。
AVO 原本是为 GPU 内核优化设计的自主系统,在 NVIDIA DGX B200 上连续运行 7 天优化 CUDA 内核,探索超过 500 个优化方向,产出超越 cuDNN 和 FlashAttention-4 的注意力内核。NVIDIA 将同一架构迁移到 ARC-AGI-3,仅更换任务接口,核心 Agent 循环保持不变。
核心结果
| 系统 | RHAE | 动作数 | 备注 |
|---|---|---|---|
| AVO (Claude Opus 5) | 100.00 | 6,624 | 公开集 25 环境 183 关卡 |
| VISTA (Claude Opus 5) | — | 7,542 | 相同任务,非受控对比 |
| Claude Opus 5 裸模型 | 30.2% | — | 高推理努力,公开集 |
AVO 的核心架构包括持久记忆系统、监督循环和迭代检查-规划-实现-评估机制。这些机制使 Agent 能够在长周期任务中维持进展、从失败中恢复并持续积累上下文。
方法论 Caveat
NVIDIA 在博客中明确标注三个重要限制:
- 公开集而非隐藏集:100% RHAE 是 25 环境公开集的结果,不是半私有或私有竞赛集。ARC-AGI-3 明确划分公开、半私有和私有集以防止过拟合。
- 非受控对比:AVO vs VISTA 和 AVO vs 裸 Opus 5 的对比均非受控实验,多个变量同时变化(Agent 后端、观察格式、记忆系统、推理努力设置等)。
- 初步结果:GPT-5.6 Sol 的比较仅覆盖部分游戏,NVIDIA 标记为初步结果,待系统性后续工作。
战略意义
- 架构迁移性:GPU 内核优化 Agent 直接迁移到交互式推理基准,证明架构设计的跨域泛化能力。
- 系统级贡献:裸模型 30.2% 到 Agent 系统 100% 的差距凸显外围系统(记忆、监督、上下文管理)的关键作用。
- 效率提升:比 VISTA 少用 12% 动作完成相同任务,尽管对比非受控。
风险边界与后续观察
- 公开集满分不等于 ARC-AGI-3 被解决
- 对比实验非受控,无法隔离单个变量贡献
- 隐藏集表现未知
- GPT-5.6 Sol 结果仅为初步
AI Master 解读
核心事件
NVIDIA AVO 在 ARC-AGI-3 公开集 25 个环境 183 个关卡中获 100.00 RHAE 满分,使用 Claude Opus 5 完成,仅 6,624 个环境动作(比 VISTA 的 7,542 少 12%)。底层 Opus 5 裸模型仅 30.2%,AVO 通过记忆系统+监督循环+迭代检查-规划-实现-评估架构实现 70% 提升。NVIDIA 明确标注这是公开集而非隐藏集,且对比实验并非受控消融。
行业影响
为什么重要: 这个结果的核心不是"ARC-AGI-3 被解决了",而是 Agent 架构的系统级贡献。同一底层模型,裸跑与包裹在记忆系统、监督循环和迭代检查-规划-实现-评估架构中,性能差距达到 3.3 倍。这对构建长周期自主 Agent 的团队有直接参考价值:能力边界不仅取决于模型本身,还取决于上下文管理、失败恢复和状态维护的外围系统。
影响分析:
| 维度 | 影响 |
|---|---|
| Agent 架构 | 系统级设计(记忆+监督+迭代)比裸模型能力更关键 |
| 跨域迁移 | GPU 内核优化 Agent 直接迁移到交互式推理基准 |
| 基准方法论 | 公开集满分不等于隐藏集解决,需区分评估集 |
| 效率 | 比 VISTA 少用 12% 动作完成相同任务 |
风险边界: NVIDIA 明确标注这是公开集而非隐藏集;AVO vs VISTA 和 AVO vs 裸 Opus 5 的对比均非受控实验,多个变量同时变化;GPT-5.6 Sol 的比较仅覆盖部分游戏且被标记为初步结果。
AI Master 建议
关注 Agent 架构设计而非仅关注模型能力;区分公开集和隐藏集的基准结果;评估记忆系统和监督循环在自有场景的适用性。 **来源:** NVIDIA Developer Blog **链接:** https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
