Nvidia AVO 将 Claude Opus 5 在 ARC-AGI-3 上从 30% 提升至 100%
2026 年 8 月 21 日,Nvidia 公开 AVO(Agentic Variation Operators)架构细节,展示同一模型在不同 Agent 框架下的性能差距。
事件背景
ARC-AGI-3 是衡量通用 AI 推理能力的基准。ARC Prize 7 月报告 Claude Opus 5 在高推理努力下得分约 30%。Nvidia 8月21日展示 AVO 框架将同一模型提升至 100%。
关键事实
| 项目 | 详情 |
|---|---|
| 裸模型得分 | ~30%(ARC Prize 测量,高推理努力) |
| AVO 系统得分 | 100% RHAE(183 关全通) |
| 环境动作数 | 6,624 次 |
| 对比系统 | VISTA 7,542 次动作完成相同关卡 |
| 核心差异 | Agent 后端、观察表示、记忆管理、评估框架均不同 |
技术机制
AVO 的核心设计:
- 持久记忆:跨步骤携带有用理解,减少重复探索
- 监督 Agent 组件:管理代码检查、编辑、命令执行、文档查阅和验证
- 长程自主操作:专注于持续上下文中的多步骤任务
影响分析
| 维度 | 影响 |
|---|---|
| Agent 架构 | 持久记忆 + 监督组件是关键 |
| 基准解读 | 裸模型得分不代表系统能力 |
| 商业策略 | Nvidia 从卖 GPU 转向卖系统设计 |
| 竞争格局 | OpenAI、LangChain 等也在 harness 侧优化 |
风险边界与后续观察
- Nvidia 明确声明这不是受控消融实验
- 无法归因性能提升于单一组件
- 不同 harness 的 RHAE 评分标准可能不同
- AVO 尚未开源或提供商业版本
AI Master 解读
核心事件
Nvidia 8月21日公开 AVO 架构,将 Claude Opus 5 在 ARC-AGI-3 上从 30% 提升至 100%(183 关全通,RHAE 满分)。
行业影响
为什么重要: 这是"harness 比模型更重要"论点的最极端例证。同一模型在不同 Agent 框架下得分差距达 70 个百分点。Nvidia 强调这不是受控消融实验——AVO 与 ARC Prize 的 harness 在 Agent 后端、观察表示、记忆管理和评估框架上均不同——但结果说明系统设计与模型能力同样重要,甚至更重要。
影响分析:
| 维度 | 影响 |
|---|---|
| Agent 架构 | 持久记忆 + 监督组件是长程任务的关键 |
| 基准解读 | 裸模型得分不代表系统实际能力 |
| 商业策略 | Nvidia 从卖 GPU 转向卖 Agent 系统设计 |
| 竞争格局 | OpenAI、LangChain 等也在 harness 侧优化 |
风险边界: Nvidia 明确声明这不是受控消融实验;AVO 的 6,624 次环境动作 vs VISTA 的 7,542 次,差异 12%,但无法归因于单一组件;RHAE 满分要求同时满足完成率和动作效率,不同 harness 的评分标准可能不同。
AI Master 建议
Agent 开发者应重视 harness 设计而非仅关注模型选择;评估长程任务时需测试完整系统而非裸模型;关注 Nvidia AVO 后续是否开源或提供商业版本。 **来源:** Nvidia Developer Blog / The New Stack **链接:** https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
