模型与研究

英伟达 AVO 在 ARC-AGI-3 公共测试集取得 100% 分数,但关键可能不只是模型

英伟达公布其 Agentic Variation Operators(AVO)在 ARC-AGI-3 公共测试集取得 100.00 RHAE 分数,完成 183 个关卡。文章强调长期任务中模型只是组成部分,记忆、工具、上下文管理和监督等 harness 机制同样决定最终表现与泛化能力。

英伟达 AVO 在 ARC-AGI-3 公共测试集取得 100% 分数,但关键可能不只是模型

英伟达公布其 Agentic Variation Operators(AVO)在 ARC-AGI-3 公共测试集取得 100.00 RHAE 分数,完成 183 个关卡。文章强调长期任务中模型只是组成部分,记忆、工具、上下文管理和监督等 harness 机制同样决定最终表现与泛化能力。

英伟达在 2026 年 8 月 21 日发布的一篇研究文章称,其 Agentic Variation Operators(AVO)智能体架构在 ARC-AGI-3 公共测试集上取得 100.00 的 RHAE 分数,完成全部 25 个环境、183 个关卡。英伟达表示,系统使用 Claude Opus 5,并在 6,624 次环境操作中完成测试。

这一结果的重点并不只是一个新的基准分数,而是英伟达试图强调的系统性结论:在需要连续探索、记忆和行动的长期任务中,底层模型只是智能体的一部分,围绕模型构建的 harness——包括记忆、工具、上下文管理、反馈、监督和失败恢复机制——可能同样决定最终表现。

AVO 解决的不是单轮回答问题

英伟达将 AVO 描述为一个面向长期运行任务的通用智能体架构。它最初被用于 GPU kernel 优化:智能体需要检查已有实现,提出修改假设,运行测试和性能分析,再根据反馈反复调整,而不是一次性生成代码。

在英伟达的早期实验中,AVO 曾连续运行七天,探索超过 500 个优化方向,并提交 40 个 kernel 版本。英伟达称,在 DGX B200 系统上,最终的多头注意力 kernel 在部分配置中较 cuDNN 快最多 3.5%,较 FlashAttention-4 快最多 10.5%。这些结果属于英伟达自述的研究实验,重点在于展示一种可以持续迭代的执行循环。

应用到 ARC-AGI-3 时,AVO 接入了另一套环境工具,但保留了相同的长期运行思路。智能体要在没有说明、规则或明确目标的陌生环境中,通过观察行动结果逐步推断游戏机制和任务目标,并把先前获得的信息带入后续关卡。

在这一过程中,AVO 使用持久化记忆保存既有实现、评估结果和积累的推理信息;监督器则负责观察更长时间范围内的运行轨迹,在主智能体陷入停滞、重复探索或偏离方向时推动其调整策略。

这条路线与此前 微软为 Agent Framework 的 harness 加上四项扩展能力 的讨论形成呼应:技能、受控 Shell、CodeAct 和后台代理等组件,正在成为连接模型与现实工作流的基础设施。

公共测试集上的 100 分意味着什么

ARC-AGI-3 是 ARC Prize 推出的互动推理基准。与静态题目不同,它要求智能体进入陌生的、类似游戏的环境,通过连续交互学习规则、发现目标并规划行动。基准采用 Relative Human Action Efficiency(RHAE)指标,同时考虑任务是否完成以及完成任务所使用的行动次数。

ARC Prize 的介绍称,100% 分数意味着智能体完成所有游戏,并达到与首次参与测试的人类玩家相当的行动效率。公开资料显示,ARC-AGI-3 的设计目标是衡量跨多个步骤的适应、规划和经验积累,而不是单次回答是否正确。

英伟达在官方文章中称,AVO 使用文本形式接收精确的 64×64 网格观测,没有向模型发送图像或图像 token。系统完成了公共集合中的 183 个关卡,并获得 100.00 RHAE 分数。

不过,这一数字的适用范围需要严格限定。英伟达明确表示,测试只覆盖 ARC-AGI-3 公共测试集,不是半私有或完全私有的竞赛测试集;因此,不能把它直接解释为对隐藏数据的泛化证明,也不能据此得出 AVO 已在所有智能体任务上具备普遍能力的结论。

不能简单把 30% 与 100% 视为模型增益

ARC Prize 的 Claude Opus 5 结果页面显示,在官方基准配置下,Claude Opus 5 在 ARC-AGI-3 上的公共测试结果为 30.16%。这与英伟达所报告的 AVO 100.00 分形成鲜明对比。

但这两个数字并不是严格控制变量实验的两端。英伟达的 AVO 使用了不同的 Agent 后端、文本网格观测、记忆机制、上下文管理方式和执行循环。英伟达还将结果与 VISTA 配置作了比较:后者同样使用 Claude Opus 5 完成了公共集合,但报告的环境操作次数为 7,542 次,而 AVO 使用 6,624 次。

这类比较可以说明不同 harness 可能带来明显差异,却不能单独证明某一个组件贡献了多少分数。英伟达也承认,AVO 与 VISTA 在观测表示、记忆和后端实现等方面存在多项差异,因此并非严格的消融实验。

与此同时,OpenAI 在一篇关于 ARC-AGI-3 的研究文章中也得出了类似但幅度不同的结论。OpenAI 表示,在 GPT-5.6 Sol 的测试中,保留推理过程并启用上下文压缩后,公共测试集分数大约提升至原来的三倍,同时输出 token 减少约六倍。OpenAI 的解释是,如果每次行动后都丢弃此前的推理,或者随着历史增长不断截断旧上下文,模型就很难在长期任务中真正学习。

这些结果共同指向一个更谨慎的判断:基准分数衡量的往往不是“模型裸能力”,而是模型、提示词、API 设置、工具、记忆和任务运行器组成的完整系统。

从 GPU 优化到陌生环境,迁移性仍待检验

英伟达认为,GPU kernel 优化和 ARC-AGI-3 虽然表面上属于不同领域,但底层循环相似:根据不完整证据形成假设,执行外部行动,观察反馈,保存状态,修正错误并继续推进。英伟达据此主张,长期任务中的通用性可能不只来自模型掌握的领域知识,也来自让反馈和经验能够持续积累的系统机制。

这一观点对 Agent 产品开发具有现实意义。一个模型即使能在单轮交互中生成高质量答案,也未必能在数小时或数天的任务中保持目标、管理上下文、处理失败并避免重复劳动。持久记忆、监督器、工具权限、运行时隔离和回滚能力,可能决定系统能否从“会回答”变成“能完成工作”。

但 ARC-AGI-3 的公共测试集仍然是一个受控环境。它可以为长期交互能力提供有价值的观察窗口,却不能替代真实软件项目、科研流程或企业生产系统中的独立评测。尤其是 AVO 的结果主要来自英伟达自己的实验说明,外部研究者还需要在相同配置下复现,并进一步测试半私有和私有任务,才能判断这一架构的泛化程度。

英伟达表示,AVO 还曾在部分困难游戏上与 GPT-5.6 Sol 进行配对测试,初步结果显示,不同模型在完成速度和环境操作效率上可能各有优势。不过,公司没有把这些有限样本结果当作系统性模型比较,完整评估仍留待后续工作。

对当前 Agent 生态而言,AVO 最值得关注的或许不是“Claude Opus 5 从 30% 变成 100%”这一容易传播的对比,而是评测对象正在发生变化:当模型开始承担长期、多步骤任务时,真正需要被比较的可能不再只是模型排行榜,而是包括记忆、反馈、监督、工具和安全边界在内的完整 harness。

来源: NVIDIA Developer Blog:NVIDIA AVO Reaches 100% on ARC-AGI-3TechCrunch:Nvidia just showed that the harness, not the AI model, is now the real hero

相关背景:ARC-AGI-3 官方介绍ARC Prize 的 Claude Opus 5 结果页面OpenAI 关于 ARC-AGI-3 harness 设置的研究AVO 研究论文

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读