NVIDIA通用编程Agent系统AVO在ARC-AGI-3取得100%满分
NVIDIA官方发布技术公告,其自研通用编程Agent系统AVO在ARC-AGI-3基准测试中完成全部25个公开环境下的183个关卡挑战,Relative Human Action Efficiency(RHAE)指标取得100.00满分,大幅刷新此前由Claude Opus 5创下的30.2%得分纪录。
ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是目前最具挑战性的通用智能基准测试之一,旨在评估AI系统的抽象推理和模式识别能力。
ARC-AGI-3是其最新版本,包含25个环境、183个关卡,对现有AI系统构成极大挑战。ARC-AGI-3由研究员François Chollet创立的ARC Prize Foundation开发,专门针对大模型基准注水问题设计。它摒弃了传统基准中模型可能在训练阶段见过变体的静态谜题模式,转而将Agent投入无任何指令、无任何提示的类游戏交互式环境中,强制Agent通过自主探索理解规则、完成挑战,从机制上避免了常规的刷分行为。此前Claude Opus 5在该基准上30.2%的得分,已经达到GPT-5.6 Sol此前最佳成绩的4倍左右。
一、核心技术路径
NVIDIA并未重新训练全新基础大模型,而是采用成熟的Agent架构封装方案,将Claude Opus 5作为底层模型嵌入自研的AVO系统中。该系统最初面向GPU工程工具场景开发,在不改动核心Agent架构的前提下,仅将GPU工程工具接口替换为ARC-AGI-3任务交互界面,就实现了代码自检、自我纠错逻辑向完全无关的视觉交互式逻辑谜题场景的无缝迁移。
整套系统全程没有针对ARC-AGI-3做任何专项微调,也没有提前输入任务相关的前置说明与目标提示,完全依靠Agent自主探索完成全部挑战,总执行动作数仅为6624次,相比VISTA等主流Agent封装框架所需的7542次动作,执行效率提升约12%。
二、方法和过程
NVIDIA AVO(Agent for Visual Operations)系统的关键突破在于Harness工程:
- 视觉推理循环:Agent通过观察视觉输入、抽象模式、生成假设、验证预测的循环解决问题
- 工具调用编排:动态选择和组合多种视觉操作工具
- 上下文管理:高效的推理痕迹保留和上下文压缩
三、研究结果
- ARC-AGI-3公开测试集:全部25个环境、183个关卡取得100%满分
- 关键发现:TechCrunch评论"NVIDIA证明了Harness(运行框架)而非AI模型本身才是真正的英雄"
- 行业意义:与OpenAI开源Codex Harness、DeepSeek Harness周更等动态相呼应,行业共识形成——Agent核心竞争力已从底层模型能力转移到运行时架构
四、横向对比
| 系统 | ARC-AGI-3成绩 | 核心特点 |
|---|---|---|
| NVIDIA AVO | 100% | Harness工程驱动,视觉操作Agent |
| OpenAI GPT-5.6 Sol + Harness | 38.3%(之前13.3%) | 保留推理+上下文压缩 |
| 人类基准 | ~85% | 抽象推理能力 |
| 传统LLM | <20% | 纯文本推理,缺乏视觉抽象 |
五、启示
NVIDIA首席工程师Terry Chen带领的官方博客团队在公告中明确指出:这一结果清晰证明,模型能力评估与Agent系统评估是完全不同的两件事。基础模型的上限固然重要,但外围Agent架构的设计质量,才是决定模型能力能否转化为持续自主任务推进的核心变量。此前行业普遍将注意力集中在基础模型参数与跑分的比拼上,AVO的满分结果直接将行业竞争焦点,从“基础模型性能”转向“Agent系统工程能力”。
附:AVO系统的技术实现
1. 系统核心定位
AVO全称为Agentic Variation Operators,是NVIDIA自研的面向自主软件工程、GPU内核优化场景的智能体系统,最初用于CUDA GPU内核的自动化迭代优化,后续通过架构迁移直接在ARC-AGI-3基准测试中取得满分,全程未针对该基准做任何专项微调。
2. 两大核心底层设计
- 持久化记忆模块:完整留存智能体所有历史尝试与对应结果,避免重复执行相同的无效探索动作,大幅提升长周期任务的探索效率。
- 监督层调度机制:独立于主智能体的监控模块,全程跟踪任务推进轨迹,当主智能体陷入探索停滞、重复无效操作时,自动介入调整探索方向,打破局部最优陷阱。
3.核心技术能力表现
- 在DGX B200系统上的注意力内核优化任务中,AVO连续运行7天,尝试超过500个优化方向,最终生成的内核性能比FlashAttention-4最高提升10.5%。
- 迁移到ARC-AGI-3任务场景时,仅将环境以纯文本64×64网格的形式输入模型,全程无图像输入,最终用6624个动作完成全部183个谜题,相比VISTA等主流Agent封装框架效率提升12%。
4. 架构迁移的关键逻辑
- NVIDIA完全保留AVO的核心Agent架构,仅将底层GPU工程工具接口替换为ARC-AGI-3任务交互界面,就实现了代码自检、自我纠错逻辑向完全无关的视觉交互式逻辑谜题场景的无缝迁移,证明该架构具备极强的跨场景泛化能力。
- 目前ARC-AGI-3官方评估平台暂不支持第三方自定义Agent框架接入测试,相关性能数据均来自NVIDIA官方公开的测试结果。
- NVIDIA
- 网易
- CSDN
- Techmeme
- Smartotics