⚡ 前沿动态

NVIDIA通用编程Agent系统AVO在ARC-AGI-3取得100%满分

🕐 2026.08.22 星期六 来源 · 媒体 🔥 3 次点击

NVIDIA官方发布技术公告,其自研通用编程Agent系统AVO在ARC-AGI-3基准测试中完成全部25个公开环境下的183个关卡挑战,Relative Human Action Efficiency(RHAE)指标取得100.00满分,大幅刷新此前由Claude Opus 5创下的30.2%得分纪录。

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是目前最具挑战性的通用智能基准测试之一,旨在评估AI系统的抽象推理和模式识别能力。

ARC-AGI-3是其最新版本,包含25个环境、183个关卡,对现有AI系统构成极大挑战。ARC-AGI-3由研究员François Chollet创立的ARC Prize Foundation开发,专门针对大模型基准注水问题设计。它摒弃了传统基准中模型可能在训练阶段见过变体的静态谜题模式,转而将Agent投入无任何指令、无任何提示的类游戏交互式环境中,强制Agent通过自主探索理解规则、完成挑战,从机制上避免了常规的刷分行为。此前Claude Opus 5在该基准上30.2%的得分,已经达到GPT-5.6 Sol此前最佳成绩的4倍左右。

一、核心技术路径

NVIDIA并未重新训练全新基础大模型,而是采用成熟的Agent架构封装方案,将Claude Opus 5作为底层模型嵌入自研的AVO系统中。该系统最初面向GPU工程工具场景开发,在不改动核心Agent架构的前提下,仅将GPU工程工具接口替换为ARC-AGI-3任务交互界面,就实现了代码自检、自我纠错逻辑向完全无关的视觉交互式逻辑谜题场景的无缝迁移。

整套系统全程没有针对ARC-AGI-3做任何专项微调,也没有提前输入任务相关的前置说明与目标提示,完全依靠Agent自主探索完成全部挑战,总执行动作数仅为6624次,相比VISTA等主流Agent封装框架所需的7542次动作,执行效率提升约12%。

二、方法和过程

NVIDIA AVO(Agent for Visual Operations)系统的关键突破在于Harness工程:

  1. 视觉推理循环:Agent通过观察视觉输入、抽象模式、生成假设、验证预测的循环解决问题
  2. 工具调用编排:动态选择和组合多种视觉操作工具
  3. 上下文管理:高效的推理痕迹保留和上下文压缩

三、研究结果

  • ARC-AGI-3公开测试集:全部25个环境、183个关卡取得100%满分
  • 关键发现:TechCrunch评论"NVIDIA证明了Harness(运行框架)而非AI模型本身才是真正的英雄"
  • 行业意义:与OpenAI开源Codex Harness、DeepSeek Harness周更等动态相呼应,行业共识形成——Agent核心竞争力已从底层模型能力转移到运行时架构

四、横向对比

系统 ARC-AGI-3成绩 核心特点
NVIDIA AVO 100% Harness工程驱动,视觉操作Agent
OpenAI GPT-5.6 Sol + Harness 38.3%(之前13.3%) 保留推理+上下文压缩
人类基准 ~85% 抽象推理能力
传统LLM <20% 纯文本推理,缺乏视觉抽象

五、启示

NVIDIA首席工程师Terry Chen带领的官方博客团队在公告中明确指出:这一结果清晰证明,模型能力评估与Agent系统评估是完全不同的两件事。基础模型的上限固然重要,但外围Agent架构的设计质量,才是决定模型能力能否转化为持续自主任务推进的核心变量。此前行业普遍将注意力集中在基础模型参数与跑分的比拼上,AVO的满分结果直接将行业竞争焦点,从“基础模型性能”转向“Agent系统工程能力”。

附:AVO系统的技术实现

1. 系统核心定位

AVO全称为‌Agentic Variation Operators‌,是NVIDIA自研的面向自主软件工程、GPU内核优化场景的智能体系统,最初用于CUDA GPU内核的自动化迭代优化,后续通过架构迁移直接在ARC-AGI-3基准测试中取得满分,全程未针对该基准做任何专项微调。

2. 两大核心底层设计

  • 持久化记忆模块‌:完整留存智能体所有历史尝试与对应结果,避免重复执行相同的无效探索动作,大幅提升长周期任务的探索效率。
  • 监督层调度机制‌:独立于主智能体的监控模块,全程跟踪任务推进轨迹,当主智能体陷入探索停滞、重复无效操作时,自动介入调整探索方向,打破局部最优陷阱。

3.核心技术能力表现

  • 在DGX B200系统上的注意力内核优化任务中,AVO连续运行7天,尝试超过500个优化方向,最终生成的内核性能比FlashAttention-4最高提升10.5%。
  • 迁移到ARC-AGI-3任务场景时,仅将环境以纯文本64×64网格的形式输入模型,全程无图像输入,最终用6624个动作完成全部183个谜题,相比VISTA等主流Agent封装框架效率提升12%。

4. 架构迁移的关键逻辑

  • NVIDIA完全保留AVO的核心Agent架构,仅将底层GPU工程工具接口替换为ARC-AGI-3任务交互界面,就实现了代码自检、自我纠错逻辑向完全无关的视觉交互式逻辑谜题场景的无缝迁移,证明该架构具备极强的跨场景泛化能力。
  • 目前ARC-AGI-3官方评估平台暂不支持第三方自定义Agent框架接入测试,相关性能数据均来自NVIDIA官方公开的测试结果。
声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. NVIDIA
  2. 网易
  3. CSDN
  4. Techmeme
  5. Smartotics
← 返回 [前沿动态]