AI 快讯英伟达AVO刷满ARC-AGI-3
模型上新

英伟达AVO刷满ARC-AGI-3

2026-08-21T23:04:27.770Z
英伟达AVO刷满ARC-AGI-3

NVIDIA AVO完成ARC-AGI-3全部25个公开环境、183个关卡,成绩从前沿系统不足1%跃升至100%。但这更像一次智能体工程突破,而非通用智能已经被解决。

NVIDIA用一个编程智能体,打穿了ARC-AGI-3公开环境

NVIDIA今天宣布,通用编程智能体系统AVO在ARC-AGI-3交互式推理基准中取得100%成绩,完成全部25个公开环境、共183个关卡。按照NVIDIA披露的信息,AVO在测试中没有获得任务说明、明确规则或预先给定的目标,需要通过与环境持续交互,自行判断“这里能做什么、最终要做成什么”。

这项成绩最值得关注的地方,不是又一个基准被刷满,而是完成任务的系统并非专门训练的游戏模型。AVO原本是NVIDIA开发的通用编程智能体,具备查看和修改代码、运行命令、查阅文档以及通过执行结果验证工作的能力;NVIDIA把同一套面向长期软件任务的智能体架构,迁移到了一个强调探索、记忆和规划的抽象交互环境中。

**AVO是NVIDIA开发的一套面向长周期自主任务的通用编程智能体系统。**它与常见Coding Agent的区别,不只在于能否生成代码,而在于能否在数十分钟乃至更长时间里持续保留任务状态,根据失败反馈修改假设,并将前面获得的信息带入后续决策。

NVIDIA AVO在ARC-AGI-3交互式环境中探索、规划并完成关卡的流程示意图

NVIDIA官方称,AVO会循环执行检查、规划、实现和评估,并借助记忆、工具与运行反馈累积经验。换句话说,它不是每次看到新画面都重新“猜答案”,而是像一名接手陌生项目的工程师:先运行程序观察现象,再阅读状态、提出假设、修改操作策略,最后通过实际结果判断自己的理解是否正确。

ARC-AGI-3测的不是做题,而是主动发现规则

**ARC-AGI-3是一套通过新颖、抽象、回合制交互环境评估智能体适应效率的推理基准。**它于2026年3月公开,核心目标是考察AI能否在没有自然语言说明的情况下主动探索环境、推断目标、建立内部世界模型,并规划一系列有效动作。

ARC-AGI-3与传统大模型考试的差异,在于模型无法仅凭一次前向推理给出答案。传统基准通常提供一道题和若干选项,模型只需输出最终结果;ARC-AGI-3则更接近一款没有教程、没有任务栏、甚至不告诉玩家胜利条件的小游戏。智能体必须先尝试移动、点击或交互,再根据环境变化反推出规则。

ARC系列的演进也反映了AI评测重心的变化。ARC-AGI-1和ARC-AGI-2主要要求系统观察静态网格中的输入输出样例,再归纳像素或对象变换规则;ARC-AGI-3把问题改造成了一个连续过程,系统不仅要“看懂”,还要决定下一步应该探索哪里,以及何时停止探索并执行计划。

| 基准 | 主要形式 | 系统需要解决的问题 | 典型能力 | |---|---|---|---| | ARC-AGI-1 | 静态网格变换 | 从少量样例归纳转换规则 | 抽象、组合、模式归纳 | | ARC-AGI-2 | 更复杂的静态任务 | 处理更深层的对象关系与规则组合 | 多步推理、样本效率 | | ARC-AGI-3 | 交互式回合制环境 | 在未知目标和未知规则下探索并完成任务 | 主动探索、记忆、世界建模、长期规划 |

ARC-AGI-3之所以难,是因为无效探索本身也会降低成绩。该基准并非只看关卡有没有通关,还会把智能体的动作数量与人类基线进行比较;人类基线采用相应关卡中第二佳人类参与者的动作数,而非宽松的平均水平。

单个关卡的效率得分会对动作比率取平方。假设人类基线用10步完成任务,而AI用了100步,那么原始效率是10/100,也就是0.1;平方后只剩0.01,最终只能得到该关卡1%的效率分。后期、更复杂的关卡还会获得更高权重,因此靠无目的穷举把环境试穿,并不能获得理想总分。

从不足1%到100%,五个月的跃升需要拆开看

AVO的100%成绩与今年3月论文中的前沿模型表现形成了极大反差。ARC-AGI-3论文披露,在没有专用任务线束的条件下,当时的前沿AI系统得分不足1%,而人类可以解决全部环境;五个月后,NVIDIA宣称AVO已经完成所有25个公开环境和183个关卡。

| 对比项 | 2026年3月前沿AI基线 | 2026年8月NVIDIA AVO | |---|---:|---:| | 环境范围 | ARC-AGI-3测试环境 | 25个公开环境 | | 已披露关卡数量 | 依具体测试设置而定 | 183个 | | 对外公布成绩 | 低于1% | 100% | | 是否使用专门智能体架构 | 无专用任务线束的基线 | 使用记忆、工具、执行反馈与长期循环 | | 是否有人类可读任务说明 | 无 | 无 | | 是否为私有盲测集 | 论文包含私有评估设计 | 本次披露明确指向公开环境 |

这两个数字并不能被简单理解为同一个模型能力在五个月内提升了100倍以上。论文中的“低于1%”强调的是没有专门任务线束的前沿模型,而AVO是一整套经过工程化设计的智能体系统;两者在上下文管理、工具权限、运行时长、探索策略以及是否能够编写辅助程序方面,都可能存在明显差异。

**任务线束是连接基础模型、环境、工具、记忆和评估循环的一层智能体运行框架。**在交互式基准里,线束往往和底层模型同样重要,因为它决定系统如何读取状态、保存发现、重试失败方案,以及防止长任务在上下文切换后“失忆”。

公开环境与私有盲测环境的区别同样不能忽略。公开环境意味着开发团队可以检查接口、观察任务分布,并针对反复出现的问题调整智能体工作流;私有环境则更能检验系统面对真正未知任务时的即时适应能力。因此,AVO的结果可以证明这套架构有能力解决全部公开关卡,但还不能单独证明它已经掌握可无条件迁移到任何新环境的通用推理能力。

NVIDIA使用“100%”描述本次结果,也需要与ARC-AGI-3的效率计分机制一起理解。完成全部183个关卡代表100%的通关覆盖率,而严格的总分还涉及动作效率、关卡权重和具体评估协议;如果没有逐关卡动作轨迹、人类基线对照和官方评测日志,仅凭通关数量无法独立核验每个效率分项是否同样达到满分。

截至发稿,NVIDIA公开信息尚未完整列出AVO所用基础模型、每个环境的推理调用量、总运行时间、计算成本及失败重试次数。这些数据决定了AVO究竟是一个高效的通用智能体,还是用较高测试时计算换取稳定成功率,也决定其他团队能否公平复现此次成绩。

AVO真正解决的是“长任务越做越明白”

AVO的关键价值,是展示了智能体如何把执行历史转化为可以继续利用的任务知识。很多大模型在单轮推理中很强,但进入长周期任务后会反复尝试相同错误、忘记早期约束,或者在上下文变长后偏离最初目标;这类问题常被概括为“会做一道题,却做不完一个项目”。

记忆机制让AVO不必在每个上下文窗口里从零开始。它可以把已经确认的环境规则、失败动作、可用工具和阶段性目标保存下来,再将这些内容压缩为后续决策所需的状态。对于ARC-AGI-3,这意味着智能体在发现“某个颜色代表可移动对象”后,不需要每过几十轮就重新验证一次。

执行反馈让AVO能够用现实结果校正内部假设。纯文本模型只能判断一段推理“听起来是否合理”,而具备工具使用能力的智能体可以真正运行操作并观察环境变化;如果结果不符合预期,它就能把这次失败作为新证据,而不是继续沿着错误推理生成更长的解释。

持续规划让AVO能够把探索和完成任务分开处理。一个有效的智能体需要知道什么时候应当尝试低成本动作收集信息,什么时候已有足够证据开始执行,以及什么时候应该放弃原方案。这个过程与软件调试非常接近:先复现问题,再缩小范围,提出原因,修改代码,最后运行测试确认修复。

| 智能体组件 | 在编程任务中的作用 | 在ARC-AGI-3中的对应作用 | |---|---|---| | 环境检查 | 阅读仓库、日志和依赖 | 读取画面、对象与状态变化 | | 规划 | 拆分开发和修复步骤 | 安排探索与通关动作 | | 工具执行 | 编辑代码、运行命令 | 与环境交互、验证规则 | | 长期记忆 | 保存约束和历史结论 | 记录已发现机制与失败路径 | | 结果评估 | 执行测试并检查回归 | 判断动作是否接近目标 | | 策略修正 | 根据报错修改实现 | 根据状态变化更新世界模型 |

这也解释了为什么一个Coding Agent能在抽象游戏环境中取得突破。软件开发本身就是典型的部分可观察长任务:需求可能不完整,代码库结构未知,错误信息有限,修改还会引入新的状态变化。能够长期维护假设、调用工具并验证结果的系统,自然具备迁移到交互式推理基准的潜力。

这不是基础模型单挑,而是系统工程开始接管榜单

AVO的结果说明,前沿智能体竞争正在从“谁的基础模型更聪明”转向“谁能让模型持续有效工作”。底层模型仍然决定代码能力、视觉理解与推理上限,但上下文管理、记忆结构、工具反馈、任务恢复和预算分配,正在成为影响最终成功率的关键变量。

这种趋势会让传统模型排行榜变得更难解读。两个团队即使使用同等级别的基础模型,也可能因为一个允许长时间运行、保留结构化记忆并自动验证,另一个只进行单轮回答,而出现数十倍的任务完成率差距。对于开发者而言,只比较模型在静态问答中的准确率,已经不足以判断它能否胜任真实工程任务。

AVO暂时也不是一个已公开定价、可直接购买的独立模型产品。NVIDIA将它描述为通用编程智能体系统,而非新的基础大模型;目前公开重点是架构能力和基准成绩,不是上下文价格、每百万Token费用或标准化服务等级。因此,把它归入“模型上新”时,更准确的理解是智能体系统能力上新,而不是又多了一个可以替换现有聊天模型的模型端点。

100%很亮眼,但私有盲测才是下一道门槛

AVO目前最明确的成绩,是它已经覆盖ARC-AGI-3全部公开环境。对于一个原本面向代码工作的通用智能体来说,这足以证明其长期记忆、执行反馈和任务恢复机制并非只对软件仓库有效,也可以迁移到没有文字说明的抽象环境。

AVO目前最需要补充的证据,是在全新私有环境中的盲测结果。只有当任务规则、画面布局和目标机制都未被开发团队预先看到,且系统仍能以接近人类的动作效率完成任务,才能更有力地说明它学到的是通用探索方法,而不是一套针对公开环境打磨充分的工作流。

成本数据也将决定这项技术是否具有实际产品价值。如果AVO每个关卡需要数小时运行和大量并行采样,它依然是有意义的研究结果,却未必能直接用于日常开发;如果它能以接近人类的动作量和可控计算成本稳定完成任务,那么它对自动调试、长周期代码迁移、复杂运维以及科研自动化的影响会更直接。

NVIDIA这次真正展示的,不是AI已经理解了所有未知世界,而是一套智能体架构可以在长期执行中越做越明白。相比一次生成更长的答案,这种从环境中获取证据、保存知识、修正计划并最终完成任务的能力,更接近开发者真正需要的自主系统。

参考来源

注:本文同时依据NVIDIA于2026年8月21日发布的AVO技术说明与官方公告,以及ARC-AGI-3论文公开的评测方法、计分公式和人类基线信息进行整理。

相关推荐

查看全部