何恺明团队用猫片攻克ARC

何恺明团队最新提出纯视觉ARC解题方案NAT-ARC:模型只用ImageNet自然图像预训练编码器,再迁移到抽象彩色网格推理任务。在ARC-1上,最佳单模型pass@2达到63.4%,集成系统达到70.2%。
何恺明团队最新论文,把猫狗照片变成了推理训练
何恺明团队最近提出了NAT-ARC,一套不依赖大语言模型、只靠视觉编码器完成ARC抽象推理任务的方案。它最引人注意的地方不是模型规模,而是训练数据:编码器没有先看海量数学题、代码或文字推理语料,而是用ImageNet中的猫、狗、花草和日常物体图像进行预训练,随后被迁移到由彩色小方格组成的抽象推理任务上。
这项工作的核心结论是:自然图像预训练学到的视觉表征,可能已经包含了一部分解决抽象规则问题所需要的结构信息。NAT-ARC在ARC-1上的最佳单模型pass@2成绩达到63.4%,集成版本达到70.2%。按照目前公开信息,这使它成为纯视觉方案中首次接近专用大语言模型系统的结果之一。

ARC到底在测什么
ARC,即Abstraction and Reasoning Corpus,是一套用于测试人工智能抽象与归纳能力的基准。它不是让模型从四个选项中挑答案,也不是让模型把自然语言问题转换成文字结论,而是给出几组输入网格和对应输出网格,要求模型推断隐藏在样例背后的变换规则,再把规则应用到一个全新的网格上。
例如,训练样例可能展示一个网格中某种颜色的像素被复制、旋转、平移,或者一个封闭形状被填充;测试样例只给出新的输入,模型必须判断哪些视觉结构是关键、哪些只是噪声,并生成尺寸和颜色都正确的输出。题目本身通常很小,网格可能只有几行几列,但规则并不会直接写出来。
ARC的难点在于,它考查的不是记忆答案,而是从极少样例中提取规则。传统图像分类任务更像是判断一张照片里有没有猫;ARC则要求模型理解猫的位置、数量、相互关系,以及这些关系在不同示例中的变化。前者可以依赖统计相关性,后者需要组合、类比和抽象。
ARC-AGI-1是ARC体系中的第一代公开基准,由François Chollet在2019年提出。ARC-AGI-1的目标,是测试模型处理未见过任务的能力,而不是单纯衡量模型在训练分布内继续扩大规模后的拟合能力。
这也是ARC长期被视为AI能力试金石的原因。一个模型即使读过大量网页、代码和数学题,也可能在一个只有十几个彩色方格的新任务前失效,因为题目要求它临时构造一个程序,而不是从数据库里检索一个相似答案。
NAT-ARC的关键思路:先学会看,再处理抽象网格
NAT-ARC是一个以自然图像预训练视觉编码器为基础的ARC解题方案。它的策略可以概括为两步:先利用ImageNet学习通用视觉表征,再把这种表征迁移到ARC的离散网格推理任务上。
ImageNet是一个大规模自然图像数据集,包含约130万张训练图像,覆盖猫狗、植物、交通工具和日常物体等类别。根据目前公开资料,NAT-ARC使用在ImageNet上训练的编码器,而不是从ARC任务本身从零开始学习全部视觉特征。
这个选择看起来反直觉,却有现实依据。ARC网格虽然没有纹理、光照和真实物体,但其中依然存在边界、重复、局部形状、对称性、相邻关系和空间层次。自然图像编码器在预训练过程中学到的边缘、区域和形状信息,可能为这些关系提供了一个比随机初始化更好的起点。
换句话说,NAT-ARC并不是把猫的识别能力直接迁移到彩色方格上,而是利用猫片训练出的底层视觉能力。模型不需要知道某个方格代表猫、花还是汽车,它需要的是识别结构变化:哪里出现了一个对象、对象是否被复制、不同颜色是否形成了边界,以及一个局部变化是否会影响整个网格。
这和大语言模型处理ARC的方式有明显区别。语言模型通常会把网格序列化为文本或符号,再通过上下文推理、程序生成或搜索来尝试解决问题;NAT-ARC则把ARC视作视觉输入,重点放在编码器如何形成空间表征。前者更接近一个会写程序的推理系统,后者更接近一个把视觉经验压缩成抽象操作的感知系统。
成绩意味着什么
NAT-ARC在ARC-1上最佳单模型达到63.4%的pass@2成绩,集成系统达到70.2%。pass@2表示系统拥有两次候选答案机会时,至少有一个答案正确,因此它和一次性单答案准确率不是同一个指标,不能简单当作模型每题一次作答的成功率。
集成结果比单模型高出6.8个百分点,这说明不同模型或不同推理路径之间仍然存在互补性。对ARC这类题目而言,一个模型可能抓住了颜色变化,却漏掉了对象数量;另一个模型可能识别出几何变换,却在边界处理上出错。集成系统可以把这些不同判断组合起来,提高最终命中率。
| 方案 | ARC-1结果 | 是否依赖大语言模型 | 主要特点 | |---|---:|---|---| | NAT-ARC最佳单模型 | 63.4% pass@2 | 否 | 使用ImageNet预训练视觉编码器,直接面向抽象网格推理 | | NAT-ARC集成系统 | 70.2% pass@2 | 否 | 融合多个模型或推理结果,利用不同解题路径的互补性 | | 传统图像分类模型 | 不适用 | 否 | 主要判断类别或视觉标签,不负责推断网格变换规则 | | 通用大语言模型ARC系统 | 需按具体系统比较 | 通常是 | 可结合文本推理、程序生成和搜索,但系统复杂度更高 |
这个成绩最值得关注的地方,不是它已经解决了ARC,而是它改变了纯视觉方法的上限判断。过去,ARC往往被看作语言模型、神经符号系统或程序搜索系统的舞台;NAT-ARC表明,一个没有文字推理链、没有显式自然语言提示的视觉系统,也可以在这类任务上取得有竞争力的结果。
但63.4%和70.2%仍然不能被解读为模型已经具备稳定的通用推理能力。ARC题目数量有限,评价指标对候选答案数量敏感,而且集成系统通常需要更高的计算成本。它展示的是一种有效的研究路线,不是对所有新任务都可靠的智能证明。
为什么ImageNet预训练仍然有价值
ImageNet预训练的价值在于,它为模型提供了比随机初始化更稳定的视觉先验。即使ARC网格非常抽象,模型仍然需要区分局部区域、识别重复模式、追踪对象位置,并判断颜色和形状之间的关系,这些能力与自然图像中的低层和中层视觉表征存在重叠。
这也说明,预训练数据和下游任务之间不需要表面上完全相似。猫狗照片不会直接教会模型如何把一个红色方块移动到网格右侧,但它们可能帮助模型形成关于边缘、区域和空间组合的基础表示。真正被迁移的不是语义标签,而是视觉结构。
这种思路与自监督学习的基本直觉相近。自监督学习是利用数据本身构造训练信号,让模型在没有人工标签的情况下学习输入结构。相关资料将NAT-ARC与MAE式预训练联系起来;MAE,即Masked Autoencoder,是一种通过遮挡图像部分区域、再要求模型恢复被遮挡内容来学习视觉表示的方法。
如果模型在预训练阶段必须根据可见区域推断缺失部分,它就会被迫学习物体的整体形状、局部之间的联系和空间上下文。迁移到ARC后,这些表示或许能够帮助模型处理网格中的对象补全、重复和变换问题。
不过,这条路线也存在明显限制。ImageNet主要提供自然图像分布,而ARC刻意构造了远离自然视觉经验的抽象任务。模型从自然图像中得到的先验可能帮助它识别结构,也可能让它过度依赖连续纹理、物体边界等自然图像特征。NAT-ARC能取得较好结果,说明前者至少在一部分ARC任务上占了上风,但这并不代表自然图像预训练能够覆盖所有抽象规则。
和大语言模型相比,NAT-ARC好在哪里
NAT-ARC最大的优势是系统更专注。它不需要把网格翻译成自然语言,也不需要依赖上下文窗口、提示词设计或外部程序执行器。对于输入尺寸固定、规则主要体现在空间关系上的任务,纯视觉模型可能减少了中间表示转换带来的误差。
第二个优势是计算路径更短。大语言模型解决ARC时,通常需要完成网格编码、规则描述、推理或代码生成,再把结果转换回网格;纯视觉方案可以直接从网格特征出发预测输出。路径变短不等于一定更强,但有机会降低系统延迟和工程复杂度。
第三个优势是它提供了不同于规模扩张的研究方向。当前AI行业大量依赖更大的模型、更多的训练数据和更长的上下文,而NAT-ARC尝试回答另一个问题:如果保留较小的视觉模型,重新设计预训练方式和迁移方法,能否获得更强的抽象能力。这个问题对边缘设备、机器人和低延迟视觉系统都具有现实意义。
但NAT-ARC的短板同样清楚。纯视觉模型通常不擅长表达自己发现的规则,也不容易像程序搜索系统那样明确验证每一步变换。当题目需要多个离散操作串联,或者需要区分非常接近的符号关系时,模型可能出现看似合理但无法解释的错误。
大语言模型则更适合处理显式规则、自然语言描述和代码化推理。它可以把一个网格任务转写成程序,执行旋转、复制、计数和筛选,再检查输出是否满足样例约束。代价是系统更复杂,错误可能发生在编码、推理、执行和解码的任一环节。
| 对比维度 | NAT-ARC纯视觉方案 | 大语言模型ARC方案 | |---|---|---| | 输入处理 | 直接处理彩色网格视觉表征 | 常需将网格转为文本、符号或代码 | | 推理方式 | 视觉特征匹配与空间关系建模 | 语言推理、程序生成、搜索或工具调用 | | 规则可解释性 | 相对较弱 | 通常更容易输出规则描述或程序 | | 系统复杂度 | 较低,模块更集中 | 较高,可能包含编码器、提示词和执行器 | | 适合场景 | 空间变换、局部结构和视觉模式 | 多步规则、符号操作和可验证程序推理 | | 主要风险 | 对分布外抽象规则泛化不足 | 表述和执行链条较长,可能产生编码错误 |
因此,NAT-ARC并不是在所有维度上替代大语言模型。更准确的判断是:它证明了视觉表征本身仍然有潜力,ARC不应该被默认等同于语言推理问题。
对开发者的启发
NAT-ARC给开发者的第一个启发是,预训练数据不应只按任务表面相似度选择。一个用于抽象推理的模型,不一定要先读大量抽象推理题;更重要的是判断预训练阶段是否学到了可迁移的结构表示。
第二个启发是,评估模型时必须区分单模型能力和系统级能力。63.4%的最佳单模型结果与70.2%的集成结果说明,模型本身和推理系统之间存在差异。开发者在比较不同方法时,应该同时报告候选数量、集成规模、搜索预算和计算成本,否则单个百分比很容易掩盖真实差异。
第三个启发是,视觉模型与语言模型不必二选一。NAT-ARC证明纯视觉路线有竞争力,但更有前景的方向可能是视觉编码器负责发现对象和空间结构,程序模块负责执行离散变换,语言模型负责解释规则或进行高层搜索。这样的组合能够把感知、推理和验证拆开,减少单一模型承担全部工作的压力。
对于机器人和智能体系统,这种分工尤其重要。机器人面对的不是一张需要分类的图片,而是一个需要理解变化、预测结果并采取行动的空间环境。一个能从少量示例中识别结构变化的视觉模块,可能比单纯提高物体识别准确率更接近真实任务需求。
还需要警惕什么
ARC分数不能直接等同于现实世界通用智能。ARC是高度人工设计的基准,它有明确的输入格式、有限的颜色集合和离散网格规则。模型在ARC上变强,说明它在这类抽象任务上的能力提高了,但不能据此推断它已经能可靠处理开放世界中的因果推理、长期规划或物理常识。
NAT-ARC的具体训练细节和完整实验范围仍需要等待论文、代码和更完整的基准结果来确认。目前公开信息主要集中在ImageNet预训练、纯视觉路线以及ARC-1成绩,关于模型参数规模、训练成本、不同预训练策略的消融实验,以及在更困难数据集上的泛化情况,仍不宜过度推断。
另一个问题是数据泄漏和任务污染。ARC题目规模相对有限,随着基准越来越知名,公开数据被重复研究和间接记忆的可能性会上升。未来更有说服力的评估,需要引入隐藏测试集、全新任务生成方式和更严格的训练数据审计,确保模型学到的是抽象规则,而不是熟悉题型。
OpenAI Hub判断
NAT-ARC最重要的贡献,不是把ARC-1的数字推到了70.2%,而是把一个被广泛当作语言推理难题的基准重新放回视觉研究语境中。它说明,模型能否完成抽象推理,未必只取决于是否拥有语言、参数规模和更长上下文,也取决于它如何组织空间结构和视觉经验。
从实用角度看,NAT-ARC暂时还不是一个可以直接替代通用推理模型的产品。它更像一项有明确研究价值的路线验证:自然图像预训练得到的视觉编码器,经过适当迁移后,确实能够处理一部分远离自然图像分布的抽象网格任务。
如果后续实验能证明这种能力可以稳定迁移到ARC-AGI-2、全新生成任务以及机器人视觉场景,意义会比单次基准成绩更大。那将意味着,视觉预训练不仅帮助模型识别世界,也可能帮助模型发现世界中更一般的结构规则。
截至2026年10月2日,NAT-ARC值得关注,但更适合被看作纯视觉抽象推理的一次重要进展,而不是ARC问题已经被攻克。真正的分水岭将是:模型能否在未见过的规则、不同网格规模和更高组合复杂度下,保持稳定、可解释并且低成本的推理能力。
参考来源
- 知乎:何恺明团队新作:看猫片就能学会ARC挑战 —— 汇总NAT-ARC方案与公开成绩,包括63.4%的最佳单模型pass@2和70.2%的集成结果。
- ARC-AGI GitHub仓库 —— ARC-AGI相关任务、代码与研究资料入口。
- GitHub搜索:ARC相关公开实现 —— 用于查阅ARC基准的开源复现、评测工具和社区实现。



