何恺明团队证明:用猫片预训练的视觉模型解 ARC 几乎追平 LLM
何恺明团队——ResNet 和 Masked Autoencoder 的作者、如今的 MIT 教授——发表了 ECCV 2026 论文:一个只用 ImageNet 普通照片(猫、狗、花草)预训练的视觉模型,解出了抽象测试 ARC 的题目,单模型拿到 63.4% pass@2,集成后 70.2%。这个模型里没有文本、没有语言,只有从真实照片迁移到抽象彩色格子上的「视觉」。这是纯视觉路线第一次逼近专门的 LLM 系统,而且只用了对方四分之一的参数量。
ARC 是什么,为什么难
ARC(Abstraction and Reasoning Corpus)是 Keras 之父 François Chollet 在 2019 年提出的。格式很统一:最大 30×30 的网格、最多 10 种颜色、2 到 5 组「输入—输出」示例。要从示例里推断出隐藏的变换规则,再应用到新格子上。听起来像儿童找规律题,但对机器来说这是最严苛的抽象思维测试之一:规则每次都不同,没有模板可背,示例只有两三个。
现在大家怎么解 ARC
主流是语言模型:把格子翻译成文本或符号序列,交给 LLM 推理。视觉路线长期落后,但最有意思的进展恰恰来自这里。同一个 MIT 团队在之前的 VARC 工作里把 ARC 重新定义成条件图生图翻译任务,把 19M 参数的模型推到 54%。之后是各种改进:带循环推理的 LoopViT——18M 参数、65.8%;用视频预训练的 Loop-OWM——10.6M、68.5%。参数量比 LLM 系统小几个数量级,成绩已经追到门口。
视觉模型缺的是预训练。语言模型能靠规模涨点,是因为在海量文本语料上预训练过;而视觉方案从随机初始化开始,一直没吃到这个红利。
NAT-ARC:用猫片做预训练
NAT-ARC 在 VARC 视觉流程前面插了一步:在 ImageNet——约 130 万张自然照片的数据集——上做 MAE 预训练。MAE(Masked Autoencoder)正是何恺明 2022 年提出的方法:把图片遮住大部分,让模型从剩下的碎片里复原原图,顺带学会形状、结构和空间关系。
一个很实用的细节:研究者直接用了公开的 MAE checkpoint,预训练一分钱没花。这个 checkpoint 是为大尺寸 ImageNet 图片设计的,而 ARC 格子只有 64×64 像素,所以他们只保留 backbone,丢掉 patch embedding 和位置编码,换成灵活的 2D RoPE。

为什么猫片能帮着解抽象题
作者把三种初始化的模型——无预训练、ImageNet MAE、ARC 风格 MAE——放在还没训练过的 ARC 题目前,观察注意力分布。随机初始化的模型注意力均匀铺开、毫无焦点;ImageNet 预训练过的模型,注意力已经自动聚焦到有意义的区域:它会把物体从背景里分出来,尽管一张 ARC 格子都没见过。
研究者挑出 15 道预训练带来明显提升的题目,手动归类。6 道属于「匹配并复制」——识别物体、颜色或图案,把结构复制到输出;另外 6 道属于连通区域推理——把网格上连通的区域分离、填充或重新着色。「把猫从草地上分出来」到了 ARC 里就变成「把连通的彩色区域从背景里分出来」——视觉世界和抽象世界共享同一套底层机制。
数字:0.6B 参数对 8B
在 ARC-1 上,NAT-ARC 最好的单模型是 huge 尺度——0.6B 参数——拿到 63.4±0.7% pass@2。三种预训练策略训出的模型集成(多数投票,总共约 2B 参数)达到 70.2±0.6%。作为参照:最好的专门 LLM 系统 The ARChitects 是 71.6%,但用的是 8B 语言模型。视觉路线用四分之一的参数量追到了它门口。
预训练修好了 scaling
第二个重要结果关于模型怎么长大。没有预训练时曲线是断的:从 base 到 large 精度还在涨,从 large 到 huge 反而掉——模型更大、结果更差,因为 ARC 数据太少,多出来的容量全进了过拟合。加上 ImageNet 预训练后曲线变健康:三个尺度都随规模一起涨。这就是视觉路线被解锁的 scaling。
作者还从反方向拿到了漂亮的证明:自编码器把 ImageNet 的普通照片映射成 60×60、10 色的离散网格——相当于「把猫翻译成 ARC 的语言」。NAT-ARC 对这个网格执行学到的变换——旋转 180°、加蓝色边框——再解码回像素。猫真的被转了,边框真的出现了。抽象规则和视觉表征住在同一个空间里。
背后是谁
一作是 MIT CSAIL 的 Xiaoman Delores Ding,来自何恺明组;上一代 VARC 也是她主导的。之后是 Keya Hu、Katelyn Gan 和 Victor Yin,同样来自 MIT。共同作者兼通讯作者是何恺明本人——从 ResNet 到 MAE,几乎能串起近十年的视觉 AI。有意思的是,这篇新工作里他把自己四年前的方法当工具用:旧武器打通了新路。
实际意味着什么
核心结论:尺寸不是一切,预训练才是决定因素。预训练做得好的紧凑模型,能追上大它四倍的系统。图像生成也是同样的逻辑:赢的不是最大的模型,而是训练得更贴合任务、跑起来更便宜的那个。根据我们服务的数据,最近 30 天(2026 年 9 月 2 日至 10 月 1 日,共 11,177 次图像生成尝试)需求最大的模型并不是最重的那个——nano-banana-2 占了 2,560 次完成生成,约占总量的 23%,平均成本约每张 0.05 美元(同期 generation_costs 表)。紧凑模型的可靠性也完全达到生产级:同月大约每 13 次尝试有 1 次没出结果——11,177 次里 829 次失败。
诚实的保留意见:ARC-1 只是一个基准,离通用的视觉推理还很远。但方向已经清楚:与其无限膨胀语言模型,不如让视觉在真实世界里学习,再迁移到抽象任务上。
常见问题
ARC 是什么?
Keras 之父 François Chollet 提出的抽象推理基准:根据彩色网格上 2–5 组「输入—输出」示例推断隐藏规则,再应用到新格子上。它被认为是 AI 最难的基准之一。
为什么偏偏是猫?
关键不在猫,而在自然图像上的预训练——ImageNet 里全是这类照片。在照片上学会把物体从背景里分出来的模型,会把这种能力迁移到抽象网格上。
可以试试图像生成吗?
可以,在 NeuralSpace 图像生成板块,那里汇集了不同档次的模型,从快速的到最高质量的。