何恺明团队NAT-ARC:看猫狗照片学会抽象推理,纯视觉方案逼近LLM

AI大模型5小时前发布 iowen
1 0 0

何恺明团队最新论文提出了 NAT-ARC,一套不依赖大语言模型的纯视觉 ARC 解题方案。它的预训练素材不是 ARC 格子,而是 ImageNet 上的猫狗花草等自然图像——模型先学会「看」,再把视觉能力迁移到完全抽象的彩色格子推理上。表现最好的单模型在 ARC-1 上取得 63.4% 的 pass@2 分数,集成后达到 70.2%,是纯视觉方案首次逼近专用 LLM 系统的水平。

ARC 全称 Abstraction and Reasoning Corpus,由 Keras 之父 François Chollet 在 2019 年提出,被公认为最难的 AI 视觉智力测验之一:给出几组彩色格子的输入输出示例,要求推断隐藏的变换规则并应用到新格子上。过去的主流解法几乎都是把格子翻译成文字或符号序列交给 LLM,而视觉路线此前缺少预训练带来的红利。

从题目结构看,ARC 每道题是一块最大 30×30 的二维格子,最多 10 种颜色,只给 2 到 5 组输入输出示例,每道题的变化规则都不一样,没有固定模板可背,数据量又极少,精确归纳并执行规则的难度很高。NAT-ARC 的流程分三步:先用 MAE 在 ImageNet 上预训练 encoder,再在 ARC 训练集上离线训练整个编解码器,测试时对每道题单独做 LoRA 微调。

零成本复用预训练权重

NAT-ARC 的做法是在 VARC 视觉流程前插入 ImageNet MAE 预训练。MAE 是何恺明 2022 年在 FAIR 时期提出的自监督方法,通过遮住图片大部分区域让模型复原原图,从而理解物体的形状、结构和空间关系。团队直接采用 MAE 的公开 checkpoint,没有额外花一分钱预训练,只保留 backbone 权重并换用 2D RoPE 位置编码,以适配只有 64×64 像素的 ARC 格子。

此前 VARC 用 19M 参数模型跑到 54%,LoopViT 和 Loop-OWM 分别以 18M、10.6M 参数达到 65.8% 和 68.5%,参数量比 LLM 方案小了几个数量级。对行业而言,这类研究的启示在于:把大规模预训练的通用能力迁移到垂直任务上,未必需要堆参数,小模型加好方法同样能打。

本文基于 量子位 公开报道改写,版权归原作者所有,如有侵权请联系删除。
© 版权声明

相关文章