星光澄海 | BLOG

何恺明团队新作:用猫片攻克ARC挑战的门道

ARC挑战要求模型根据少量示例推理抽象规则,此前最优模型在该任务上的准确率刚过40%,是公认的硬瓶颈。何恺明团队这次的新成果,靠给AI喂大量猫、狗的日常图片,就把准确率拉到了60%以上——这个反差足够让AI圈的人停下来看看。

ARC的死胡同:刷题式训练的困境

ARC的公开数据集规模极小,只有几千个样本,规则又足够抽象。之前大家的思路是“死磕这个数据集”:给模型喂尽所有ARC示例,训到过拟合再测准确率。但这种方法的极限就是40%,因为每个抽象规则的分布太零散,小数据集里根本学不全。就像让学生只做100道抽象题,不管刷多少遍,也摸不到通用推理的门道。

猫片的作用:补上感知到抽象的缺口

何恺明团队没在ARC数据集上死磕,换了个思路:让AI先从日常图片里提炼通用感知规律。他们用了海量无标注的自然图片——包括猫、狗、风景这些常见内容,让AI自己学“物体是什么、形状怎么变、位置关系怎么保持”。这就像人从小看世界,不是只做课本题,而是先建立对具体事物的感知,再理解抽象概念。当AI学会这种“从具体到抽象”的通用映射,再迁移到ARC任务,就能更快抓住规则核心,不会被小数据集的特定样本带偏。

对行业的实际影响:别只盯着基准题

这个成果最直接的意义,是打破了“必须在任务数据集上训模型”的惯性。之前很多AI研究者做任务,第一反应是找该任务的公开数据集刷榜。现在何恺明的方法说明,自然世界里的海量无标注数据,是通用感知能力的金矿。这意味着,OpenAI、DeepMind这类通用AI团队,可能会调整预训练方向,不再只依赖文本或代码数据,加入更多日常视觉数据;做抽象推理、逻辑任务的团队,不用在小数据集里卷准确率,能用自然图片做中间桥梁提升泛化性;甚至普通AI公司,都能从猫片、手机相册里找到提升模型的素材,不用只盯着竞赛数据集。

ARC准确率到60%还远不到实用的程度,但这个方向的突破,足够让行业想一个问题:当AI靠日常图片就能搞定抽象推理,我们还要花那么多精力在特定任务的标注和刷题式训练上吗?


素材来源:量子位 · AI情报、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown