跳到主内容
开元娱乐平台

Claude满分、GPT 99分,何恺明团队把AGI考试打穿了

2026-10-04 · 潘一鸣

何恺明团队的最新研究成果,在X平台上引发了轰动!

国庆假期期间上传至arXiv的VISTA论文揭示,过去半年里,全球最顶尖的大模型在参加AGI测试时,都像是被蒙上了双眼。

同一个Claude Opus 5模型,在官方标准测试中仅获得可怜的40分。

何恺明团队只是为它揭开了眼罩,让它直接观察游戏画面,并递上一本可以随时回溯的“相册”。

结果,Claude直接攻克了ARC-AGI-3的全部25个公开游戏,取得了100分的满分成绩!

而且,它所走的步数,甚至比初次游玩的人类玩家还要少一半以上。

18个从未见过的游戏,没有任何文字说明,AI自行摸索规则并一路通关

知名AI博主Mark Kretschmann在X上评论道:“赋予Agent‘再看一眼’的能力,带来的差异可能非常巨大。”

过去几个月,为了攻克ARC-AGI-3,众多编程高手编写了数千行代码来构建世界模拟器。

何恺明团队的判断是,大模型的认知能力已经足够,限制它的,是视觉和记忆能力。

大模型被一张数字表格,耽误了半年

ARC-AGI-3,是由Keras之父François Chollet与ARC Prize基金会在今年3月推出的AGI测试。它包含一系列交互式像素小游戏,开局没有任何说明或规则,完全依赖玩家自行探索和试错。

评分机制极为严格。官方招募了近500名人类新手进行实测,AI不仅要通关,其步数还不能超过人类,才能获得满分。

然而,官方测试平台提供给大模型的,仅仅是一张64×64的数字表格。人类眼中看到的小人、机关和路线,到了模型那里就只剩下4096个数字。

这相当于让人闭着眼睛,仅凭他人报坐标来玩《超级马里奥》。

同一帧画面,左侧是官方提供给模型的数字表格,右侧是VISTA让其直接看到的图像

VISTA团队做的第一件事,就是将数字表格替换回图像。

除此之外未做任何改动,GPT-5.6 Sol的分数就从13.33分跃升至47.32分。

直接看图还更节省算力。一个数字格子大约消耗4000个Token,而一张512×512的图片仅需308个Token。

完成一局游戏,文本版本消耗了7190万个Token,而图像版本仅需3070万个,并且分数更高。

仅仅是换上一双真正的“眼睛”,大模型就提升了34分。

仅将数字替换为图片,GPT-5.6 Sol的分数就提高了三倍多,能通关的游戏也从1个增加到9个

让AI过目不忘,一步多拿24分

仅仅能看见还不够。一局游戏动辄数百步,多模态模型的通病是:图像看一遍后,一旦上下文窗口满了就会被删除,或者被压缩成几句文字摘要。

当模型想要回头核对细节时,那一帧画面早已消失。

VISTA的核心杀招,就是一本无损视觉记忆的“相册”。

游戏输出的每一帧画面,包括动画帧在内,全部按编号原样保存。模型想看哪一帧,随时可以调用inspect工具翻出来,还能进行多帧并排对比、角落放大,甚至用read_pixels读取精确颜色。

最关键的是,翻阅相册不计入步数,只有在游戏中实际操作才会计步。

团队将这套机制称为“显式注意力”,翻看哪一帧、观察哪一块,完全由模型自行决定。

它还随身携带两个笔记本:GUIDE.md用于记录游戏规则,WORKING.md则作为草稿纸。

VISTA的一个回合中,模型先观察画面、思考规则,需要时翻阅相册,最后才执行一步操作

论文中记录了一个极其“像人”的操作瞬间。

在BP35游戏的第三关,画面中出现了一个橙色方块。模型点击了一下,橙色方块变成了X。

它先停了下来,调出上一回合的最后一帧和刚才的三帧动画,进行并排回放。

几个回合后,它又发现点击X能让橙色方块重新出现,当场写道:“这就是我要的工具,用它来搭建天花板,阻挡会致命的上升。”

这一关,初次游玩的人类需要走44步,而它仅用了34步。

点击橙色方块后,模型先将前后4帧动画调出逐帧比对,理解后才继续行动

在《吃豆人》游戏中,迷宫里的豆子吃一颗少一颗。模型在第13回合和第36回合,两次主动回溯到游戏的第一帧,记忆迷宫地图以寻找路径。

给模型增加上下文、提供更多像素,是很多人的第一反应。但论文测试表明,这两种方法都无效。

将上下文从默认的200K扩展到780K,每局游戏消耗的Token从3070万增加到1.057亿,但成绩却从99分下降到93.9分。

图像也是如此。放大到16倍后,每帧Token增至1229个,成绩仅剩88.3分;而仅放大4倍时,成绩是99.7分,比默认的8倍还要高。

论文的解释是,图像过大,多出来的Token白白占用了上下文,但模型并未因此看得更明白。

上下文从200K拉到780K、图像从8倍放到16倍,分数都不升反降

“多给不一定更好”是VISTA整套设计遵循的思路。团队在博客中表示,他们刻意追求极简。

系统中没有一个新训练的模型,每个游戏的提示词都是同一份,一共四句话,没有一句教它具体怎么玩。

VISTA提供给模型的全部提示词

代码派忙了一整个夏天,它一页笔记就追平

这个夏天,在ARC-AGI-3上取得高分的主流方案,如Tycho和Schema,都是让大模型为每个游戏编写一套可运行的程序,硬生生构建一个模拟器来反复试错。

仅跳棋游戏LF52这一个,Schema就编写了整整4000行Python代码。

而VISTA中的模型,仅用自然语言在笔记里写下了三句话,就搞定了同样的规则。

同一条跳棋规则,左侧是程序路线的代码(总共约4000行),右侧是VISTA模型自己记录的三句笔记

按论文的说法,VISTA是第一个不依赖编写程序,就能在ARC-AGI-3上取得满分或接近满分成绩的系统。

这一点放到游戏之外更为重要。在真实世界里,没有人能提前为你写好一套4000行的模拟器。

Claude Opus 5打通了25个游戏的全部183关,每个游戏都是100分,总共走了7302步,仅为人类步数的0.43倍。

GPT-5.6 Sol同样全部通关,获得99分。

在m0r0这个游戏中,人类需要走1107步,而Claude仅用了219步。这两份成绩在ARC Prize官方平台上都有记分卡。

ARC Prize官方平台上的记分卡,显示183关全部通关,25个游戏全是满分

25个游戏逐一比较,蓝色条(Claude)全部比灰色条(初次游玩的人类)短

这套纯机械、零训练的Harness系统泛化能力极强。

将其应用于带有透视效果的3D画面中,同样获得了84.12分。

套上GPT-5.6 Sol后,投入34个网页游戏(包括马里奥、2048、我的世界等),任务成功率达到63.3%,直接超过了人类新手(55.3%)。

即使是静态的看图题也能应用。在BabyVision的一道连线题中,不使用VISTA时,模型将驼鹿和兔子连反了;而使用VISTA放大观察后,就答对了。

即便是官方实现几乎交了白卷(1.89分)的320B开源模型,套上VISTA后,分数被硬生生提升到了66.93分,暴涨了35倍!

一年三篇,何恺明团队死磕视觉

ARC测试的主流解法,一直由大语言模型的文本推理所主导。

但何恺明团队偏偏不信邪,一年内连续发表三篇论文,死磕同一件事:ARC是视觉问题。

第一篇VARC,一个1800万参数的小型视觉模型从零开始训练,仅凭看图就追平了人类平均分。

第二篇NAT-ARC,先让模型在ImageNet数据集上观察猫狗图像进行“补课”,其抽象推理能力也随之增强。

第三篇就是VISTA,连小模型都不训练了,直接给前沿大模型配上“相册”。

何恺明团队一年三篇ARC论文,都押注在“ARC是视觉问题”这一观点上

贯穿这三篇论文的,是何恺明的博士生胡珂雅,本科毕业于上海交大ACM班,三篇论文中她担任了两篇的一作和一篇的二作。

VISTA另外两位共同一作是MIT博士生Qiushi Han和Linlu Qiu,MIT副教授Cathy Wu也在作者名单中。

曾经凭借ResNet和MAE封神的何恺明,这一次将视觉路线一路推进了AGI考场。

这也挑战了整个行业的默认路线。

过去几年,大家拼命把模型做大、把推理过程拉长,智能的进步几乎都押注在模型本身。

VISTA让同一个Claude从40分打到满分,依靠的却是模型外部的一双“眼睛”和一本“相册”。

ARC Prize联合创始人Mike Knoop也判断,越来越多的“学习”将会发生在模型权重之外。

通往AGI的下一程,比拼的是谁能帮助模型看清世界、记住世界。

何恺明团队的下一站,是充满真实画面的具身环境,在那里,没有人会提前将世界翻译成一张数字表格。

参考资料:

https://x.com/mark_k/status/2106377357078450620

本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。

更多文章