AI推理能力只有人类的百分之零点三七? 两周前,一个新的测试悄悄上线了。 它没有登上任何头条新闻,但硅谷的核心圈子里,很多人失眠了。 因为这个测试的结果显示,当今世界上最强大的AI,面对全新环境的推理能力只有人类的百分之零点三七。 不是百分之三十七,是零点三七。 哈喽,大家好,我是王利杰。 今天我要跟你聊的这个测试叫ARC-AGI-3,是2026年3月25号刚刚发布的。 如果你跟踪AI领域的新闻,你一定知道过去两年AI刷榜的速度有多疯狂——今天一个模型在某个排行榜上登顶,明天另一个模型就把它挤下来。 每隔几周就有人宣布AI又在某个考试上超越了人类。 在这种一片凯歌的氛围下,突然冒出来一个测试说AI只有人类的百分之零点三七,听起来几乎像个笑话。 但它不是。 它可能是近几年来AI领域最重要的一次"照镜子"。 这个测试的创造者叫弗朗索瓦·肖莱,一个法国裔AI研究者。 他曾在谷歌工作了九年多,2024年底离开谷歌去创业了。 他不是什么圈外人,恰恰相反。 他是深度学习框架Keras的作者,这个框架被全世界成千上万的AI工程师用来搭建神经网络。 换句话说,他是造AI工具的人。 但正是这么一个"圈内人",在2019年发表了一篇论文,标题翻译过来就是《论智能的度量》。 这篇论文的核心观点可以用一句话概括:我们一直在用错误的方式衡量AI的智能。 这句话是什么意思呢? 你想想看,过去几年我们看到的那些AI成绩单——什么考试得了多少分,什么排行榜排名第几——这些测试测的是什么? 是AI能不能回答一个已知类型的问题。 比如做数学题、写代码、回答常识问题。 AI确实在这些事情上越来越强,有些甚至已经超过了人类。 但肖莱说,这根本不是智能,这是背书。 他做了一个区分,借用了心理学里一个经典概念:流体智能和晶体智能。 晶体智能是你积累的知识和技能,比如你会说英语,你记得勾股定理,你知道北京是中国的首都。 这些东西你学过、记住了、可以随时调用。 流体智能完全不同,它是你面对一个从未见过的、完全陌生的新问题时,能不能当场想出解决办法的能力。 举个最简单的例子。 假设你被空投到一个完全陌生的城市。 语言不通,手机没信号,地图也没有。 你能不能找到回旅馆的路? 你会怎么做? 你可能会先观察周围的地标,然后选一个方向走走看,走错了就根据新的线索调整方向。 整个过程你用到的不是任何预先存储的知识,而是一种即时感知、试探、反馈、调整的能力。 这就是流体智能。 每个正常人都有,而且效率极高。 肖莱的核心论点是:当今的AI,几乎全部的惊人表现都来自晶体智能。 它们拥有人类历史上所有公开文本作为训练数据,它们的"知识储备"早就超越了任何人类个体。 你问它任何已知的问题,它都能给你一个像模像样的答案。 但这不是智能,这是记忆力加模式匹配。 真正的智能是什么? 是你面对一个前所未有的情境时,学习和适应的效率。 不是你知道多少,而是你在不知道的时候,能多快地搞明白。 为了证明这一点,他设计了ARC-AGI这个测试。 最初的第一版叫ARC-AGI-1,是一系列抽象的图案变换题。 给你几组输入输出的图案示例,让你推断出背后的规则,然后把这个规则应用到一个新的输入上。 比如,你看到三组例子,每组都是一个蓝色方块移动到了某个位置,你需要找出移动的规律,然后预测下一个方块会移到哪里。 题目都不难,普通人看一眼就能想明白。 但关键是每道题的规则都是独一无二的,你不可能提前背答案。 它考的就是你能不能"现场悟"。 结果很有意思。 一开始AI在这个测试上表现很差,只有百分之零到百分之三十几。 然后AI公司们开始集中火力攻克这个测试。 到了2024年底,OpenAI拿出了一个叫o3的推理模型,开了最高算力模式——消耗的算力是正常版本的172倍——跑出了百分之八十七点五的成绩,一下子超过了人类百分之八十五的平均水平。 硅谷炸了。 很多人欢呼雀跃,说通用人工智能的曙光已经出现了。 但很少有人注意到另一个数字:这次测试的计算成本是个天文数字。 最初的估计是每道题大约三千美元,四百道题总计一百多万美元。 后来有人重新算了一下,认为真实成本可能高达每道题三万美元,总计超过一千万。 不管是哪个数字,都够吓人了。 而一个普通人做同样的四百道题,花的能量大概相当于吃一顿午饭,人力成本每题大约五美元。 你花几百万甚至上千万美元跟一个吃了顿午饭的人打个平手,这叫突破吗? 更关键的是,当研究者深入分析o3的解题过程时发现,它并不是真的"理解"了规则。 它是用暴力搜索的方式,在成千上万条可能的推理路径中反复试探、回溯、重选,直到碰巧找到一条能走通的路。 这不是思考,这是穷举。 就好比你要找到一把密码锁的密码,不是理解了密码的设计逻辑,而是从0000试到9999,总有一个能打开。 你确实打开了锁,但你真的"理解"了这把锁吗? 肖莱看到这个结果,不但没有气馁,反而加倍下注。 他先推出了ARC-AGI-2,大幅提升了题目难度。 AI的成绩从百分之九十三掉到百分之六十八点八。 然后今年三月,他放出了ARC-AGI-3。 这一版彻底改变了游戏规则。 ARC-AGI-3不再是静态的图案题了。 它是一个个互动式的环境——你可以把它想象成一个个微型的电子游戏世界。 每个世界都是由人类游戏设计师手工打造的,一共有几百个完全不同的环境。 但这些游戏没有任何说明书,没有规则介绍,连目标是什么都不告诉你。 你被扔进去一个陌生世界,需要自己去点击、去试错、去观察每一个动作带来的变化,然后自己搞清楚三件事:这个世界是怎么运转的? 目标是什么? 怎么才算赢? 而且它不只是看你能不能最终过关,它还看你花了多少步。 它计算的是你的学习效率——你从环境中获取信息并转化为有效策略的速度。 这才是肖莱2019年那篇论文里给智能下的定义:在未知任务上的技能获取效率。 这才是真正的流体智能测试。 不是给你一道题让你解,而是把你扔进一个完全未知的环境,看你能不能从零开始搞明白发生了什么。 人类在这个测试上的得分是百分之百。 每一个被测试的人类参与者都成功搞定了所有环境。 而全世界最强的AI呢? 谷歌的Gemini 3.1得分百分之零点三七。 OpenAI的GPT-5.4得分百分之零点二六。 Anthropic的Claude Opus 4.6得分百分之零点二五。 最离谱的是Grok-4.20,直接零分。 你听清楚了,不是AI比人差一点,不是差百分之几十,是差了两到三个数量级。 人类百分之百,最强的AI零点三七。 如果人类是站在山顶上,AI此刻连山脚下的入口都没找到。 有人可能会说,这不公平吧? 这种互动式的环境本来就是为人类设计的,AI又没有手,又没有眼睛,怎么操作? 但问题是,这些环境完全是在电脑屏幕上运行的,就是网格上的方块和颜色。 AI能看到画面,能执行动作,它拥有和人类完全相同的信息输入和操作接口。 它缺的不是感官,不是算力,不是数据。 它缺的是理解。 更耐人寻味的是一个细节:在测试的预览阶段,表现最好的不是那些万亿参数的大语言模型,而是一个用强化学习加图搜索方法构建的相对简单的系统,它拿到了百分之十二点五八。 比所有大语言模型高出一个数量级。 这说明什么? 说明大语言模型那一套思路——从海量文本中学习统计规律和语言模式——在面对真正的新问题时,压根不是正确的方法论。 语言不是智能的全部。 你把整个互联网的文字都喂给一个系统,它也不会因此学会在陌生环境中试错和适应。 这让我想到一个很有画面感的比喻。 你知道AlphaGo的故事,AI可以在围棋上击败世界冠军。 围棋虽然变化极多,但规则是固定的、已知的、从第一天就告诉你了。 AI可以在这个已知规则的空间里做到极致优化,甚至超越人类。 但ARC-AGI-3做的事情完全不同——它相当于把你扔进一个你从没见过的棋盘游戏,不告诉你棋子怎么走,不告诉你什么算赢,让你自己玩几轮搞明白。 人类觉得这事不难,玩几把就能摸出门道。 AI呢? 几乎完全瘫痪。 你再想想日常生活中的场景。 你去一个朋友家做客,他家的马桶冲水方式你从没见过——不是按钮,不是拉绳,是某种奇怪的旋转装置。 你可能愣三秒钟,摸一摸,转一下,水就冲了。 你从来没学过这个具体装置,但你就是"会了"。 这种能力你觉得理所当然,但对今天最强大的AI来说,这才是真正的难题。 它可以写诗、做数学证明、生成代码,却搞不定一个它没见过的冲水按钮。 那这个实验结果到底意味着什么? 如果你看过我上一期关于彭罗斯意识理论的内容,你可能已经在脑子里画出了一条隐线。 彭罗斯从数学出发,用哥德尔不完备定理论证了一个惊人的结论:人类的心智包含某种"不可计算"的成分。 有些事情我们能做到,但原则上任何算法都做不到。 那是一个纯理论层面的推演。 而ARC-AGI-3提供的是实验层面的证据。 它不谈意识,不谈灵魂,不谈量子力学。 它就是非常朴素地设计了一个测试:面对全新的环境,你能不能从零开始学会应对? 结果人类全员通过,AI全军覆没。 一个理论的锤子,一个实验的锤子,从两个完全不同的方向,砸向了同一面墙:人类智能里有某种东西,不是靠堆数据、堆参数、堆算力能复制的。 这个对比很残酷,但也很真实。 我们被AI在语言和逻辑上的流畅表现惊艳到了,以至于忘了一个事实:流畅不等于理解。 一个鹦鹉可以完美地模仿你说的每一句话,但它并不知道这些话是什么意思。 大语言模型当然比鹦鹉复杂得多,但ARC-AGI-3在问的是同一类问题:当你剥掉所有预训练的知识、所有学过的模式,只留下"面对未知时现场搞明白"这一个维度,AI还剩下什么? 答案是:几乎什么都不剩。 我要特别强调一点:我不是在说AI永远追不上。 技术在进步,架构在创新,也许明年就会有人找到突破口。 肖莱自己也设了总计两百万美元的竞赛奖金,等着谁能在ARC-AGI-3上达到人类水平。 但今天ARC-AGI-3揭示的那个鸿沟,不是一个简单的量的差距——不是说AI只要继续训练、继续扩大参数就能赶上来。 它暴露的是一个质的差异:当前整个AI范式——从大语言模型到推理增强模型——在面对真正的、彻底的未知时,缺少一种根本性的能力。 这种能力到底是什么? 肖莱给了一个技术性的回答:是流体智能,是在全新环境中高效获取技能的能力。 但如果你再深追一步,这个答案其实只是换了个名字重新描述了问题。 真正的问题是:为什么人类天生就有这种能力? 一个三岁的孩子被放到一个他从未去过的房间里,没人教他,没有说明书,几分钟内他就能搞明白门把手怎么用、哪个按钮开灯、积木往哪里放。 他不需要训练十万次,不需要搜索所有可能的动作组合。 他看了一眼,就"懂了"。 这个"懂了"到底是什么? 它不是计算。 因为如果是计算,AI比人快一万亿倍,不应该比人差。 它不是知识储备,因为一个三岁孩子的知识储备约等于零。 它也不是进化赋予的本能反应,因为门把手和积木不是进化环境里的东西。 它似乎是某种更基础的能力——一种把零散的感知信息瞬间组织成"有意义的整体"的能力,一种不需要被教就能看出"这个东西是干什么用的"的能力。 认知科学家管这个叫"格式塔感知",但这个名字也只是给谜题贴了个标签,并没有解开谜题本身。 这就是ARC-AGI-3真正让人不安的地方。 它不只是在说AI不够强,需要继续优化。 它在问一个更深的问题:我们以为的"智能"到底是什么? 我们一直以为智能是信息处理——输入数据,处理数据,输出答案。 按这个定义,AI早就应该比人聪明了。 但ARC-AGI-3显示,在面对真正的未知时,人类这台每秒只能处理大约十比特信息、二十瓦功率的"生物计算机",碾压了所有用百万美元电费堆出来的硅基系统。 也许,智能从来就不是信息处理。 也许"理解"这件事,不是用更多的计算能力就能追上的。 也许在人类看懂一个从未见过的东西的那个瞬间,发生的不是计算,而是某种物理事件——某种今天的计算机架构根本无法模拟的东西。 ARC-AGI-3没有回答这个问题。 但它用百分之零点三七这个冰冷的数字,把这个问题狠狠地钉在了桌面上,让所有人都没办法再假装看不见。 你觉得AI最终能跨过这道鸿沟吗? 还是说这道鸿沟本身就在告诉我们,我们从一开始就小看了"理解"这件事? 如果你有什么想法,我很想听。 我是王利杰,我们下期见!