﻿1
00:00:00,349 --> 00:00:03,450
AI推理能力只有人类的百分之零点三七

2
00:00:04,349 --> 00:00:04,849
两周前

3
00:00:05,149 --> 00:00:07,549
一个新的测试悄悄上线了

4
00:00:07,868 --> 00:00:09,990
它没有登上任何头条新闻

5
00:00:10,108 --> 00:00:11,868
但硅谷的核心圈子里

6
00:00:11,868 --> 00:00:13,269
很多人失眠了

7
00:00:13,669 --> 00:00:15,589
因为这个测试的结果显示

8
00:00:15,669 --> 00:00:18,068
当今世界上最强大的AI

9
00:00:18,068 --> 00:00:22,949
面对全新环境的推理能力只有人类的百分之零点三七

10
00:00:23,388 --> 00:00:24,730
不是百分之三十七

11
00:00:25,109 --> 00:00:26,550
是零点三七

12
00:00:26,908 --> 00:00:27,129
哈喽

13
00:00:27,349 --> 00:00:27,809
大家好

14
00:00:28,068 --> 00:00:29,109
我是王利杰

15
00:00:29,388 --> 00:00:32,009
今天我要跟你聊的这个测试叫ARC

16
00:00:32,109 --> 00:00:33,030
AGI - 3

17
00:00:33,308 --> 00:00:36,429
是2026年3月25号刚刚发布的

18
00:00:36,668 --> 00:00:38,789
如果你跟踪AI领域的新闻

19
00:00:38,829 --> 00:00:42,329
你一定知道过去两年AI刷榜的速度有多疯狂

20
00:00:42,908 --> 00:00:45,630
今天一个模型在某个排行榜上登顶

21
00:00:45,668 --> 00:00:48,109
明天另一个模型就把它挤下来

22
00:00:48,348 --> 00:00:52,549
每隔几周就有人宣布AI又在某个考试上超越了人类

23
00:00:52,829 --> 00:00:54,950
在这种一片凯歌的氛围下

24
00:00:54,988 --> 00:00:57,759
突然冒出来一个测试说AI只有人类的

25
00:00:57,759 --> 00:00:59,189
百分之零点三七

26
00:00:59,389 --> 00:01:01,189
听起来几乎像个笑话

27
00:01:01,389 --> 00:01:02,390
但它不是

28
00:01:03,268 --> 00:01:07,209
它可能是近几年来AI领域最重要的一次"照镜子"

29
00:01:07,789 --> 00:01:10,870
这个测试的创造者叫弗朗索瓦·肖莱

30
00:01:11,108 --> 00:01:13,230
一个法国裔AI研究者

31
00:01:13,509 --> 00:01:15,829
他曾在谷歌工作了九年多

32
00:01:15,948 --> 00:01:18,790
2024年底离开谷歌去创业了

33
00:01:18,948 --> 00:01:20,129
他不是什么圈外人

34
00:01:20,549 --> 00:01:21,510
恰恰相反

35
00:01:21,668 --> 00:01:24,390
他是深度学习框架Keras的作者

36
00:01:24,588 --> 00:01:27,849
这个框架被全世界成千上万的AI工程师

37
00:01:27,989 --> 00:01:29,670
用来搭建神经网络

38
00:01:29,948 --> 00:01:30,569
换句话说

39
00:01:30,868 --> 00:01:32,590
他是造AI工具的人

40
00:01:32,868 --> 00:01:34,329
但正是这么一个"圈内人"

41
00:01:34,629 --> 00:01:36,790
在2019年发表了一篇论文

42
00:01:36,909 --> 00:01:39,769
标题翻译过来就是<论智能的度量>

43
00:01:40,388 --> 00:01:42,818
这篇论文的核心观点可以用一句话概括

44
00:01:42,828 --> 00:01:46,829
我们一直在用错误的方式衡量AI的智能

45
00:01:47,149 --> 00:01:48,290
这句话是什么意思呢

46
00:01:48,748 --> 00:01:49,670
你想想看

47
00:01:49,709 --> 00:01:52,250
过去几年我们看到的那些AI成绩单

48
00:01:52,668 --> 00:01:54,308
什么考试得了多少分

49
00:01:54,308 --> 00:01:57,849
什么排行榜排名第几 - 这些测试测的是什么

50
00:01:58,349 --> 00:02:01,269
是AI能不能回答一个已知类型的问题

51
00:02:01,709 --> 00:02:05,069
比如做数学题、写代码、回答常识问题

52
00:02:05,509 --> 00:02:08,150
AI确实在这些事情上越来越强

53
00:02:08,389 --> 00:02:10,430
有些甚至已经超过了人类

54
00:02:10,669 --> 00:02:11,370
但肖莱说

55
00:02:11,588 --> 00:02:12,948
这根本不是智能

56
00:02:12,949 --> 00:02:13,949
这是背书

57
00:02:14,508 --> 00:02:15,707
他做了一个区分

58
00:02:15,709 --> 00:02:20,229
借用了心理学里一个经典概念：流体智能和晶体智能

59
00:02:20,549 --> 00:02:23,229
晶体智能是你积累的知识和技能

60
00:02:23,269 --> 00:02:24,409
比如你会说英语

61
00:02:24,628 --> 00:02:26,027
你记得勾股定理

62
00:02:26,028 --> 00:02:28,270
你知道北京是中国的首都

63
00:02:28,429 --> 00:02:31,949
这些东西你学过、记住了、可以随时调用

64
00:02:32,669 --> 00:02:34,310
流体智能完全不同

65
00:02:34,468 --> 00:02:38,909
它是你面对一个从未见过的、完全陌生的新问题时

66
00:02:38,989 --> 00:02:42,110
能不能当场想出解决办法的能力

67
00:02:42,549 --> 00:02:44,069
举个最简单的例子

68
00:02:44,348 --> 00:02:47,469
假设你被空投到一个完全陌生的城市

69
00:02:47,868 --> 00:02:48,530
语言不通

70
00:02:48,949 --> 00:02:49,810
手机没信号

71
00:02:50,308 --> 00:02:51,430
地图也没有

72
00:02:51,868 --> 00:02:53,569
你能不能找到回旅馆的路

73
00:02:54,188 --> 00:02:54,889
你会怎么做

74
00:02:55,788 --> 00:02:57,949
你可能会先观察周围的地标

75
00:02:58,028 --> 00:02:59,990
然后选一个方向走走看

76
00:03:00,188 --> 00:03:03,150
走错了就根据新的线索调整方向

77
00:03:03,429 --> 00:03:07,389
整个过程你用到的不是任何预先存储的知识

78
00:03:07,468 --> 00:03:11,909
而是一种即时感知、试探、反馈、调整的能力

79
00:03:12,308 --> 00:03:13,789
这就是流体智能

80
00:03:14,149 --> 00:03:15,250
每个正常人都有

81
00:03:15,508 --> 00:03:16,949
而且效率极高

82
00:03:17,308 --> 00:03:20,187
肖莱的核心论点是：当今的AI

83
00:03:20,188 --> 00:03:23,710
几乎全部的惊人表现都来自晶体智能

84
00:03:23,949 --> 00:03:27,830
它们拥有人类历史上所有公开文本作为训练数据

85
00:03:27,989 --> 00:03:31,229
它们的"知识储备"早就超越了任何人类个体

86
00:03:31,429 --> 00:03:33,150
你问它任何已知的问题

87
00:03:33,308 --> 00:03:35,590
它都能给你一个像模像样的答案

88
00:03:35,788 --> 00:03:37,110
但这不是智能

89
00:03:37,149 --> 00:03:39,189
这是记忆力加模式匹配

90
00:03:39,669 --> 00:03:40,849
真正的智能是什么

91
00:03:41,269 --> 00:03:44,110
是你面对一个前所未有的情境时

92
00:03:44,269 --> 00:03:46,270
学习和适应的效率

93
00:03:46,389 --> 00:03:47,867
不是你知道多少

94
00:03:47,868 --> 00:03:49,590
而是你在不知道的时候

95
00:03:49,748 --> 00:03:51,550
能多快地搞明白

96
00:03:51,868 --> 00:03:53,068
为了证明这一点

97
00:03:53,068 --> 00:03:56,150
他设计了ARC - AGI这个测试

98
00:03:56,348 --> 00:03:59,310
最初的第一版叫ARC - AGI - 1

99
00:03:59,468 --> 00:04:01,909
是一系列抽象的图案变换题

100
00:04:02,229 --> 00:04:04,750
给你几组输入输出的图案示例

101
00:04:04,829 --> 00:04:06,750
让你推断出背后的规则

102
00:04:06,868 --> 00:04:09,789
然后把这个规则应用到一个新的输入上

103
00:04:10,188 --> 00:04:10,530
比如

104
00:04:10,788 --> 00:04:12,268
你看到三组例子

105
00:04:12,269 --> 00:04:15,389
每组都是一个蓝色方块移动到了某个位置

106
00:04:15,508 --> 00:04:17,427
你需要找出移动的规律

107
00:04:17,428 --> 00:04:20,029
然后预测下一个方块会移到哪里

108
00:04:20,509 --> 00:04:21,509
题目都不难

109
00:04:21,629 --> 00:04:23,629
普通人看一眼就能想明白

110
00:04:23,869 --> 00:04:27,067
但关键是每道题的规则都是独一无二的

111
00:04:27,069 --> 00:04:28,709
你不可能提前背答案

112
00:04:29,189 --> 00:04:31,329
它考的就是你能不能"现场悟"

113
00:04:32,149 --> 00:04:33,189
结果很有意思

114
00:04:33,629 --> 00:04:36,750
一开始AI在这个测试上表现很差

115
00:04:36,949 --> 00:04:39,069
只有百分之零到百分之三十几

116
00:04:39,509 --> 00:04:42,990
然后AI公司们开始集中火力攻克这个测试

117
00:04:43,269 --> 00:04:44,747
到了2024年底

118
00:04:44,749 --> 00:04:47,629
OpenAI拿出了一个叫o3的推理模型

119
00:04:47,749 --> 00:04:49,050
开了最高算力模式

120
00:04:49,468 --> 00:04:52,329
消耗的算力是正常版本的172倍

121
00:04:52,869 --> 00:04:55,269
跑出了百分之八十七点五的成绩

122
00:04:55,389 --> 00:04:58,589
一下子超过了人类百分之八十五的平均水平

123
00:04:58,869 --> 00:04:59,949
硅谷炸了

124
00:05:00,309 --> 00:05:01,947
很多人欢呼雀跃

125
00:05:01,949 --> 00:05:04,910
说通用人工智能的曙光已经出现了

126
00:05:05,269 --> 00:05:06,939
但很少有人注意到另一个数字

127
00:05:06,949 --> 00:05:10,709
这次测试的计算成本是个天文数字

128
00:05:10,949 --> 00:05:13,949
最初的估计是每道题大约三千美元

129
00:05:13,988 --> 00:05:16,430
四百道题总计一百多万美元

130
00:05:16,709 --> 00:05:18,788
后来有人重新算了一下

131
00:05:18,788 --> 00:05:22,148
认为真实成本可能高达每道题三万美元

132
00:05:22,149 --> 00:05:23,709
总计超过一千万

133
00:05:24,108 --> 00:05:25,250
不管是哪个数字

134
00:05:25,468 --> 00:05:26,750
都够吓人了

135
00:05:26,949 --> 00:05:29,509
而一个普通人做同样的四百道题

136
00:05:29,548 --> 00:05:32,550
花的能量大概相当于吃一顿午饭

137
00:05:32,749 --> 00:05:35,110
人力成本每题大约五美元

138
00:05:35,389 --> 00:05:38,420
你花几百万甚至上千万美元跟一个吃了

139
00:05:38,420 --> 00:05:40,029
顿午饭的人打个平手

140
00:05:40,069 --> 00:05:40,930
这叫突破吗

141
00:05:41,588 --> 00:05:42,790
更关键的是

142
00:05:42,908 --> 00:05:46,269
当研究者深入分析o3的解题过程时发现

143
00:05:46,389 --> 00:05:48,430
它并不是真的"理解"了规则

144
00:05:48,629 --> 00:05:50,588
它是用暴力搜索的方式

145
00:05:50,588 --> 00:05:54,290
在成千上万条可能的推理路径中反复试探

146
00:05:54,668 --> 00:05:56,230
回溯、重选

147
00:05:56,309 --> 00:05:58,949
直到碰巧找到一条能走通的路

148
00:05:59,309 --> 00:06:00,209
这不是思考

149
00:06:00,548 --> 00:06:01,670
这是穷举

150
00:06:02,028 --> 00:06:04,507
就好比你要找到一把密码锁的密码

151
00:06:04,509 --> 00:06:06,668
不是理解了密码的设计逻辑

152
00:06:06,668 --> 00:06:09,550
而是从0000试到9999

153
00:06:09,668 --> 00:06:11,069
总有一个能打开

154
00:06:11,348 --> 00:06:12,829
你确实打开了锁

155
00:06:12,869 --> 00:06:14,569
但你真的"理解"了这把锁吗

156
00:06:15,348 --> 00:06:16,569
肖莱看到这个结果

157
00:06:16,829 --> 00:06:18,069
不但没有气馁

158
00:06:18,108 --> 00:06:19,550
反而加倍下注

159
00:06:19,749 --> 00:06:22,149
他先推出了ARC - AGI - 2

160
00:06:22,309 --> 00:06:24,069
大幅提升了题目难度

161
00:06:24,389 --> 00:06:28,550
AI的成绩从百分之九十三掉到百分之六十八点八

162
00:06:29,108 --> 00:06:30,449
然后今年三月

163
00:06:30,788 --> 00:06:32,670
他放出了ARC - AGI - 3

164
00:06:33,348 --> 00:06:35,870
这一版彻底改变了游戏规则

165
00:06:36,228 --> 00:06:39,430
ARC - AGI - 3不再是静态的图案题了

166
00:06:39,509 --> 00:06:41,449
它是一个个互动式的环境

167
00:06:41,949 --> 00:06:45,629
你可以把它想象成一个个微型的电子游戏世界

168
00:06:45,908 --> 00:06:49,709
每个世界都是由人类游戏设计师手工打造的

169
00:06:49,749 --> 00:06:52,550
一共有几百个完全不同的环境

170
00:06:53,309 --> 00:06:55,750
但这些游戏没有任何说明书

171
00:06:55,869 --> 00:06:57,230
没有规则介绍

172
00:06:57,309 --> 00:06:59,509
连目标是什么都不告诉你

173
00:07:00,028 --> 00:07:02,069
你被扔进去一个陌生世界

174
00:07:02,149 --> 00:07:04,209
需要自己去点击、去试错

175
00:07:04,588 --> 00:07:06,990
去观察每一个动作带来的变化

176
00:07:07,108 --> 00:07:10,850
然后自己搞清楚三件事：这个世界是怎么运转的

177
00:07:11,228 --> 00:07:12,129
目标是什么

178
00:07:12,389 --> 00:07:13,209
怎么才算赢

179
00:07:13,829 --> 00:07:16,709
而且它不只是看你能不能最终过关

180
00:07:16,829 --> 00:07:18,509
它还看你花了多少步

181
00:07:18,749 --> 00:07:20,730
它计算的是你的学习效率

182
00:07:21,108 --> 00:07:25,550
你从环境中获取信息并转化为有效策略的速度

183
00:07:26,069 --> 00:07:30,018
这才是肖莱2019年那篇论文里给智能下的定义

184
00:07:30,028 --> 00:07:33,949
在未知任务上的技能获取效率

185
00:07:34,228 --> 00:07:36,709
这才是真正的流体智能测试

186
00:07:37,028 --> 00:07:38,990
不是给你一道题让你解

187
00:07:39,269 --> 00:07:42,389
而是把你扔进一个完全未知的环境

188
00:07:42,588 --> 00:07:46,149
看你能不能从零开始搞明白发生了什么

189
00:07:46,548 --> 00:07:49,110
人类在这个测试上的得分是百分之百

190
00:07:49,509 --> 00:07:53,629
每一个被测试的人类参与者都成功搞定了所有环境

191
00:07:54,348 --> 00:07:55,930
而全世界最强的AI呢

192
00:07:56,548 --> 00:07:59,279
谷歌的Gemini 3 . 1得分百分之零点

193
00:07:59,279 --> 00:07:59,990
三七

194
00:08:00,389 --> 00:08:03,100
OpenAI的GPT - 5 . 4得分百分之零

195
00:08:03,100 --> 00:08:03,870
点二六

196
00:08:04,189 --> 00:08:05,290
Anthropic的Claude

197
00:08:05,468 --> 00:08:07,209
Opus 4 . 6得分

198
00:08:07,269 --> 00:08:08,670
百分之零点二五

199
00:08:08,869 --> 00:08:10,930
最离谱的是Grok - 4 . 20

200
00:08:11,269 --> 00:08:12,389
直接零分

201
00:08:12,629 --> 00:08:13,410
你听清楚了

202
00:08:13,749 --> 00:08:15,470
不是AI比人差一点

203
00:08:15,548 --> 00:08:17,189
不是差百分之几十

204
00:08:17,228 --> 00:08:19,389
是差了两到三个数量级

205
00:08:19,709 --> 00:08:20,810
人类百分之百

206
00:08:21,189 --> 00:08:23,269
最强的AI零点三七

207
00:08:23,548 --> 00:08:25,509
如果人类是站在山顶上

208
00:08:25,548 --> 00:08:28,509
AI此刻连山脚下的入口都没找到

209
00:08:28,908 --> 00:08:29,810
有人可能会说

210
00:08:30,269 --> 00:08:31,089
这不公平吧

211
00:08:31,829 --> 00:08:35,230
这种互动式的环境本来就是为人类设计的

212
00:08:35,349 --> 00:08:36,548
AI又没有手

213
00:08:36,548 --> 00:08:37,289
又没有眼睛

214
00:08:37,629 --> 00:08:38,250
怎么操作

215
00:08:38,828 --> 00:08:39,830
但问题是

216
00:08:39,869 --> 00:08:43,190
这些环境完全是在电脑屏幕上运行的

217
00:08:43,269 --> 00:08:45,509
就是网格上的方块和颜色

218
00:08:45,788 --> 00:08:46,889
AI能看到画面

219
00:08:47,229 --> 00:08:48,429
能执行动作

220
00:08:48,509 --> 00:08:52,789
它拥有和人类完全相同的信息输入和操作接口

221
00:08:53,068 --> 00:08:54,610
它缺的不是感官

222
00:08:54,908 --> 00:08:55,868
不是算力

223
00:08:55,869 --> 00:08:56,870
不是数据

224
00:08:57,068 --> 00:08:58,710
它缺的是理解

225
00:08:59,229 --> 00:09:03,110
更耐人寻味的是一个细节：在测试的预览阶段

226
00:09:03,149 --> 00:09:06,509
表现最好的不是那些万亿参数的大语言模型

227
00:09:06,589 --> 00:09:09,519
而是一个用强化学习加图搜索方法构

228
00:09:09,519 --> 00:09:11,230
建的相对简单的系统

229
00:09:11,349 --> 00:09:13,470
它拿到了百分之十二点五八

230
00:09:13,589 --> 00:09:16,389
比所有大语言模型高出一个数量级

231
00:09:16,788 --> 00:09:17,529
这说明什么

232
00:09:17,908 --> 00:09:19,850
说明大语言模型那一套思路

233
00:09:20,188 --> 00:09:23,889
从海量文本中学习统计规律和语言模式

234
00:09:24,188 --> 00:09:26,148
在面对真正的新问题时

235
00:09:26,149 --> 00:09:28,149
压根不是正确的方法论

236
00:09:28,349 --> 00:09:30,269
语言不是智能的全部

237
00:09:30,749 --> 00:09:33,669
你把整个互联网的文字都喂给一个系统

238
00:09:33,749 --> 00:09:37,830
它也不会因此学会在陌生环境中试错和适应

239
00:09:38,229 --> 00:09:40,789
这让我想到一个很有画面感的比喻

240
00:09:41,068 --> 00:09:42,710
你知道AlphaGo的故事

241
00:09:42,948 --> 00:09:45,710
AI可以在围棋上击败世界冠军

242
00:09:45,989 --> 00:09:47,788
围棋虽然变化极多

243
00:09:47,788 --> 00:09:52,110
但规则是固定的、已知的、从第一天就告诉你了

244
00:09:52,389 --> 00:09:56,268
AI可以在这个已知规则的空间里做到极致优化

245
00:09:56,269 --> 00:09:57,590
甚至超越人类

246
00:09:58,269 --> 00:10:00,730
但ARC - AGI - 3做的事情完全不同

247
00:10:01,188 --> 00:10:04,629
它相当于把你扔进一个你从没见过的棋盘游戏

248
00:10:04,668 --> 00:10:06,227
不告诉你棋子怎么走

249
00:10:06,229 --> 00:10:07,750
不告诉你什么算赢

250
00:10:07,788 --> 00:10:09,830
让你自己玩几轮搞明白

251
00:10:10,109 --> 00:10:11,590
人类觉得这事不难

252
00:10:11,629 --> 00:10:13,470
玩几把就能摸出门道

253
00:10:13,629 --> 00:10:14,210
AI呢

254
00:10:14,708 --> 00:10:16,269
几乎完全瘫痪

255
00:10:16,428 --> 00:10:18,990
你再想想日常生活中的场景

256
00:10:19,308 --> 00:10:20,990
你去一个朋友家做客

257
00:10:21,109 --> 00:10:24,668
他家的马桶冲水方式你从没见过 - 不是按钮

258
00:10:24,668 --> 00:10:25,330
不是拉绳

259
00:10:25,629 --> 00:10:27,789
是某种奇怪的旋转装置

260
00:10:27,989 --> 00:10:29,129
你可能愣三秒钟

261
00:10:29,389 --> 00:10:30,107
摸一摸

262
00:10:30,109 --> 00:10:30,570
转一下

263
00:10:30,948 --> 00:10:32,029
水就冲了

264
00:10:32,188 --> 00:10:34,347
你从来没学过这个具体装置

265
00:10:34,349 --> 00:10:35,330
但你就是"会了"

266
00:10:35,749 --> 00:10:37,990
这种能力你觉得理所当然

267
00:10:38,068 --> 00:10:40,470
但对今天最强大的AI来说

268
00:10:40,509 --> 00:10:42,230
这才是真正的难题

269
00:10:42,349 --> 00:10:45,467
它可以写诗、做数学证明、生成代码

270
00:10:45,469 --> 00:10:48,149
却搞不定一个它没见过的冲水按钮

271
00:10:48,389 --> 00:10:50,409
那这个实验结果到底意味着什么

272
00:10:50,948 --> 00:10:54,429
如果你看过我上一期关于彭罗斯意识理论的内容

273
00:10:54,509 --> 00:10:57,149
你可能已经在脑子里画出了一条隐线

274
00:10:57,509 --> 00:10:59,187
彭罗斯从数学出发

275
00:10:59,188 --> 00:11:01,830
用哥德尔不完备定理论证了一个惊人的结论

276
00:11:01,840 --> 00:11:05,509
人类的心智包含某种"不可计算"的成分

277
00:11:05,788 --> 00:11:07,508
有些事情我们能做到

278
00:11:07,509 --> 00:11:10,230
但原则上任何算法都做不到

279
00:11:10,469 --> 00:11:12,549
那是一个纯理论层面的推演

280
00:11:12,828 --> 00:11:15,860
而ARC - AGI - 3提供的是实验层

281
00:11:15,860 --> 00:11:16,750
面的证据

282
00:11:17,028 --> 00:11:17,970
它不谈意识

283
00:11:18,149 --> 00:11:19,148
不谈灵魂

284
00:11:19,149 --> 00:11:20,429
不谈量子力学

285
00:11:20,629 --> 00:11:25,309
它就是非常朴素地设计了一个测试：面对全新的环境

286
00:11:25,349 --> 00:11:27,570
你能不能从零开始学会应对

287
00:11:28,149 --> 00:11:29,649
结果人类全员通过

288
00:11:29,948 --> 00:11:31,509
AI全军覆没

289
00:11:31,948 --> 00:11:33,049
一个理论的锤子

290
00:11:33,269 --> 00:11:34,710
一个实验的锤子

291
00:11:34,788 --> 00:11:36,707
从两个完全不同的方向

292
00:11:36,708 --> 00:11:40,429
砸向了同一面墙：人类智能里有某种东西

293
00:11:40,548 --> 00:11:44,429
不是靠堆数据、堆参数、堆算力能复制的

294
00:11:44,668 --> 00:11:45,769
这个对比很残酷

295
00:11:46,068 --> 00:11:47,230
但也很真实

296
00:11:47,349 --> 00:11:51,268
我们被AI在语言和逻辑上的流畅表现惊艳到了

297
00:11:51,269 --> 00:11:54,870
以至于忘了一个事实：流畅不等于理解

298
00:11:55,068 --> 00:11:58,347
一个鹦鹉可以完美地模仿你说的每一句话

299
00:11:58,349 --> 00:12:00,750
但它并不知道这些话是什么意思

300
00:12:01,068 --> 00:12:03,750
大语言模型当然比鹦鹉复杂得多

301
00:12:03,869 --> 00:12:06,649
但ARC - AGI - 3在问的是同一类问题

302
00:12:06,659 --> 00:12:11,307
当你剥掉所有预训练的知识、所有学过的模式

303
00:12:11,308 --> 00:12:14,909
只留下"面对未知时现场搞明白"这一个维度

304
00:12:15,028 --> 00:12:16,250
AI还剩下什么

305
00:12:16,708 --> 00:12:18,870
答案是：几乎什么都不剩

306
00:12:19,229 --> 00:12:23,429
我要特别强调一点：我不是在说AI永远追不上

307
00:12:23,668 --> 00:12:24,649
技术在进步

308
00:12:24,948 --> 00:12:26,230
架构在创新

309
00:12:26,349 --> 00:12:28,909
也许明年就会有人找到突破口

310
00:12:29,109 --> 00:12:32,789
肖莱自己也设了总计两百万美元的竞赛奖金

311
00:12:32,908 --> 00:12:36,000
等着谁能在ARC - AGI - 3上达到人类

312
00:12:36,000 --> 00:12:36,629
水平

313
00:12:36,869 --> 00:12:40,190
但今天ARC - AGI - 3揭示的那个鸿沟

314
00:12:40,229 --> 00:12:42,169
不是一个简单的量的差距

315
00:12:42,548 --> 00:12:44,289
不是说AI只要继续训练

316
00:12:44,509 --> 00:12:46,750
继续扩大参数就能赶上来

317
00:12:47,469 --> 00:12:51,049
它暴露的是一个质的差异：当前整个AI范式

318
00:12:51,349 --> 00:12:53,690
从大语言模型到推理增强模型

319
00:12:54,028 --> 00:12:56,789
在面对真正的、彻底的未知时

320
00:12:56,908 --> 00:12:58,870
缺少一种根本性的能力

321
00:12:59,149 --> 00:13:00,649
这种能力到底是什么

322
00:13:00,989 --> 00:13:04,070
肖莱给了一个技术性的回答：是流体智能

323
00:13:04,188 --> 00:13:07,590
是在全新环境中高效获取技能的能力

324
00:13:07,828 --> 00:13:09,669
但如果你再深追一步

325
00:13:09,749 --> 00:13:13,230
这个答案其实只是换了个名字重新描述了问题

326
00:13:13,509 --> 00:13:16,730
真正的问题是：为什么人类天生就有这种能力

327
00:13:17,188 --> 00:13:20,909
一个三岁的孩子被放到一个他从未去过的房间里

328
00:13:20,948 --> 00:13:21,730
没人教他

329
00:13:21,948 --> 00:13:23,029
没有说明书

330
00:13:23,188 --> 00:13:25,929
几分钟内他就能搞明白门把手怎么用

331
00:13:26,308 --> 00:13:28,830
哪个按钮开灯、积木往哪里放

332
00:13:29,028 --> 00:13:30,788
他不需要训练十万次

333
00:13:30,788 --> 00:13:33,549
不需要搜索所有可能的动作组合

334
00:13:34,188 --> 00:13:35,049
他看了一眼

335
00:13:35,269 --> 00:13:35,929
就"懂了"

336
00:13:36,548 --> 00:13:38,090
这个"懂了"到底是什么

337
00:13:38,629 --> 00:13:39,750
它不是计算

338
00:13:40,028 --> 00:13:41,009
因为如果是计算

339
00:13:41,269 --> 00:13:43,148
AI比人快一万亿倍

340
00:13:43,149 --> 00:13:44,429
不应该比人差

341
00:13:44,788 --> 00:13:46,110
它不是知识储备

342
00:13:46,188 --> 00:13:49,070
因为一个三岁孩子的知识储备约等于零

343
00:13:49,308 --> 00:13:51,548
它也不是进化赋予的本能反应

344
00:13:51,548 --> 00:13:54,710
因为门把手和积木不是进化环境里的东西

345
00:13:55,188 --> 00:13:57,169
它似乎是某种更基础的能力

346
00:13:57,469 --> 00:14:00,250
一种把零散的感知信息瞬间组织成"有

347
00:14:00,269 --> 00:14:01,788
意义的整体"的能力

348
00:14:01,788 --> 00:14:04,049
一种不需要被教就能看出"这个东西

349
00:14:04,389 --> 00:14:06,070
是干什么用的"的能力

350
00:14:06,668 --> 00:14:09,129
认知科学家管这个叫"格式塔感知"

351
00:14:09,548 --> 00:14:12,710
但这个名字也只是给谜题贴了个标签

352
00:14:12,788 --> 00:14:14,669
并没有解开谜题本身

353
00:14:14,948 --> 00:14:17,460
这就是ARC - AGI - 3真正让人不安

354
00:14:17,460 --> 00:14:18,149
的地方

355
00:14:18,548 --> 00:14:20,750
它不只是在说AI不够强

356
00:14:20,828 --> 00:14:22,029
需要继续优化

357
00:14:22,308 --> 00:14:23,450
它在问一个更深的问题

358
00:14:23,460 --> 00:14:26,409
我们以为的"智能"到底是什么

359
00:14:26,828 --> 00:14:30,227
我们一直以为智能是信息处理 - 输入数据

360
00:14:30,229 --> 00:14:31,067
处理数据

361
00:14:31,068 --> 00:14:31,950
输出答案

362
00:14:32,188 --> 00:14:33,009
按这个定义

363
00:14:33,308 --> 00:14:35,429
AI早就应该比人聪明了

364
00:14:35,668 --> 00:14:37,429
但ARC - AGI - 3显示

365
00:14:37,469 --> 00:14:39,429
在面对真正的未知时

366
00:14:39,509 --> 00:14:42,450
人类这台每秒只能处理大约十比特信息

367
00:14:42,788 --> 00:14:44,529
二十瓦功率的"生物计算机"

368
00:14:44,908 --> 00:14:48,590
碾压了所有用百万美元电费堆出来的硅基系统

369
00:14:49,028 --> 00:14:49,370
也许

370
00:14:49,668 --> 00:14:51,909
智能从来就不是信息处理

371
00:14:52,229 --> 00:14:53,668
也许"理解"这件事

372
00:14:53,668 --> 00:14:56,470
不是用更多的计算能力就能追上的

373
00:14:56,708 --> 00:15:00,429
也许在人类看懂一个从未见过的东西的那个瞬间

374
00:15:00,469 --> 00:15:01,908
发生的不是计算

375
00:15:01,908 --> 00:15:03,210
而是某种物理事件

376
00:15:03,509 --> 00:15:07,149
某种今天的计算机架构根本无法模拟的东西

377
00:15:07,828 --> 00:15:10,629
ARC - AGI - 3没有回答这个问题

378
00:15:10,948 --> 00:15:14,307
但它用百分之零点三七这个冰冷的数字

379
00:15:14,308 --> 00:15:17,067
把这个问题狠狠地钉在了桌面上

380
00:15:17,068 --> 00:15:19,870
让所有人都没办法再假装看不见

381
00:15:20,149 --> 00:15:22,730
你觉得AI最终能跨过这道鸿沟吗

382
00:15:23,028 --> 00:15:25,868
还是说这道鸿沟本身就在告诉我们

383
00:15:25,869 --> 00:15:28,570
我们从一开始就小看了"理解"这件事

384
00:15:29,269 --> 00:15:30,409
如果你有什么想法

385
00:15:30,548 --> 00:15:31,590
我很想听

386
00:15:31,828 --> 00:15:32,490
我是王利杰

387
00:15:32,668 --> 00:15:33,409
我们下期见
