1 00:00:00,000 --> 00:00:03,553 Karpathy说你写的App根本不该存在 2 00:00:03,904 --> 00:00:04,974 他不是在骂谁 3 00:00:05,264 --> 00:00:06,153 是骂自己 4 00:00:06,694 --> 00:00:07,623 2025年 5 00:00:07,654 --> 00:00:09,443 OpenAI创始成员Andrej 6 00:00:09,453 --> 00:00:11,342 Karpathy花了好几天 7 00:00:11,373 --> 00:00:15,023 用AI辅助编程写了一个叫MenuGen的应用 8 00:00:15,213 --> 00:00:15,723 干嘛呢 9 00:00:16,214 --> 00:00:16,923 你去餐厅 10 00:00:17,333 --> 00:00:18,783 服务员递来菜单 11 00:00:18,973 --> 00:00:20,702 上面大部分菜没图 12 00:00:20,894 --> 00:00:22,862 你不知道那菜长啥样 13 00:00:23,054 --> 00:00:24,322 很多人都有这经历 14 00:00:24,693 --> 00:00:25,943 尤其在国外 15 00:00:25,973 --> 00:00:26,882 菜名看不懂 16 00:00:27,293 --> 00:00:29,142 更不知道端上来是个啥 17 00:00:29,414 --> 00:00:33,143 于是Karpathy做了个工具 拍张菜单照片 18 00:00:33,293 --> 00:00:36,143 它帮你把每道菜的样子生成出来 19 00:00:36,333 --> 00:00:37,962 这个App跑在云端 20 00:00:38,373 --> 00:00:39,742 前后端齐全 21 00:00:40,574 --> 00:00:43,212 用了多模态大模型做文字识别 22 00:00:43,214 --> 00:00:44,263 提取菜名 23 00:00:44,373 --> 00:00:47,062 用了图片生成模型渲染菜品 24 00:00:47,093 --> 00:00:49,373 还有用户注册 在线支付 25 00:00:49,373 --> 00:00:50,742 部署在Vercel上 26 00:00:50,854 --> 00:00:52,782 一套完整的Web应用 27 00:00:53,359 --> 00:00:53,707 然后 28 00:00:54,078 --> 00:00:55,438 2026年4月 29 00:00:55,438 --> 00:00:57,347 Karpathy在红杉资本的AI 30 00:00:57,347 --> 00:00:59,487 Ascent峰会上讲了一句话 31 00:00:59,639 --> 00:01:01,847 把自己这作品直接判了死刑 32 00:01:01,942 --> 00:01:02,743 他说 33 00:01:02,758 --> 00:01:05,437 你只需要把菜单照片丢给大模型 34 00:01:05,438 --> 00:01:09,288 附一句话 帮我把这些菜的样子直接画在菜单上 35 00:01:09,598 --> 00:01:10,268 几秒钟后 36 00:01:10,678 --> 00:01:12,118 模型返回一张图 37 00:01:12,119 --> 00:01:14,238 跟原始菜单几乎一模一样 38 00:01:14,238 --> 00:01:17,167 只是每道菜旁边多了张逼真的效果图 39 00:01:17,318 --> 00:01:18,027 像素层面 40 00:01:18,279 --> 00:01:19,728 直接完成了渲染 41 00:01:19,839 --> 00:01:20,628 整个MenuGen 42 00:01:20,798 --> 00:01:21,958 几天的工作量 43 00:01:21,958 --> 00:01:22,788 几千行代码 44 00:01:22,958 --> 00:01:24,368 根本没必要存在 45 00:01:24,809 --> 00:01:25,157 哈喽 46 00:01:25,169 --> 00:01:25,637 大家好 47 00:01:25,768 --> 00:01:26,777 我是王利杰 48 00:01:27,008 --> 00:01:29,777 今天这期内容信息密度会非常高 49 00:01:30,048 --> 00:01:32,377 Karpathy在这场峰会上的访谈 50 00:01:32,449 --> 00:01:33,678 我反复看了好几遍 51 00:01:34,089 --> 00:01:35,167 越看越觉得 52 00:01:35,169 --> 00:01:38,738 他在描述一件我们大多数人还没意识到的事 53 00:01:39,672 --> 00:01:41,472 他说的不是AI又进步了 54 00:01:41,472 --> 00:01:43,242 不是写代码又变快了 55 00:01:43,353 --> 00:01:44,311 他说的是 56 00:01:44,312 --> 00:01:46,642 一种全新的计算机正在诞生 57 00:01:47,073 --> 00:01:48,552 不是更快的计算机 58 00:01:48,552 --> 00:01:50,162 不是更智能的软件 59 00:01:50,552 --> 00:01:53,002 而是跟我们过去七十年用的东西 60 00:01:53,112 --> 00:01:56,041 在本质上完全不同的计算范式 61 00:01:56,392 --> 00:01:58,841 他把它叫做Software 3 0 62 00:01:59,713 --> 00:02:00,822 要理解3 0 63 00:02:01,114 --> 00:02:03,602 得先回头看1 0和2 0 64 00:02:04,034 --> 00:02:05,283 Software 1 0 65 00:02:05,314 --> 00:02:07,683 就是我们最熟悉的传统编程 66 00:02:08,073 --> 00:02:09,063 程序员写代码 67 00:02:09,474 --> 00:02:10,262 告诉计算机 68 00:02:10,673 --> 00:02:11,512 输入A 69 00:02:11,513 --> 00:02:11,903 做B 70 00:02:12,233 --> 00:02:13,123 输出C 71 00:02:13,434 --> 00:02:15,632 每一条规则 每一个分支 72 00:02:15,634 --> 00:02:18,162 都是人类用代码精确定义的 73 00:02:18,393 --> 00:02:19,142 你写什么 74 00:02:19,353 --> 00:02:20,482 它就干什么 75 00:02:20,553 --> 00:02:21,102 不多干 76 00:02:21,393 --> 00:02:22,403 也不少干 77 00:02:23,175 --> 00:02:24,544 Software 2 0 78 00:02:24,654 --> 00:02:27,463 是Karpathy在2017年提出的概念 79 00:02:27,735 --> 00:02:30,503 那时候他在特斯拉负责自动驾驶 80 00:02:30,935 --> 00:02:31,484 他发现 81 00:02:31,854 --> 00:02:34,424 有些问题没法用规则穷举 82 00:02:34,814 --> 00:02:37,503 比如让车识别一个行人 83 00:02:37,895 --> 00:02:38,843 你怎么写规则 84 00:02:39,559 --> 00:02:40,148 两条腿 85 00:02:40,918 --> 00:02:41,507 穿衣服 86 00:02:42,222 --> 00:02:42,667 有头 87 00:02:43,679 --> 00:02:45,347 那骑自行车的算不算 88 00:02:45,999 --> 00:02:46,787 撑伞的呢 89 00:02:47,358 --> 00:02:48,907 蹲下来系鞋带的呢 90 00:02:49,679 --> 00:02:52,007 规则写到天亮都写不完 91 00:02:52,478 --> 00:02:53,548 2 0的做法是 92 00:02:53,879 --> 00:02:55,287 你不写规则了 93 00:02:55,638 --> 00:02:57,967 你给机器大量的标注数据 94 00:02:58,078 --> 00:03:01,407 让神经网络自己从数据里学出规则 95 00:03:01,758 --> 00:03:03,048 编程的本质 96 00:03:03,119 --> 00:03:07,127 变成了准备数据集和设计训练目标 97 00:03:07,680 --> 00:03:09,709 那Software 3 0呢 98 00:03:10,321 --> 00:03:13,329 3 0的编程方式变成了说话 99 00:03:13,761 --> 00:03:14,790 你不写代码了 100 00:03:14,960 --> 00:03:16,730 也不准备数据集了 101 00:03:17,081 --> 00:03:18,869 你跟一个大语言模型说 102 00:03:19,441 --> 00:03:21,850 帮我把这个菜单上的菜画出来 103 00:03:22,240 --> 00:03:23,549 模型理解你的意思 104 00:03:23,960 --> 00:03:25,010 然后执行 105 00:03:25,520 --> 00:03:29,290 你的上下文窗口里塞进去的信息和指令 106 00:03:29,361 --> 00:03:32,010 就是你撬动这个解释器的杠杆 107 00:03:32,481 --> 00:03:35,369 这个解释器就是大语言模型本身 108 00:03:35,840 --> 00:03:37,290 它理解上下文 109 00:03:37,361 --> 00:03:39,570 在信息空间里执行计算 110 00:03:39,641 --> 00:03:41,089 然后给出结果 111 00:03:41,474 --> 00:03:43,364 Karpathy说这不是隐喻 112 00:03:43,514 --> 00:03:45,283 这就是正在发生的事 113 00:03:45,474 --> 00:03:47,964 他举了另一个更贴近日常的例子 114 00:03:48,155 --> 00:03:50,443 有一个开源工具叫OpenClaw 115 00:03:50,514 --> 00:03:52,270 就是我之前一期节目讲过的 116 00:03:52,270 --> 00:03:54,244 那个奥地利程序员的项目 117 00:03:54,435 --> 00:03:55,383 按传统思维 118 00:03:55,674 --> 00:03:56,913 你要安装软件 119 00:03:56,914 --> 00:03:58,503 应该有个安装脚本对吧 120 00:03:58,995 --> 00:03:59,873 但问题是 121 00:03:59,875 --> 00:04:03,883 不同操作系统 不同硬件配置 不同的软件环境 122 00:04:03,914 --> 00:04:06,193 这个安装脚本会越写越臃肿 123 00:04:06,194 --> 00:04:07,563 越来越容易出错 124 00:04:07,714 --> 00:04:08,474 本质上 125 00:04:08,474 --> 00:04:11,274 这是因为你还在用Software 1 0的思维 126 00:04:11,275 --> 00:04:14,764 试图把所有安装步骤都精确地写成代码 127 00:04:15,314 --> 00:04:16,644 OpenClaw不这么干 128 00:04:16,914 --> 00:04:18,884 它给你的就是一段文本 129 00:04:19,274 --> 00:04:22,244 你把这段文本复制粘贴给你的AI助手 130 00:04:22,435 --> 00:04:23,514 助手读完之后 131 00:04:23,514 --> 00:04:25,843 会自己检查你的电脑环境 132 00:04:25,995 --> 00:04:27,684 判断需要装什么依赖 133 00:04:27,754 --> 00:04:30,084 然后一步一步把软件装好 134 00:04:30,355 --> 00:04:31,304 过程中出了问题 135 00:04:31,714 --> 00:04:32,754 它自己调试 136 00:04:32,754 --> 00:04:33,723 自己修复 137 00:04:34,194 --> 00:04:35,783 你注意到范式变了没有 138 00:04:36,314 --> 00:04:37,663 以前的编程问题是 139 00:04:37,995 --> 00:04:39,764 我该写什么代码 140 00:04:40,074 --> 00:04:41,673 现在的问题变成了 141 00:04:41,675 --> 00:04:45,204 我该复制粘贴哪段文字给我的AI 142 00:04:45,795 --> 00:04:47,723 这句话听起来像开玩笑 143 00:04:47,874 --> 00:04:50,483 但这就是Software 3 0的日常 144 00:04:51,419 --> 00:04:52,779 理解了这三个阶段 145 00:04:52,779 --> 00:04:54,698 我们再回头看MenuGen的故事 146 00:04:54,700 --> 00:04:56,068 就完全不一样了 147 00:04:56,260 --> 00:04:58,068 Karpathy写那个App的时候 148 00:04:58,180 --> 00:05:00,909 他的脑子还在1 0和2 0的惯性里 149 00:05:01,099 --> 00:05:01,529 他在想 150 00:05:01,859 --> 00:05:04,229 我需要一个前端来上传图片 151 00:05:04,260 --> 00:05:06,068 一个后端来调用API 152 00:05:06,099 --> 00:05:08,258 一个数据库来存用户信息 153 00:05:08,260 --> 00:05:10,029 一个支付系统来收费 154 00:05:10,339 --> 00:05:12,669 他在用老范式思考新问题 155 00:05:13,020 --> 00:05:14,568 而3 0的解法是什么 156 00:05:15,060 --> 00:05:15,909 没有App 157 00:05:16,299 --> 00:05:19,378 只有一句自然语言指令和一张图片进去 158 00:05:19,380 --> 00:05:20,789 一张图片出来 159 00:05:21,020 --> 00:05:22,948 中间不需要任何中介层 160 00:05:24,032 --> 00:05:25,881 这就是为什么Karpathy说 161 00:05:25,912 --> 00:05:28,361 大家需要重新调整自己的思路 162 00:05:28,631 --> 00:05:30,760 不要总是沿着既有范式去想 163 00:05:30,871 --> 00:05:34,441 也不要只把AI理解成把原有的事情做得更快 164 00:05:34,751 --> 00:05:35,910 真正的变化是 165 00:05:35,912 --> 00:05:38,481 现在有很多新的东西变得可行了 166 00:05:38,551 --> 00:05:41,160 而这些东西在旧范式里根本不存在 167 00:05:41,511 --> 00:05:41,700 好 168 00:05:42,071 --> 00:05:43,871 到这里你可能会觉得 169 00:05:43,871 --> 00:05:44,460 挺好的嘛 170 00:05:44,751 --> 00:05:46,080 未来一片光明 171 00:05:46,352 --> 00:05:47,950 但Karpathy接下来说了 172 00:05:47,951 --> 00:05:50,041 一件让所有人不太舒服的事 173 00:05:50,444 --> 00:05:50,793 他说 174 00:05:51,124 --> 00:05:52,283 这些AI模型 175 00:05:52,285 --> 00:05:52,913 不是动物 176 00:05:53,244 --> 00:05:54,174 是幽灵 177 00:05:54,525 --> 00:05:56,913 他之前写过一篇文章叫Animals 178 00:05:57,004 --> 00:05:58,093 vs Ghosts 179 00:05:58,444 --> 00:05:59,814 动物与幽灵 180 00:06:00,564 --> 00:06:02,314 动物的智能是怎么来的 181 00:06:03,009 --> 00:06:03,809 进化 182 00:06:04,124 --> 00:06:05,733 几亿年的自然选择 183 00:06:05,805 --> 00:06:07,733 从单细胞到多细胞 184 00:06:07,764 --> 00:06:10,603 从鱼到爬行动物到哺乳动物 185 00:06:10,605 --> 00:06:12,523 DNA编码了学习算法 186 00:06:12,525 --> 00:06:16,293 然后通过漫长的进化外循环一点一点打磨出来 187 00:06:16,644 --> 00:06:18,033 动物有内在动机 188 00:06:18,244 --> 00:06:18,954 有好奇心 189 00:06:19,165 --> 00:06:20,083 有恐惧 190 00:06:20,084 --> 00:06:20,674 有饥饿 191 00:06:20,925 --> 00:06:22,134 有繁殖驱动 192 00:06:22,444 --> 00:06:24,853 这些东西深深嵌在基因里 193 00:06:25,524 --> 00:06:26,974 AI不是这样来的 194 00:06:27,284 --> 00:06:29,534 AI是在整个互联网的文本上 195 00:06:29,604 --> 00:06:31,733 训练出来的统计仿真电路 196 00:06:32,084 --> 00:06:33,774 它的底座是预训练 197 00:06:33,805 --> 00:06:35,733 就是大规模的模式匹配 198 00:06:36,125 --> 00:06:38,293 然后上面叠加了强化学习 199 00:06:38,365 --> 00:06:40,774 给它装上了一些定向增强的能力 200 00:06:41,204 --> 00:06:42,413 所以Karpathy说 201 00:06:42,445 --> 00:06:44,243 我们不是在制造动物 202 00:06:44,245 --> 00:06:45,974 我们是在召唤幽灵 203 00:06:46,284 --> 00:06:47,274 幽灵有什么特点 204 00:06:47,964 --> 00:06:49,053 参差不齐 205 00:06:49,284 --> 00:06:50,353 英文叫jagged 206 00:06:50,604 --> 00:06:51,654 锯齿状的 207 00:06:51,964 --> 00:06:53,053 同一个模型 208 00:06:53,204 --> 00:06:56,173 你让它重构一个十万行的代码仓库 209 00:06:56,284 --> 00:06:57,694 它干得漂漂亮亮 210 00:06:57,964 --> 00:06:59,673 你让它找零日安全漏洞 211 00:06:59,964 --> 00:07:01,053 它也能找到 212 00:07:01,815 --> 00:07:05,783 但你问它一个问题 我想去五十米外的洗车店洗车 213 00:07:05,935 --> 00:07:07,644 我应该开车还是走路 214 00:07:08,214 --> 00:07:09,723 它会一本正经地告诉你 215 00:07:10,055 --> 00:07:10,853 走路吧 216 00:07:10,855 --> 00:07:12,144 因为距离很近 217 00:07:12,254 --> 00:07:13,014 五十米 218 00:07:13,014 --> 00:07:14,144 走路去洗车 219 00:07:14,454 --> 00:07:16,464 然后你的车还停在原地 220 00:07:16,534 --> 00:07:17,243 你走回来 221 00:07:17,454 --> 00:07:18,704 车还是脏的 222 00:07:18,894 --> 00:07:22,904 一个能处理人类级别复杂工程问题的最先进模型 223 00:07:22,935 --> 00:07:26,303 连洗车要把车开过去这种常识都没有 224 00:07:26,646 --> 00:07:28,696 以前大家最爱举的例子是 225 00:07:28,807 --> 00:07:32,215 草莓这个英文单词strawberry里有几个r 226 00:07:32,487 --> 00:07:34,016 模型经常答错 227 00:07:34,326 --> 00:07:37,295 但这个问题现在已经被打补丁修掉了 228 00:07:37,607 --> 00:07:39,126 洗车店的例子说明 229 00:07:39,126 --> 00:07:41,525 这种参差不齐是结构性的 230 00:07:41,526 --> 00:07:42,735 不是偶然的 231 00:07:42,938 --> 00:07:43,489 为什么 232 00:07:43,700 --> 00:07:46,188 Karpathy给出了一个非常底层的解释 233 00:07:46,539 --> 00:07:50,308 两个变量决定了模型在哪些领域会突然变强 234 00:07:50,780 --> 00:07:52,909 第一个变量是可验证性 235 00:07:53,219 --> 00:07:56,349 模型训练的核心机制是强化学习 236 00:07:56,619 --> 00:07:57,888 做对了给奖励 237 00:07:58,219 --> 00:07:59,469 做错了扣分 238 00:07:59,859 --> 00:08:02,659 但只有结果可以被自动验证的任务 239 00:08:02,659 --> 00:08:05,229 才能有效地放进这个训练循环 240 00:08:05,780 --> 00:08:07,308 数学可以验证 241 00:08:07,659 --> 00:08:08,768 代码可以验证 242 00:08:09,179 --> 00:08:10,989 跑一下就知道对不对 243 00:08:11,340 --> 00:08:13,909 所以模型在这些领域突飞猛进 244 00:08:14,451 --> 00:08:17,420 但开车去洗车店这种常识 245 00:08:17,492 --> 00:08:18,441 怎么自动验证 246 00:08:18,932 --> 00:08:20,001 没有验证环境 247 00:08:20,211 --> 00:08:21,741 就没有训练信号 248 00:08:21,932 --> 00:08:24,741 第二个变量是AI公司关心什么 249 00:08:25,052 --> 00:08:26,741 Karpathy举了个例子 250 00:08:27,011 --> 00:08:29,460 从GPT - 3 5到GPT - 4 251 00:08:29,492 --> 00:08:33,020 很多人觉得模型下国际象棋的能力提升了很多 252 00:08:33,211 --> 00:08:35,941 以为是整体智能变强的自然结果 253 00:08:36,052 --> 00:08:37,340 他说不一定 254 00:08:37,532 --> 00:08:38,240 据他了解 255 00:08:38,571 --> 00:08:40,651 是有人在OpenAI做了决定 256 00:08:40,652 --> 00:08:44,340 把大量国际象棋棋谱数据加进了预训练集 257 00:08:44,611 --> 00:08:45,860 就这一个决定 258 00:08:45,892 --> 00:08:47,931 模型在国际象棋上的表现 259 00:08:47,932 --> 00:08:50,140 就出现了一个巨大的能力峰值 260 00:08:50,772 --> 00:08:53,620 跟其他领域的提升完全不成比例 261 00:08:54,752 --> 00:08:56,600 所以模型的能力地形 262 00:08:56,632 --> 00:08:58,681 不是一个均匀上升的平面 263 00:08:58,752 --> 00:09:02,120 而是一片充满山峰和深谷的崎岖地带 264 00:09:02,752 --> 00:09:06,681 山峰是强化学习和数据集重点覆盖的区域 265 00:09:07,032 --> 00:09:10,360 深谷是数据分布从来没有碰过的盲区 266 00:09:10,912 --> 00:09:13,831 如果你的应用场景刚好站在山峰上 267 00:09:13,831 --> 00:09:15,401 你会觉得AI是神 268 00:09:15,872 --> 00:09:17,431 如果你落在深谷里 269 00:09:17,432 --> 00:09:19,801 你会觉得AI连小学生都不如 270 00:09:20,351 --> 00:09:22,480 这对所有使用AI的人来说 271 00:09:22,512 --> 00:09:24,561 都是一个极其重要的认知 272 00:09:25,032 --> 00:09:27,760 你不能笼统地说AI行还是不行 273 00:09:28,071 --> 00:09:29,100 你必须搞清楚 274 00:09:29,351 --> 00:09:30,870 在你的具体场景里 275 00:09:30,872 --> 00:09:33,041 你站在这片地形的什么位置 276 00:09:33,792 --> 00:09:36,521 如果你不在强化学习覆盖的电路里 277 00:09:36,552 --> 00:09:38,480 你可能需要自己做微调 278 00:09:38,632 --> 00:09:41,401 或者做额外的工程工作来弥补 279 00:09:42,269 --> 00:09:44,697 那人类在这个新世界里还剩下什么 280 00:09:45,188 --> 00:09:48,077 Karpathy引用了一句让他念念不忘的话 281 00:09:48,188 --> 00:09:50,118 我看完也印象极深 282 00:09:50,389 --> 00:09:52,118 你可以外包你的思考 283 00:09:52,149 --> 00:09:54,118 但你不能外包你的理解 284 00:09:54,428 --> 00:09:56,758 他说自己正在变成一个瓶颈 285 00:09:57,029 --> 00:09:59,707 即便只是理解我们到底想构建什么 286 00:09:59,708 --> 00:10:01,237 为什么这件事值得做 287 00:10:01,389 --> 00:10:03,638 我该如何指挥我的AI助手 288 00:10:03,828 --> 00:10:06,638 光是这些事情本身就在成为瓶颈 289 00:10:07,068 --> 00:10:10,118 信息必须以某种方式进入他的大脑 290 00:10:10,188 --> 00:10:12,357 而大脑的带宽是有限的 291 00:10:12,969 --> 00:10:14,567 这也是为什么Karpathy 292 00:10:14,569 --> 00:10:17,297 对一个叫知识库的东西特别兴奋 293 00:10:17,489 --> 00:10:20,338 他做了一个项目叫LLM Wiki 294 00:10:20,368 --> 00:10:22,858 也就是他说的大模型知识库 295 00:10:23,008 --> 00:10:25,338 让大模型读完一堆文档后 296 00:10:25,408 --> 00:10:27,738 自动生成一个结构化的知识库 297 00:10:27,929 --> 00:10:29,618 每当他读一篇文章 298 00:10:29,689 --> 00:10:32,098 知识库会自动更新和重组 299 00:10:32,288 --> 00:10:36,138 然后他可以围绕这些内容提问 追问 深挖 300 00:10:36,408 --> 00:10:37,958 这种工具的本质是什么 301 00:10:38,408 --> 00:10:40,218 不是增强你的产出 302 00:10:40,329 --> 00:10:41,978 而是增强你的理解 303 00:10:42,168 --> 00:10:43,927 因为如果你不理解 304 00:10:43,929 --> 00:10:46,378 你就无法成为一个好的指挥者 305 00:10:46,689 --> 00:10:49,937 大语言模型本身并不擅长真正的理解 306 00:10:50,809 --> 00:10:52,057 你作为一个人类 307 00:10:52,089 --> 00:10:54,608 仍然是系统中那个独一无二的 308 00:10:54,609 --> 00:10:56,138 负责理解的角色 309 00:10:56,413 --> 00:10:58,092 Karpathy在这个访谈里 310 00:10:58,092 --> 00:11:00,021 还说了一个关于未来的预判 311 00:11:00,092 --> 00:11:01,501 我觉得非常大胆 312 00:11:01,656 --> 00:11:02,413 他说 313 00:11:02,413 --> 00:11:06,261 他相信未来会出现完全由神经网络构成的计算机 314 00:11:06,653 --> 00:11:09,621 设备直接接收原始视频和音频输入 315 00:11:09,653 --> 00:11:11,141 送进一个神经网络 316 00:11:11,212 --> 00:11:14,702 然后用扩散模型实时渲染出一个用户界面 317 00:11:14,852 --> 00:11:18,422 这个界面是为当下这个具体时刻 即时生成的 318 00:11:18,895 --> 00:11:21,623 今天的计算机本质上还是计算器 319 00:11:21,895 --> 00:11:22,764 五十年代的时候 320 00:11:23,135 --> 00:11:24,863 人们其实还不确定 321 00:11:24,934 --> 00:11:28,463 计算机到底应该长得像计算器还是像大脑 322 00:11:28,895 --> 00:11:31,103 后来我们选了计算器路线 323 00:11:31,574 --> 00:11:32,823 发展了七十年 324 00:11:32,855 --> 00:11:36,264 就是今天的芯片 操作系统和应用商店 325 00:11:36,775 --> 00:11:39,144 但未来这件事可能要反过来 326 00:11:39,615 --> 00:11:41,664 神经网络变成主进程 327 00:11:41,775 --> 00:11:44,144 传统CPU变成协处理器 328 00:11:44,574 --> 00:11:47,424 神经网络承担绝大部分核心负载 329 00:11:47,735 --> 00:11:51,333 而那些需要一加一精确等于二的确定性计算 330 00:11:51,334 --> 00:11:52,823 变成了附属工具 331 00:11:53,535 --> 00:11:57,823 就像今天GPU已经在很多场景下比CPU更重要了 332 00:11:57,855 --> 00:12:01,264 只是将来这个趋势会推进到一切计算领域 333 00:12:01,374 --> 00:12:04,622 Karpathy还提到了一个很多人没想到的影响 334 00:12:04,622 --> 00:12:05,398 招聘 335 00:12:05,774 --> 00:12:09,622 他说现在大多数公司想招厉害的AI工程师 336 00:12:09,813 --> 00:12:12,543 但面试方式还停留在旧范式 337 00:12:12,854 --> 00:12:14,222 出一道小谜题 338 00:12:14,293 --> 00:12:16,942 让候选人在白板上写算法 339 00:12:17,293 --> 00:12:18,362 这是在考什么 340 00:12:18,894 --> 00:12:19,643 考记忆力 341 00:12:20,014 --> 00:12:21,982 考手写代码的熟练度 342 00:12:22,414 --> 00:12:25,372 但这些能力在Software 3 0时代 343 00:12:25,374 --> 00:12:26,742 几乎没有价值 344 00:12:27,791 --> 00:12:29,879 他建议面试应该变成这样 345 00:12:30,031 --> 00:12:31,879 给候选人一个大项目 346 00:12:31,911 --> 00:12:34,670 比如用AI写一个完整的社交平台 347 00:12:34,671 --> 00:12:35,999 然后部署上线 348 00:12:36,511 --> 00:12:39,639 接下来公司放十个AI去攻击这个平台 349 00:12:39,710 --> 00:12:40,960 试图把它搞崩 350 00:12:41,271 --> 00:12:42,899 看候选人怎么用工具 351 00:12:43,191 --> 00:12:44,479 怎么组织架构 352 00:12:44,511 --> 00:12:48,759 怎么在AI的帮助下构建出一个既强大又安全的系统 353 00:12:49,151 --> 00:12:51,519 考的不再是你能不能写代码 354 00:12:51,590 --> 00:12:55,119 而是你能不能指挥AI做出真正靠谱的东西 355 00:12:55,911 --> 00:12:57,700 这背后隐含的信号是什么 356 00:12:58,271 --> 00:13:01,440 连评判人才的标准都在被重新定义 357 00:13:02,317 --> 00:13:03,806 听到这你可能想问 358 00:13:03,917 --> 00:13:05,625 那人类现在到底该怎么办 359 00:13:06,197 --> 00:13:07,846 Karpathy的回答很务实 360 00:13:07,981 --> 00:13:08,780 他说 361 00:13:08,797 --> 00:13:11,885 目前AI还是一个能力很尖锐的实习生 362 00:13:11,957 --> 00:13:13,556 有时候表现惊艳 363 00:13:13,557 --> 00:13:15,446 有时候犯很蠢的错误 364 00:13:15,688 --> 00:13:17,978 他用MenuGen举了一个真实的bug 365 00:13:18,089 --> 00:13:19,978 用户用谷歌账号注册 366 00:13:20,048 --> 00:13:22,538 但买积分走的是Stripe支付 367 00:13:22,688 --> 00:13:24,697 两边系统都有邮箱地址 368 00:13:24,729 --> 00:13:26,618 AI在写代码的时候 369 00:13:26,688 --> 00:13:29,207 直接拿两边的邮箱地址去做匹配 370 00:13:29,209 --> 00:13:31,697 把支付跟用户关联起来 371 00:13:31,808 --> 00:13:32,398 问题是 372 00:13:32,648 --> 00:13:35,087 你完全可能谷歌用一个邮箱 373 00:13:35,089 --> 00:13:36,618 支付用另一个邮箱 374 00:13:36,688 --> 00:13:37,478 一旦不一样 375 00:13:37,688 --> 00:13:39,898 系统就把你的钱搞丢了 376 00:13:40,009 --> 00:13:41,888 因为AI根本没有意识到 377 00:13:41,889 --> 00:13:45,728 应该用一个统一的用户ID来绑定所有系统 378 00:13:45,729 --> 00:13:48,898 而不是用邮箱这种随意的信息做关联 379 00:13:49,528 --> 00:13:50,528 这种错误 380 00:13:50,528 --> 00:13:53,538 一个有经验的工程师一眼就能看出来 381 00:13:53,808 --> 00:13:55,297 但AI看不出来 382 00:13:55,648 --> 00:13:59,057 它只是在预测下一个最可能的代码片段 383 00:13:59,369 --> 00:14:02,097 不是在理解系统设计的本质逻辑 384 00:14:02,527 --> 00:14:03,816 所以Karpathy说 385 00:14:04,007 --> 00:14:06,326 人仍然必须负责规格 386 00:14:06,326 --> 00:14:07,365 负责计划 387 00:14:07,367 --> 00:14:08,235 负责品味 388 00:14:08,446 --> 00:14:09,536 负责判断 389 00:14:09,806 --> 00:14:12,335 AI负责在这个框架内填空 390 00:14:12,806 --> 00:14:13,796 人是建筑师 391 00:14:14,127 --> 00:14:15,576 AI是施工队 392 00:14:16,007 --> 00:14:18,855 但他紧接着说了一句让我脊背发凉的话 393 00:14:18,970 --> 00:14:19,771 他说 394 00:14:19,966 --> 00:14:23,936 没有什么根本性的东西阻止AI在这些方面继续进步 395 00:14:24,326 --> 00:14:27,135 品味 判断 审美这些东西 396 00:14:27,287 --> 00:14:28,975 目前之所以还不行 397 00:14:29,086 --> 00:14:31,326 可能只是因为AI公司还没有 398 00:14:31,326 --> 00:14:34,215 把它们放进强化学习的训练环境里 399 00:14:34,486 --> 00:14:37,896 还没有人去构建专门训练品味的奖励函数 400 00:14:38,887 --> 00:14:40,335 一旦他们找到办法 401 00:14:40,367 --> 00:14:42,686 这些能力也会像代码能力一样 402 00:14:42,686 --> 00:14:43,696 出现飞跃 403 00:14:44,366 --> 00:14:45,735 他还举了一个例子 404 00:14:45,927 --> 00:14:48,495 他做了一个叫microGPT的项目 405 00:14:48,567 --> 00:14:52,296 目标是把大语言模型的训练过程简化到极致 406 00:14:52,687 --> 00:14:55,015 但模型非常抗拒这件事 407 00:14:55,167 --> 00:14:58,336 他反复提示AI去简化 去精炼 408 00:14:58,407 --> 00:14:59,735 AI就是做不到 409 00:14:59,886 --> 00:15:01,395 那种感觉就像拔牙 410 00:15:01,687 --> 00:15:03,296 而不是光速前进 411 00:15:03,567 --> 00:15:06,096 因为简洁和优雅这种审美 412 00:15:06,167 --> 00:15:08,895 根本不在模型的强化学习电路里 413 00:15:09,167 --> 00:15:11,296 但这不代表它永远做不到 414 00:15:11,687 --> 00:15:15,015 只是还没有人专门去训练这个能力而已 415 00:15:15,967 --> 00:15:18,576 所以我们面对的局面是这样的 416 00:15:18,886 --> 00:15:21,736 一种全新的计算范式正在诞生 417 00:15:22,126 --> 00:15:23,635 编程不再是写代码 418 00:15:23,886 --> 00:15:24,895 而是说话 419 00:15:25,246 --> 00:15:27,135 App不再是必需品 420 00:15:27,327 --> 00:15:31,415 很多场景下一句自然语言就能替代一整个应用 421 00:15:31,967 --> 00:15:33,515 AI的能力参差不齐 422 00:15:33,927 --> 00:15:35,086 像幽灵一样 423 00:15:35,087 --> 00:15:36,566 在某些领域超人 424 00:15:36,567 --> 00:15:39,096 在另一些领域连常识都没有 425 00:15:39,447 --> 00:15:40,876 人类最后的护城河 426 00:15:41,207 --> 00:15:42,126 不是技能 427 00:15:42,126 --> 00:15:43,175 不是知识 428 00:15:43,207 --> 00:15:44,555 甚至不是思考能力 429 00:15:44,727 --> 00:15:45,775 而是理解 430 00:15:46,126 --> 00:15:47,956 但这个护城河能守多久 431 00:15:48,687 --> 00:15:52,535 Karpathy说品味和判断只是还没被训练到 432 00:15:53,286 --> 00:15:54,246 这意味着 433 00:15:54,246 --> 00:15:58,336 留给人类的窗口期可能比我们以为的要短得多 434 00:15:58,882 --> 00:16:00,172 作为一个投资人 435 00:16:00,283 --> 00:16:02,291 我看到的是这样一幅图景 436 00:16:02,602 --> 00:16:04,491 过去我们投资一家公司 437 00:16:04,642 --> 00:16:06,452 核心看它的技术壁垒 438 00:16:06,803 --> 00:16:08,052 现在的问题是 439 00:16:08,122 --> 00:16:11,852 技术壁垒正在以前所未有的速度被侵蚀 440 00:16:12,242 --> 00:16:16,651 一个人用几句话就能让AI做出一个完整的产品原型 441 00:16:17,083 --> 00:16:18,432 那真正的壁垒在哪 442 00:16:19,002 --> 00:16:21,531 也许就在Karpathy说的那个词里 443 00:16:21,666 --> 00:16:22,467 理解 444 00:16:23,175 --> 00:16:24,903 对行业的深刻理解 445 00:16:25,214 --> 00:16:26,863 对用户的深刻理解 446 00:16:27,214 --> 00:16:30,224 对什么值得做 什么不值得做的深刻理解 447 00:16:30,575 --> 00:16:33,263 这些是AI目前还给不了你的 448 00:16:33,494 --> 00:16:34,243 但问题是 449 00:16:34,614 --> 00:16:36,724 你有没有在真正地去理解 450 00:16:37,094 --> 00:16:39,724 还是你也在把理解外包给AI 451 00:16:40,374 --> 00:16:40,844 这个问题 452 00:16:41,134 --> 00:16:42,103 我留给你 453 00:16:42,214 --> 00:16:42,883 我是王利杰 454 00:16:43,175 --> 00:16:44,353 我们下期见