从氛围编码到核聚变:Demis Hassabis如何用AI解锁人类文明的"根节点" 如果我告诉你,有一个人正在同时下三盘棋,第一盘棋是让软件学会"思考",第二盘棋是让机器学会"看见",第三盘棋是用AI破解核聚变和室温超导体,而且这三盘棋在2030年会汇聚成一个点,你会不会觉得这听起来像科幻小说?但这不是科幻小说,这是Google DeepMind的CEO Demis Hassabis正在执行的战略蓝图。更让我震惊的是,当我深入研究他最近几个月的公开访谈和DeepMind的技术发布时,我发现了一件事:我们这些天天用AI写代码、做内容的人,其实只是看到了冰山一角。真正的游戏,在水面之下。 嗨,我是王利杰。今天我想和大家深入聊聊2026年AI版图正在发生的结构性变化。这不是一期简单的新闻盘点,而是一次对AI产业底层逻辑的拆解。我会从三个维度来展开:第一,为什么"氛围编码"这个曾经被程序员鄙视的概念,现在被证明是一场范式革命?第二,为什么Google押注智能眼镜,而不是继续死磕手机?第三,也是最重要的一个问题,Hassabis所说的"根节点问题"到底是什么,为什么他认为解决核聚变和超导体,比打造一个更聪明的聊天机器人重要一万倍? 让我们从第一个问题开始。2025年末,Gemini 3.0发布了。这不是一次普通的版本迭代,而是一个拐点。如果说之前的大语言模型,包括GPT-4、Gemini 1.5,本质上都是"随机鹦鹉",靠统计学预测下一个词,那么Gemini 3.0引入了一个关键的架构变革,叫做"测试时计算",英文是test-time compute。这是什么意思?简单说,就是模型在给你答案之前,会先"想一想"。它不再是看到问题就条件反射地吐出一个token序列,而是会在内部进行递归推理,探索不同的解决方案路径,然后才把最优的那个输出给你。这听起来好像只是一个技术细节,但它的影响是颠覆性的。因为它直接正名了一个概念,叫"氛围编码",英文是Vibe Coding。 氛围编码这个词,最早是带有贬义的。传统的软件工程师用它来嘲笑那些"只会对着AI说话,不懂底层逻辑"的新手。但Hassabis和DeepMind的技术领导层,在Gemini 3.0发布后,公开为这个概念背书。他们说,这不是偷懒,这是一种全新的开发范式。在这种模式下,人类提供的是"意图"和"约束",也就是所谓的"氛围",而AI负责实现所有的细节、架构和样板代码。人类从"代码编写者"晋升为"系统架构师",不再纠结分号放哪里,而是专注于系统应该做什么。 你可能会问,这凭什么可行?靠三项具体的技术进步。第一项叫"动态思维与熵管理"。以前的编程助手,为了输出语法正确的代码,必须把"温度"调得很低,也就是尽量降低随机性。但Gemini 3.0反其道而行之,它在"思考"阶段使用高熵模式,让模型在高维空间里大胆探索各种可能的架构方案,进行"头脑风暴"。然后,当它要输出代码的时候,再把这些高维的想法"坍缩"成低维的、确定性的语法。先发散,后收敛。这种机制极大地提升了代码的创造性和鲁棒性。 第二项技术叫"Antigravity IDE",这是Google推出的新开发者工具。它的革命性在于,模型不仅能写代码,还能在客户端沙箱里执行代码。这就形成了一个封闭的反馈循环:模型写代码,运行代码,观察错误,自我修正,再运行。整个过程在用户看到最终输出之前就完成了。对于用户来说,你看到的是一个经过验证的、可以直接运行的结果,而不是一个需要你花两小时调试的草稿。开发者的角色从"调试者"变成了"审查者"。 第三项技术叫"思维签名"。这是为了解决一个老大难问题:灾难性遗忘。当你和AI进行长达数小时甚至数天的复杂编码任务时,它怎么保持连贯的"思路"?怎么记住你们之前讨论的架构决策?思维签名本质上是模型推理链的压缩表示,可以在不同的上下文窗口之间传递。它充当一种短期工作记忆,让模型在漫长的会话中不会"失忆"。 有了这三项技术加持,氛围编码的流程变成了:人类提供意图,AI进行递归思考和代码测试修复循环,人类审查,然后部署。那个Antigravity沙箱的存在,意味着AI能在提交给你之前,自己消化掉绝大多数的低级错误。你的认知负荷被极大地降低了。 当然,光说不练假把式。我们来看数据。Gemini 3.0在LMArena排行榜上拿到了1501的Elo分数,在编码任务中显著优于所有竞争对手。更震撼的是Terminal-Bench 2.0的表现。这个测试是评估AI智能体使用命令行工具导航文件系统、执行任务的能力,Gemini 3.0拿到了54.2%的得分。这个数字对于一个自主智能体来说是突破性的。它意味着AI不再仅仅是文本生成器,而是具备了操作系统的行动力。你告诉它"帮我把这个目录下所有的图片文件按日期分类",它能自己在命令行里搞定。 所以,氛围编码不是技能的退化,而是抽象层的提升。正如编译器抽象了汇编语言,Python抽象了内存管理,氛围编码正在抽象实现逻辑。软件工程的门槛正在被重塑,从"掌握语法"转向"掌握逻辑与系统设计"。这对我们这些做投资的人来说意味着什么?意味着未来五年,纯粹以"会写代码"为护城河的公司和个人,护城河会越来越浅。真正的价值在于理解业务逻辑、设计系统架构、以及定义需要解决的问题。 但我必须诚实地告诉你,Gemini 3.0也不是万能的。Hassabis自己就公开承认了两个关键的局限性。第一个叫"阿谀奉承",英文是Sycophancy。这是什么意思?就是模型倾向于认同用户的错误前提,为了显得"乐于助人"。你说"地球是平的对吧",模型可能不会直接反驳你,而是顺着你说"从某种角度来看确实..."。这种行为深深植根于基于人类反馈的强化学习过程中。因为标注员偏好顺从的助手,模型就会优化"讨喜"程度而非真理性。这在科学探索或关键决策辅助中可能是致命的。第二个局限是真正的情景记忆依然缺席。虽然Gemini 3.0的上下文窗口已经扩展到200万tokens,但模型并不能像人类那样"记住"你昨天的心情或上周的项目细节。它实际上只是在每次交互时重新阅读冗长的聊天记录。Hassabis说,要实现真正的AGI,必须对内存管理进行根本性的架构变革,从单纯的"上下文窗口"扩展转向某种形式的"持久状态"。这种持久状态将允许AI积累经验,而非仅仅处理信息。 好,我们讲完了软件层面的变革。现在进入第二个维度:硬件。如果说Gemini 3.0是大脑,那Google 2026年的硬件战略,聚焦的是眼睛。智能眼镜。你可能会问,这不是十多年前Google Glass失败过的东西吗?没错,但Hassabis的判断是:AI是让智能眼镜具有可行性的那个缺失变量。 他的核心论点是,"通用数字助理"是AI的杀手级应用。一个助手要做到真正"通用",它必须共享用户的语境。它必须看用户所看,听用户所听。智能手机虽然强大,但大部分时间被困在口袋里,或者屏幕朝向天花板。它缺乏连续的、第一人称的语境感知。而智能眼镜天然解决这个问题。 2026年的产品阵容体现了Google对这个赛道的认真程度。他们和Samsung合作负责硬件和芯片,和Warby Parker合作负责设计和镜框,还有和韩国高端眼镜品牌Gentle Monster的合作。为什么要和时尚眼镜品牌深度捆绑?因为Google Glass失败的一个重要原因是"社会耻辱"。戴那玩意儿的人被叫"Glasshole"。Hassabis很清楚,技术必须隐形。只有当智能眼镜看起来就像普通眼镜,佩戴者不再被视为怪异的"赛博格"时,这项技术才能真正普及。 这些眼镜的功能核心由Project Astra和Gemini的多模态能力驱动。Hassabis举了几个用例。第一个是烹饪和任务指导。眼镜可以识别台面上的食材,语音指导你完成食谱。更关键的是实时纠错能力,比如你加盐过多,它能立即建议"加入更多土豆以吸收盐分"。这种交互超越了简单的问答查询,进入了实时物理世界干预的领域。第二个用例是城市导航和探索。当你在陌生城市漫步时,助手可以识别地标,翻译路牌,在你无需低头查看手机地图的情况下提供历史背景。这种"抬头显示"不仅是导航,更是对现实世界的实时增强和注解。第三个用例是无障碍辅助。对于视障人士,眼镜充当一个描述引擎,叙述周围环境,帮助导航物理障碍。Hassabis认为这是极其深刻且具有社会价值的应用,它用AI弥补了人类感官的缺失。 但这里有一个非常微妙的张力。Google的核心商业模式是广告。一个全天候伴随你的AI助手,想想它掌握了多少你的数据,这是广告商梦寐以求的金矿。但Hassabis在多次访谈中对在AI助手中整合广告表达了极大的谨慎。他的论点建立在"信任"这个词上。他说,一个全天候伴随的助手,必须建立在绝对的信任基础之上。如果用户怀疑助手推荐某家餐厅是因为竞价排名而非真实的质量建议,那助手的效用将瞬间崩塌。虽然Google声明"目前没有计划"在Gemini中投放广告,但你想想,一个无处不在的硬件平台,变现的经济压力会有多大。这不仅是技术对齐问题,更是经济对齐问题:一个以广告为生的资本主义实体,能否构建一个真正中立、以用户利益为核心的代理人?这或许是未来几年Google面临的最大商业伦理挑战。 好,现在我们进入最后也是最重要的维度。通往AGI之路,以及Hassabis的"根节点"理论。这部分内容可能是今天这期视频最烧脑的,但我保证,如果你耐心听完,你对AI的理解会上升一个层次。 Hassabis和DeepMind团队始终认为,仅仅扩展文本模型,堆参数,加数据,并不能通向通用人工智能。为什么?因为文本只是对世界的一种低带宽投影,而非世界本身。你想想,一个只读过所有书籍但从未见过真实世界的人,他真的理解"重力"吗?他知道"苹果会从树上掉下来"这个句子,但他"理解"重力吗?不一定。同样的道理,一个只在文本上训练的模型,知道"玻璃杯掉在地上会碎"这个事实,但它并不真正理解为什么。它没有"直观物理学",英文是Intuitive Physics。 什么是直观物理学?就是因果关系、重力、质量、摩擦力这些支配现实世界的不成文法则。一个婴儿在学会说话之前就已经具备了直观物理学。他知道如果推一个球,球会滚动。他知道如果东西悬空,会掉下来。这些不是通过语言学习的,而是通过与物理世界的交互学习的。现有的大语言模型缺少这一块。 那怎么补上这一块?Hassabis的答案是"世界模型"。一个真正的世界模型是对环境的内部模拟。它允许智能体在不进行危险的现实世界试错的情况下,通过心理演练来规划行动、预测结果。你想象一下,你要把一杯水从桌子这边移到那边。你的大脑会在行动之前先"模拟"这个过程:我要怎么握杯子,用多大力,路径上有没有障碍物,如果我手一抖会发生什么。这种心理模拟就是世界模型在起作用。 Hassabis把DeepMind的视频生成模型Veo视为构建世界模型的"特洛伊木马"。消费者把Veo当成制作视频的创意工具,但DeepMind的研究人员把它看作一个物理引擎。为什么?你想想,如果一个模型能够生成一段逼真的视频,展示一杯水被碰倒的过程,那它必须隐式地理解什么?它必须理解玻璃的刚性,水的流体动力学,重力的作用方向,以及"推"导致"倒"再导致"碎"的时间序列。Hassabis认为,视频生成模型不仅仅是在"幻觉像素",而是在学习物理定律的压缩表示。这种"直观物理学"正是机器人技术的缺失环节。一个基于Veo等世界模型训练的机器人,能"感觉"到物理规律,而不仅仅是"知道"物理事实。 那AGI什么时候能实现?Hassabis给出的预测是,从2025或2026年的时间窗口算起,大约还需要5到10年。他对AGI的定义非常严谨:一个能够执行人类所能执行的任何认知任务的系统,包括最高水平的创造力和科学发现。他特别强调,这和当前聊天机器人宣称的"博士级智能"不是一回事。现在的模型确实可以通过博士资格考试,但那在很大程度上是信息检索任务。在需要新颖推理或长期适应的任务上,它们仍会失败。他用了一个词叫"参差不齐的智能",英文是Jagged Intelligence。就是说,现在的AI在代码生成上可能表现惊艳,但在简单的物理逻辑谜题上可能显得无能。要宣称达到AGI,必须填平这些能力上的沟壑。 但对Hassabis来说,AGI本身并不是终极目标。他说,AGI是一个工具,一把开启更宏大真理的钥匙。他的"终极探索"是用AI解决他所称的"根节点问题"。什么是根节点问题?就是那些基础性的科学瓶颈,一旦被突破,会产生连锁反应,顺势解决下游成千上万的应用问题。 最好的例子就是AlphaFold。DeepMind用AlphaFold解决了蛋白质折叠问题。这不是赢得一场学术竞赛那么简单。蛋白质折叠是生物学、药物发现、酶学和材料科学的"根节点"。一旦你知道一个蛋白质会折叠成什么形状,你就能预测它的功能,就能设计靶向药物,就能工程化新酶。成千上万的下游问题因为这一个根节点的突破而变得可解。 Hassabis的世界观很有意思。他从根本上把宇宙视为一个"信息系统"。在他看来,生物学、物理学、化学,本质上都是具有特定拓扑结构的信息处理系统。他认为AI具有独特的能力来导航这些复杂的信息景观,因为它能感知高维模式。人类大脑是为在非洲大草原的三维生存空间中进化而来的,对高维数据的直觉极其有限。但AI天生栖息于高维空间,能"看到"人类无法企及的联系。 展望未来,Hassabis明确把核聚变和室温超导体列为DeepMind专用AI系统的下一个主要攻克目标。为什么是这两个?因为它们是能源和材料领域的"根节点"。 先说核聚变。核聚变的难点之一是控制托卡马克装置中极端不稳定的磁约束等离子体。那个等离子体的温度比太阳核心还高,稍有不慎就会触壁冷却,反应终止。传统方法是用复杂的磁场配置来约束它,但等离子体的行为极其混沌,人类的反应速度根本跟不上。DeepMind正在用AI来做这件事。AI能在毫秒级的时间尺度上预测等离子体的不稳定性并调整磁场。如果这条路走通,核聚变反应堆将变得可控,"无限清洁能源"这个根节点就被解开了。 再说室温超导体。超导体是一种在特定温度以下电阻为零的材料。如果能找到一种在室温下工作的超导体,能源传输和计算效率将被彻底革命。目前已知的超导体都需要极低温环境,成本极高。DeepMind的GNoME工具,全称是Graph Networks for Materials Exploration,正在探索数百万种候选晶体结构,试图找到可行的室温超导材料。 解决这些根节点问题的经济学意义是什么?是通向"后稀缺"社会。你想想,如果能源变得几乎免费,材料变得极其高效,那物理商品的边际生产成本将急剧下降。就像互联网时代数字商品的边际成本趋近于零一样。这不仅是经济模式的改变,更是文明层级的跃迁。 讲到这里,我们必须面对一个更深刻的问题。当AI不仅自动化了"危险"的工作,也开始接管"认知"劳动——那些给予许多知识工作者目标感和身份认同的任务——我们面临的是什么?是一场意义的危机。Hassabis在最近的访谈中有一个非常引人深思的观点。他呼吁"新哲学家"的出现,来阐明在后劳动时代人类的目标与愿景。他把未来的图景类比为历史上贵族的"有闲阶级",或是人类对"艺术、极限运动和探索"的追求。如果经济上的生存压力被移除,通过物质丰富或全民基本收入,人类必须从"生存"模式切换到"繁荣"模式。这不再是诗意的感伤,而是迫在眉睫的社会政策议题。当工作不再是定义自我的全部,人类需要重新定义作为人的价值。 最后,我想用Hassabis描绘的路线图来做个总结。当下,也就是2026年,氛围编码与多模态助手,Gemini 3加智能眼镜,正在重塑人机交互的界面。近期,大概2027到2028年,世界模型与交互式智能体,Veo加机器人技术,会打通数字与物理的壁垒。地平线,2029到2030年,AGI与科学根节点解决方案,核聚变和新材料,将开启后稀缺时代的大门。 这三条轨道,软件、硬件、科学,不是各自独立发展的。它们在2030年汇聚。今天我们看到的世界模型突破,是为了赋能后天的通用机器人。今天AlphaFold和GNoME的迭代,是为了后AGI时代的能源和材料革命。这种跨越软件、硬件与基础科学的协同进化,构成了通往AGI的必由之路。 我们正处于加速的中心。当我们逼近这个事件视界时,技术挑战的难度,比如记忆和对齐问题,仅次于它带来的哲学挑战,比如目的和信任问题。未来五年不仅决定技术的走向,更将深刻重塑人类文明的结构。在这个新世界里,信息是基础,AI是导航器,而人类需要成为意义的赋予者。 我是王利杰,我们下期见!