这是Jeff Dean 挥别谷歌后的首次公开亮相,也是他向 AI 下一个十年交出的第一份“投名状”。
钛媒体注: 宣布离职Google 仅仅48小时后,8月7日,这位前 Google 首席科学家 Jeff Dean便以创业者身份站在了斯坦福纪念礼堂的舞台中央,出席AASF 2026 前沿与先锋峰会的开幕对谈。
这是Jeff Dean 挥别老东家后的首次公开亮相,也是他向 AI 下一个十年交出的第一份“投名状”。
这场首秀的舞台规格极高——由亚裔美国学者论坛(AASF)联合斯坦福亚裔美国研究中⼼主办、胡佛研究所协办的AASF2026前沿与先锋峰会,堪称“众神云集”:除 Jeff Dean 外,现场还汇聚了“AI 教母”李飞飞、菲尔兹奖得主陶哲轩,以及朱棣文、丁肇中等五位诺贝尔奖得主。在如此史诗级的学术阵容中,Jeff Dean 的这场对谈依然是焦点中的焦点。
而与Jeff Dean对谈的主持人同样极具话题度:UC Berkeley 教授、刚刚宣布出任 Meta Superintelligence Labs AI 研究副总裁的 Dawn Song。 一位刚刚转身离开全球最大的模型巨头,一位刚刚加入全球最大的科技平台之一——这场“双向奔赴”的对话,本身就折射出当前 AI 人才流动的最强震感。
在这场对话中, Jeff Dean 难得地复盘了从 MapReduce、TensorFlow 到 Gemini 的技术脉络,并首次完整阐述了新公司 Discovery Loop 的构想。 他用自己的方法论为“AI for Science”赛道加码:判断技术价值要看“10倍提升”而非百分比,寻找问题要瞄准“五个已知苗头加两个未知挑战”。
这不仅是个人的告别与出发,更是产业变革的缩影: 当基础设施走向标准化,顶尖科学家正从大厂溢出,以更聚焦的创业团队,去博取下一个数量级的科学突破。
以下是这场对话的详细记录,转载自微信公众号 硅谷未来在线, 内容有删节。
⼀、MoE 的原始直觉: “看到10x,你就知道这事成了”
对谈从⼀段回忆开场。2017 年前后,Jeff Dean 在ICLR 会场兴奋地向Dawn Song 介绍⾃⼰刚完成的⼀项⼯作⸺那篇MoE(混合专家模型)的开⼭之作。彼时没有多少⼈预⻅到,这个架构⽇后会成为⼏乎所有前沿⼤模型的底层选择。
Jeff这样描述当年的直觉:你想要⼀个容量极⼤的模型,记住海量的知识;但你⼜希望它⾼效,每次只激活对当前任务最有⽤的那⼀部分。“就像⼈脑⸺欣赏莎⼠⽐亚⼗四⾏诗的脑区,和开⻋时听到垃圾⻋倒⻋警报的脑区,不会同时点亮。”
真正让团队确信这条路⾛得通的,是⼀个数字:在内部实验中,MoE 带来了约10 倍的训练算⼒/质量⽐提升。“当你看到10x 量级的改善,你就知道,这事成了。”
这是Jeff 整场对谈反复出现的思维底⾊:不靠信念驱动判断,靠数量级驱动判断。
⼆、TensorFlow 的复盘: 做对了抽象,做错了⽣态
Jeff罕⻅地公开复盘了TensorFlow 的得与失。
做对的核心只有一件事:解耦。所谓解耦,就是把”想模型的人”和”管机器的事”分开。在那之前,研究者脑中有一个漂亮的模型还不够,还得亲自操心它怎么拆分到一百台机器、五百块 GPU 上运行——好比厨师想炒一道菜,却还得先自己搭灶台、接煤气。TensorFlow 用”计算图”这层统一抽象把两件事隔开:研究者只需描述”我要一个什么样的模型”,框架负责让它在硬件上跑起来。再加上开源,深度学习的门槛第一次降到了全球研究者都够得着的高度。
做错的有两件,也很具体。其一,早期没有做 eager execution(即时执行)——简单说,就是写一行代码立刻看到一行结果、随时可以调试的模式。TensorFlow 起初要求先把整张”图”搭完才能运行,开发体验不够友好,这一点后来被其他框架证明是更好的选择。其二,开源时设了一个 contrib 目录,任何人都能往里贡献代码库,结果”同一件事出现了十种做法”,反而把用户搞糊涂了。Jeff 的总结是:“应该保持核心的干净,让生态长在外面,而不是长在里面。”
对做平台和开发者工具的创业公司,这两条教训今天依然适用:好的抽象,要替用户挡掉复杂性;好的生态,要有清晰的边界——热闹可以在外面,核心必须保持简洁。
三、Gemini 的起点: ⼀⻚memo
谈到Gemini,Jeff 透露了⼀个细节。当年Google Brain、DeepMind 和Google Research 各⾃都在朝相似的⽅向推进⸺扩⼤模型规模、探索多模态。“我写了⼀⻚memo:这太傻了,我们应该合起来⼲。“于是各团队的⼈才、想法与算⼒被整合到⼀个项⽬⾥,他与Oriol Vinyals 出任联合技术负责⼈。
他认为Gemini 最正确的决定,是从第⼀天就坚持原⽣多模态⸺⽂本、代码、图像、视频、⾳频同时进⼊训练,甚⾄加⼊了少量激光雷达数据,“让模型⾄少知道这种数据形态的存在”。⽽最⼤的遗憾,是早期对编程能⼒的投⼊滞后了。他补充了⼀个重要观察:补强coding 的过程带来了意外的副产品⸺模型的推理能⼒、把复杂问题拆解为⼦问题的能⼒,会随编程能⼒同步提升。这也解释了过去两年各家前沿实验室不约⽽同重仓代码能⼒的原因。
四、“点⽯成⾦”的⽅法论: 5+2 的问题形状
Dawn Song抛出了在场所有⼈都想问的问题:⼏⼗年来,从MapReduce 到TPU 再到MoE,你如何⼀次次分辨”真正基础性的技术”与”⼀时的⻛尚”?
Jeff给出了三条可操作的原则,我们原样记录:
第⼀,⼴度优先。“与其精读⼀篇论⽂,不如略读⼗篇,甚⾄扫⼀百篇摘要。“你需要在头脑中建⽴⼀⽚”可能性的点云”,因为突破往往来⾃把尚未被连接的想法连接起来。
第⼆,寻找”完美形状”的问题。⼀个值得投⼊的难题,应该能拆成七个⼦问题:其中五个,社区已有明显苗头、接近解决;另外两个,完全不知道怎么办。太确定的是纯⼯程,太未知的要等⼆⼗年,“五加⼆”才是恰到好处的⻛险。
第三,信封背⾯计算。动⼿之前先估算数量级:处理这些数