跳转到内容
主站 新闻 控制台

Jeff Dean 离职后首次公开访谈:火力十足

· 量子位
国内AI

离开谷歌的原因之一:小团队可以极致聚焦!

Gemini 早期在 Coding 这件事上,确实做得不太行

要不说 Jeff Dean 这人还是实诚呢。

从谷歌离职后的首次公开访谈,他也不藏着掖着了,直接上演了一场“前员工锐评老东家”。

在斯坦福 2026 Frontier & Pioneer Symposium 上,Jeff Dean 一口气聊开了不少过去很少公开展开的话题——

关于为什么离开谷歌、Gemini 为什么不行、自己的科研秘诀、新公司 Discovery Loop 接下来准备押注什么……在访谈里全都一吐为快。

整场访谈听下来,信息密度相当高。Jeff Dean 这次给出的几个核心判断,也可以总结为:

  • AI 在网络安全上的能力,已经可能达到顶级人类攻击者的水平,甚至更进一步。
  • TensorFlow 当年有两个比较明确的失误,Jeff Dean 自己也承认了。
  • 未来科学实验的一轮迭代,可能从一天、一周压缩到一分钟、一小时。
  • Jeff Dean 真正想做的递归自我改进,将覆盖模型参数、训练数据、Eval,甚至模型架构本身。
  • 在寻找重大研究方向时,与其精读 1 篇论文,不如先浏览 10 篇,甚至 100 篇论文摘要。

以下为本次访谈的重点内容实录,围绕核心观点做了摘选整理,部分文字在不改变原意的基础上进行了适度删改。

Gemini 早期在 Coding 上确实有所欠缺

**Q:**回头看 Gemini 的开发过程,最让你意外的是什么?有哪些经验能够影响下一代 AI 系统?

**Jeff Dean:**Gemini 其实是谷歌内部几个较早研究项目最终汇合的结果——

包括原来的 DeepMind、Google Brain,以及 Google Research 其他团队的一些工作。

当时我们逐渐意识到,大家其实都在朝着非常相似的方向发展。

比如不断扩大模型规模,同时也有几支团队分别在研究如何让语言模型拥有多模态能力,使其能够理解图像等信息。

所以当时我写了一份一页纸的 Memo,心想:各自做各自的事情有点傻,我们应该直接合作。

把大家的人员、想法和算力资源整合起来,训练一个从一开始就具备多模态能力的模型,把谷歌内部多个研究组织中最优秀的人聚到一起。

后来,我和 Oriol Vinyals 一起发起了 Gemini 项目,担任最初的联合技术负责人,并将这些团队真正整合到了一起。

现在回头看,从一开始就让模型具备多模态能力,是一个非常成功的决定。

因为如果你最终希望一个模型能够用于各种任务,它就应该同时理解文本、语言、代码、图像、视频、音频,以及其他模态。

我们当时甚至在训练数据中加入了一些 LiDAR 数据,至少让模型知道 LiDAR 这种数据形式的存在。因为在之后进一步训练 Gemini 时,它也可能成为一个重要的应用场景。

但当时我们希望模型在很多事情上都表现出色,所以我觉得,我们当时对如何真正把 Gemini 的 Coding 能力做到令人惊艳,重视得稍微晚了一些。

后来我们意识到了这一点,也一直在努力追赶。目前已经有一些很不错的工作正在推进。

而且我觉得,Coding 其实是一项非常重要的能力。

当你专门提升模型的 Coding 能力时,最后往往会得到一个更善于推理的系统,因为写代码本身就要求模型能够一步一步地处理问题,把一个复杂问题拆解成多个子问题,再逐个解决。

所以,当 Coding 能力得到提升后,这种能力通常也会迁移到许多非 Coding 任务中。

承认 TensorFlow 当年有两个明显失误

**Q:**回头看 TensorFlow,当时有哪些设计是你今天会重新考虑的?如果现在重新做一次,哪些地方会做得不一样?

**Jeff Dean:**我觉得我们当时有几件事情确实做得不太对。

第一,最开始没有加入 Eager Execution 这种模式。

后来,这种方式在 PyTorch 和 JAX 等框架中变得非常流行,TensorFlow 后来也加入了这一功能。我觉得这其实让整个抽象变得更好了。

另外一个问题,是我们开源 TensorFlow 时建立了一个叫作 contrib 的子目录,允许许多外部开发者向其中贡献各种辅助库和不同的实现方式。

后来,这给社区带来了很大的困惑,因为慢慢地,同一件事情可能有十种不同的做法。你到底该用哪一种,取决于你使用了 contrib 中的哪个子目录、哪个库。

现在回头看,我们当时其实应该让 TensorFlow 的核心保持更加简洁,把这些内容作为建立在核心之上的外部库。

如果今天重新做一次,我们不会再这样设计。

当然,TensorFlow 整体上还是帮助许多人真正开始接触机器学习,也让大家可以使用一套共同的框架,去解决自己关心的问题。这一点我觉得非常有价值。

离开谷歌的原因之一:小团队可以极致聚焦!

**Q:**你为什么选择离开谷歌创业?相比大公司,小团队在开展前沿 AI 研究上有什么优势?

**Jeff Dean:**我其实非常喜欢自己在谷歌度过的这些年。我在那里工作了 27 年,也结识了许多非常优秀的同事。

所以我觉得,谷歌现在的状态很好。他们有自己的计划,会继续把 Gemini 模型做得非常出色。与此同时,我自己也很期待出去做现在这件事情。

有时候,一家非常专注的小公司,所有人都围绕同一个使命工作,这种状态本身就很有吸引力。

而且,今天的条件已经和以前很不一样了。云计算的发展,以及各种云平台上大规模机器学习算力的部署,让一个很小的团队也可以筹到一笔资金,然后直接使用这些基础设施,不需要自己从头开始搭建整套系统。

所以,如果一小群人有一个梦想、一个愿景,或者有一个特别想探索的方向,现在完全可以在一个规模很小的组织里去做。

我们可以依赖谷歌或其他云服务商,让他们承担许多重型基础设施工作。

对我们来说,现在作为一家小公司,最令人兴奋的一点,就是可以非常专注地开展科学和工程自动化。

坦率地说,这件事情我们大概也可以留在谷歌内部完成。

但如果只有大约 10 个人,大家坐在帕洛阿尔托某个办公室里,所有人都只专注于这一件事情,那么大型组织中的许多轻微干扰就可以直接绕开。

当然,大公司也有很多很棒的地方。这些年我在谷歌建立了许多深厚的友谊,也从大型公司能够提供的资源和支持中受益良多。

所以现在离开这些支持,确实会让人稍微有些紧张;与此同时,这也非常令人兴奋。

离开谷歌后,想把科学发现变成一个可以自动迭代的 Loop

**Q:**最近,大家越来越多地讨论递归自我改进:AI 系统能不能持续学习如何改善自己,甚至进一步加快 AI 发展的速度?你怎么看这件事?

**Jeff Dean:**用机器学习来改善机器学习,其实已经被探索了很多年。

像我的联合创始人 Quoc Le,很早就在做 Neural Architecture Search:让一个模型自动生成模型架构,再根据学习速度、训练成本等指标不断获得反馈,逐渐找到更好的设计。

后来,他们还做了 Evolved Transformer,通过进化算法重新组合 Transformer 组件,最终找到的架构效率比标准 Transformer 高出大约 30%。

所以我一直觉得,让 AI 参与改进 AI 本身,是一个非常重要的方向。

递归自我改进真正要解决的问题,是如何让构建一个模型所需要的整套要素,都能够通过自动化方式持续变得更好。

今天,通常会有一整个团队去研究什么数据最有助于提升模型质量,需要什么样的 Eval 来评价模型,以及应该选择什么样的模型架构。

我认为,这些环节未来完全可以形成一个非常有效的自动化 Loop。每个部分都持续优化,再将这些结果组合起来,最终改善模型整体的能力、质量以及数据组合。

其实,仔细观察许多现代科学和工程问题,会发现它们都有类似的结构。

先提出一个大问题,然后将其拆解成许多子问题;针对某个子问题提出可能的解决方案,将方案实现出来,真正运行一次实验,再评估实验效果。

接着,将实验得到的结果反馈回去,用这些反馈决定下一次应该进行什么实验。

这其实就是最基本的科学方法。工程设计同样如此:你不断迭代自己的设计,再比较不同方案的各种属性。

而我们想做的,就是让这样一个完整的 Loop 越来越自动化。

Discovery Loop 目标:让一个模型拥有“20 个博士”的科研能力

**Q:**你刚才谈到了递归自我改进,这似乎也和你刚刚成立的新公司有关。你们具体想做什么?

**Jeff Dean:**我们新公司 Discovery Loop 背后的想法,就是实现机器学习、科学和工程的自动化,从而提高许多不同领域产生科学发现的速度。

一开始,我们肯定会先聚焦于少数几个领域,因为早期保持一定程度的专注非常重要。

但我们认为,不同领域之间其实存在许多可以复用的基础设施和通用技术。

而且,如果能够构建出真正理解许多不同科学和工程领域的模型,就有可能让一个模型同时拥有接近 20 个领域 PhD 级别的专业能力。

没有哪个人类能够同时拥有 20 个不同领域的博士学位。

但如果模型具备这样的能力,它就可以判断一个大问题中真正重要的子问题是什么,然后调度 Agent 和 Multi-Agent 系统分别解决这些子问题。

再将各个子问题的结果重新组合起来,形成整个大问题的解决方案,并持续重复这样的循环。

我们还希望让这个循环运行得越来越快。通过构建合适的工具,让系统能够非常快地完成一次实验,或对一次实验进行评估。

这样,过去需要一天甚至一周才能完成的一轮实验,未来可能只需要一分钟或一个小时。

不仅如此,我们还可以同时运行成千上万次实验,从这些实验中获得反馈,再利用这些反馈判断下一批实验应该做什么。

所以,我们希望同时提升两件事:实验运行的速度,以及实验本身的质量。

如果这两件事都能持续提升,我觉得最终会产生一些非常惊人的成果。

与其精读 1 篇论文,不如直接浏览 10 篇文章,甚至 100 篇摘要

**Q:**你是怎么判断一项技术是真正具有基础性价值,还是只是当下比较流行?有没有什么一直没有改变的研究和工程原则?

**Jeff Dean:**我经常跟学生说:与其非常仔细地读完一篇论文,有时候快速浏览 10 篇论文反而更好。

因为这样一来,你脑子里会多出 10 个关于“哪些事情可能开始变得可行”的想法,甚至可以快速浏览 100 篇论文摘要。

你真正想具备的能力,是将那些此前尚未建立联系的重要想法连接起来。

有时候,当你面对一个很困难的问题时,如果脑子里已经知道许多事情正在隐约变得可行,就能帮助你重新理解整个问题。

一开始,这个问题可能看起来包含 7 个部分,每一个都无法解决。但重新看一遍后,你可能会发现,其中 5 个方向已经有一些研究开始成形,可能足以解决其中一部分问题。

然后还剩下两个问题,你目前完全不知道该怎么做,但如果认真投入,就有可能将它们解决。

对我来说,这类问题才真正值得长期投入,可能一做就是 5 年。

如果一个问题看起来需要 20 年才能解决,而且眼下连其中任何一块该如何突破都完全没有头绪,那通常还为时过早。

同样,一个两年就能完成、具体路径已经非常明显的问题,更多是在做实际工程。

真正值得寻找的,是那些可能需要一种非常不同的方法,同时又已经开始变得可行的问题。

我还有一个经常使用的工程工具,就是快速进行数量级估算。比如,如果我要处理这么多数据,需要花多长时间?如果要通过这种网络传输这些数据,到底是否可行?需要 100 年,还是只需要 10 秒?

10 秒和 100 年是完全不同的事情。

所以,你要能够利用第一性原理和一些工程经验,在脑子里快速判断不同解决方案大概处于什么量级。

我没有什么神奇答案,也做过许多最终没有成功的事情,所以还有一个建议:

多去尝试一些可能不会成功的事情,其中总会有一些能够成功。

AI 已经能完成顶尖人类黑客能做的事情,甚至可能更进一步

**Q:**你怎么看 AI 能力在网络安全领域的快速提升?

**Jeff Dean:**我觉得,这些模型可以被用于许多不同的事情,就像其他许多技术一样。

绝大多数应用,我认为都会对整个世界产生非常积极的影响。

比如医疗 AI、教育 AI,可以帮助人们解决过去很难凭借自身力量解决的问题,让大家能够完成更多事情。这些都非常令人兴奋。

但模型同样可以被用来寻找安全漏洞,所以这里确实存在一把双刃剑。

你可以用它发现并修补现实世界中大量存在的安全漏洞,恶意用户也可以利用同样的能力攻击这些漏洞。

现在,这些模型确实已经能够完成一些高水平人类网络攻击者能够完成的事情,甚至可能更进一步。

与此同时,它们也可能发现一些连非常优秀的人类网络防御工程师都未必能够发现的漏洞。

所以,网络安全一直存在攻防双方之间的平衡:一边有人努力保护计算机系统,另一边有人努力攻击这些系统。现在,双方手中的工具都强大了许多。

我不是网络安全专家,但我认为这确实是一个值得担忧的问题。对于一些我们不希望模型去做的事情,可能也需要采取非技术手段,例如法律和监管。

最终,整个社会需要逐渐弄清楚:我们究竟希望模型做哪些事情,又希望阻止它做哪些事情。

参考链接:

[1] https://www.youtube.com/watch?v=0kC3xOZChdA&t=2s