跳转到内容
主站 新闻 控制台

赛博义父 Tibo 最新访谈:专做实体重置按钮,“想重置就重置”

· 量子位
国内AI

下一代 Agent 天然会走向云端和更大规模的计算资源

henry 发自凹非寺

“只要哥想重置,哥随时都可以重置。”

刚刚,赛博义父、AKA Codex 重置额度之神 Tibo,在最新一期与 Matthew Berman 的播客节目中自信表示道。

而且最“骚”的是,为了重置,Tibo 还专门搞了一个实体按钮。

作为 Codex 现任负责人,除了介绍如何给大家发福利,Tibo 在这期播客节目中还详细回顾了自己此前的谷歌生涯,并透露了自己以及 OpenAI 现阶段的一些重要工作。

可以说,这是外界少有的一次深入了解这位 OpenAI 新晋产品负责人的机会。

从 OpenAI 的产品文化、下一代 Agent、GPT 究极极速模式(Ultra Fast),到未来的人机交互、OpenAI 停止开发前沿模型训练、RSI,几乎无所不谈。

Tibo 的核心观点如下:

  • ChatGPT 和 Codex 最终会走向融合。未来不会有“编程 Agent”和“聊天助手”两个产品,而应该是同一个高度个人化的 AGI,根据不同人的任务、能力和习惯自动调整界面。
  • 下一代 Agent 的核心,不是再增加更多 Skill、Memory 或子 Agent,而是让这些机制“消失”。用户真正想要的是一个持续理解自己、目标、日常和团队上下文的伙伴,而不是不断管理 skill 文件、记忆和 Agent 网络。
  • 笔记本电脑会成为 AI Agent 的新瓶颈,下一代 Agent 天然会走向云端和更大规模的计算资源。
  • 今天同时运行 10~15 个 Agent,是在用并发弥补模型速度较慢的问题;Ultra Fast 一旦将响应速度压缩到接近人类思考的速度,工作流将重新回到实时交互和“心流”,而不是不停切换上下文。
  • 不看重竞争。OpenAI 对 Anthropic 的差异化叙事,不是单纯强调“模型更强”,而是“把最强能力交给尽可能多的人”。OpenAI 强调广泛分发、社区参与和降低使用门槛,这也是 Codex 并入 ChatGPT 的重要原因。
  • OpenAI 已经在实际使用“递归式自我改进”。这不只是让模型研究模型,还包括让最强模型优化 CUDA 内核、推理栈和基础设施,形成“更强模型 → 更高效率 → 更多算力 → 更强模型”的飞轮。

(Tibo 全名 Thibault Sottiaux,来自比利时,本科就读于鲁汶天主教大学(UCLouvain),学习应用数学。2015 年,他加入 Google,最初参与 Google Maps 相关工作,随后进入 Google DeepMind,负责 AI 研究基础设施建设,并参与支撑包括 AlphaGo 在内的前沿 AI 项目。2024 年,他加入 OpenAI,开始负责 Codex 项目。随着 AI 编程浪潮爆发,Codex 迅速成为 OpenAI 增长最快的产品之一,Tibo 也因此进入开发者社区视野。由于他经常亲自回复用户反馈,帮助开发者重置 Codex 使用额度,被网友尊为“赛博义父”。)

以下是对话全文,经整理:

Google 与 DeepMind 的经验

主持人: 太好了,我真的很期待和你聊聊。我想先从你在 Google 的经历聊起。你当时在 DeepMind 团队。在 ChatGPT 出现之前,Google 有一个叫作 LM Chat 的东西。

你曾发帖说,Google 太紧张了,不敢发布它;DeepMind 也被阻止推出可能冲击 Google 的产品。我经常想到这件事。当时你在做这些产品,而那是在 ChatGPT 真正改变世界之前很久。你那时是怎么想的?

Tibo: 那是一段非常令人兴奋的时期。DeepMind 是一个很有创造力的地方。

我个人的专长,是为加速研究而建设基础设施和产品。当时有一个团队在做语言模型,以及它们的 scaling。

后来,他们已经取得了相当不错的结果,所以很自然地就想到:能不能把它变成一个可以与你对话,并能用于各种事情的产品?

于是,像 LM Chat 这样的想法自然就出现了。它起初是一个内部项目,之后大家产生了将其打造为面向公众开放工具的愿景。

主持人: 那是哪一年?

Tibo: 大约是在 ChatGPT 出现前一年。

Tibo: 此外,我们还在做各种其他项目,这里就不展开说了。那确实是个非常有创造力的地方。只是,DeepMind 并不是一个被设计来交付产品的组织。

相比之下,OpenAI 在这方面非常不同。我们现在的研究与产品团队协作得极其紧密。

我们一起构思,一起共同设计很多东西。我们非常倾向于把产品推出去,也非常倾向于让人们能够用上它们。我很喜欢这一点。这也是吸引我来到这里的原因:使命、人才,以及人才密度。OpenAI 有太多很棒的地方了。

主持人: 你当时参与 LM Chat 时,是否已经知道它很特别,或者将来会变得很特别?

Tibo: 确实感觉非常特别。那种模型让你第一次意识到:它能够生成连贯的文字,而且能提供一些帮助。一开始,它只是好玩,后来才逐渐变得越来越有用。

主持人: 你说你经常想起那件事,我很能理解。我觉得 Google 在很多方面是自己绊住了自己。你从那里学到了哪些经验,并把它们带到了 OpenAI?

Tibo: 是的,这就是我常常思考它的原因。我会从团队文化以及 OpenAI 整体文化的角度去想:哪些好的部分要保留,哪些事不该做。

OpenAI 的文化非常自下而上,也非常赋能。人们可以提出各种想法,聚在一起,然后非常快地推出产品。对于新产品创意,整体上几乎没有什么阻力。这很令人振奋,也很有趣;一切都是为了积极地影响世界。保留这一点对我来说非常重要。

另一件同样重要的事,是别让它变得一团乱,对吧?你不希望最后堆出一大杂烩:全是新功能,却没有整体方向和一致性。因此,它也需要由简洁感来平衡,并且要为产品质量感到自豪。

我认为,ChatGPT 的 iOS 应用是市面上最好的应用之一。我们希望保持这一点。我们在愉悦感、性能、效率和简洁性等方面投入很多。这些是总体原则,同时仍然要赋能每一个人去尝试新事物、快速交付。

打造 OpenAI 的文化

主持人: 如果要给创业者一些建议,怎样培养出这样的文化?OpenAI 内部有哪些更具体的要素或做法,是你会建议创业者借鉴的?

Tibo: 我认为,要有坚定的信念;同时要找到一种方式,既能够贴近用户,又能根据反馈快速迭代。此外,还要愿意颠覆自己。对创业者来说,这一点或许没那么直接相关,但对 OpenAI 这样的公司来说非常相关。

我们不断会有新的研究、新的想法;能够判断什么时候该投入其中,即使这意味着可能要从主营业务中重新调配资源,也极其重要。这很难,但真的非常重要。

主持人: 没错。这正是你刚才描述 Google 没能做到的事。

Tibo: 有一说一,他们是有计划的,只不过一切都属于一个更大计划的一部分。对我来说,那不是正确的地方。

主持人: 随着 OpenAI 或任何公司逐渐成熟,要维持这种快速交付、愿意自我颠覆的文化,会不会变得更难?尤其当你已经有一头不断赚钱的现金牛,同时另一边又有个可能很酷、很有创新的新东西时。

Tibo: 我们非常面向未来。AI 的未来、它最终会是什么样、人类会怎样从中受益,并不会停下来等待,也不会在意你在接下来一个月或三个月已经建立起来的东西。

因此,我认为非常重要的是要全情投入,并且对它的发展方向保持开放的眼光,再想清楚自己该如何定位,确保你能够抓住那股浪潮。

即便对 OpenAI 来说也是如此:我们训练模型,然后才发现它们的能力。基准测试并不能告诉你一切。

我们必须亲自花很多时间试用模型,才会意识到:噢,也许我们之前没有想过可以用它以这种特定方式获益;或者,噢,它居然能做这件事。

于是,这会改变我们思考产品的方式。比如现在,我们推出了新的语音功能,它非常令人愉悦,交流起来也很自然。它还能使用工具。

这就改变了很多事。现在,我会花更多时间直接跟它说话。还有一件我一直在做的事是语音听写,因为听写的质量非常、非常好;与打字输入提示词相比,这种方式高效得多。

所以早上,我会坐在那里,拿着手机说一大段话:“要让 ChatGPT 做几件事……”然后它就会去完成;它能访问我的所有工具。而在我们拥有真正出色的语音模型之前,这并不可能。因此,它会突然彻底改变你对产品的思考方式。

AI Agent 的未来

主持人: 好,我们继续聊新模型、新的 harness(智能体运行框架)。几周前,我还要从你另一条很精彩的帖子说起:“Codex 在两到三个月后会显得很原始。我们即将经历又一次重大演进。下一代模型需要的,不只是你的笔记本电脑。”那么,先从 harness 开始。随着模型变得更强,harness 的哪些方面仍有很大的创新空间?

Tibo: 太多了,真的太多。比如我刚才说的语音。现在,如果你是 Codex 或其他编程智能体的资深用户,你已经有点习惯那种不够顺畅的感觉了,对吧?

你得管理 skill 文件;这是一种教它东西的方式,但我认为许多人也意识到,这些文件长期维护起来挺难的。记忆也是个问题:它并不总能记住一切;如果你有子智能体,就得操心子智能体,还得搭建某种小型网络。在与它互动的各个环节,这种“它是一个完整伙伴”的幻觉都会被打破。

你真正想要的,只是一个能深刻理解你、理解你的目标、理解你的日常,也理解你的团队在做什么的东西。理想情况下,它还能做出反应,主动出击,在日常中帮助你,并且不打破那种幻觉:它就是你身边那个完美的小伙伴。这正是我们努力的方向。

另一件事是,当你拥有非常、非常强大的模型时,你会发现笔记本电脑本身也会成为限制。一台笔记本电脑所能承载的工作量,是为人类设计的。

△AI 生成

它大致是为了容纳你能产出的工作量、你的打字和思考速度,以及你需要同时打开多少应用程序而设计的——这些都是人类的限制。

模型没有同样的限制。举例说,模型也许将来能同时处理 100 个打开的应用程序,而且完全没问题。因此,从资源访问的角度看,很明显,未来的模型需要的资源会超过一台笔记本电脑所能提供的资源。

主持人: 你的意思是,我猜,是云端智能体?而一旦有了我们稍后要谈的 Ultra Fast,token 速度达到据称比 Fast 快 10 到 14 倍,到时候带宽约束会改变。CPU 会成为带宽;从字面上说,工具调用、网络、任何工具以及技术栈中的任何开销,都会成为限制因素。

Tibo: 不过,你也可以通过同时并发地做多件事来补偿。你可以一边探索,一边写测试,同时编译,并且同时验证一个新假设。这样你就在不断转移瓶颈的位置,因为你能够并发处理更多事情,模型也能非常高效、非常快速地思考和推进。

主持人: 以目前的 token 速度,我发现自己会并行启动 10 到 15 个智能体,这给我带来了相当明显的认知负担:要不断切换上下文、不断启动它们,而且你可以预期一个任务要 30 到 45 分钟后才会返回。

现在有了 Ultra Fast,这个工作流会显著改变;我想我不会再同时开 10 个或 15 个智能体,这或许是件好事。可能一次只需要三四个。你认为独立开发者的工作流会如何随时间变化?

Tibo: 我认为,管理你的注意力、让体验更贴合你的注意力,是我们非常重视的事情。

AI 如何改变开发者工作流

Tibo: 毕竟,我们是在为人类构建产品。我们希望打造最能赋能人类的技术,这就要求围绕你的多任务处理能力来设计:你希望怎样管理注意力?某件事应当现在呈现给你,还是 30 分钟后再呈现更好?

而当 Ultra Fast 的速度与语音结合时,你会突然感觉:好吧,这个东西的运行速度可以和我一样快,甚至更快。

于是,你能保持心流、不断构思、看到原型,实时地生成小型报告,那种感觉真的很好。你会突然觉得:对,之前我让 10 个智能体多任务并行,那种方式我其实并不想再回去了。

所以,我们正努力带来那种非常自然、同时又仿佛为你量身打造的体验。你无需去适应它,而是让技术来适应你。

主持人: 过去几个月里,大家讨论了不少智能体式编程技术。Loops 曾经很流行,现在仍然流行;如今我又听到 graphs。这些技术是否都是为了让独立开发者能够管理注意力,或者像你所说的那样,对注意力更友好?我喜欢这个说法。

Tibo: 我会把问题分为两类。第一类,是构建最好的个人 AGI,或者说个人智能体:它能和你一起处于心流之中,主动提出重要的新想法;一旦找到机会,就非常高效地按你的意图做事。

无论是技术问题,还是研究、建议之类的事,它都能完成,而且能高度贴合你。这是非常重要的事情,它深深扎根于对作为人类、作为独特个体的你的理解。我们正在全力推进这一类问题。

另一类问题则是全面自动化:你更多是在构建智能系统,让它们接管一个非常复杂的流程。也许这类流程需要,或者曾经需要智能,并且看上去非常复杂。

举例来说,查看生产日志并自动做性能优化,或者发现回归问题后自动修复。在网络安全领域,我们也看到了这种趋势。

比如,有扫描器发现一个漏洞时,能否自动修补它,并把这个漏洞暴露的窗口期缩短到几乎为零,不让人参与那些闭环,或者只让人极少参与;你只需要批准高风险动作,系统主体仍然是自动化的。此时,你也不必对它保持那么直接的控制。

主持人: 明白。

ChatGPT 与 Codex 的融合

主持人: 那么,我想稍微换个话题。过去几个月,ChatGPT 和 Codex 一直走在融合的路径上。

我首先想问:这件事进展得怎么样?在内部是什么感受?你从用户那里收到了什么反馈?

Tibo: 它确实带来了很大的助益。起初我们收到的反馈是:“为什么要合并它们?真的必须这么做吗?”但未来的模型要求我们合并。

所以,我们就会这么做,因为这是构建那个极具个人化、能力超强、能以各种方式帮助你的智能体时,最简单、也最正确的做法。

它们的底层会是同一套技术:同一个 harness、同一种思路。它高度多模态、语音优先、极其高效;无论你是不是在编程都没关系。这个智能体什么都能做,而且效率极高。

你想要的界面则应当根据你的需求进行调整。你不该先决定“我是程序员,所以我要一个程序员界面”,或“我不懂技术,所以我要一个非技术界面”。

人们处于一个连续的光谱上;软件工程师、设计师之类的标签,只是我们为了应对过于复杂的现实而创造的人类概念。

因为说到底,每个人都在那条光谱的不同位置。因此,我们要构建一个能为每个人适配的完美界面。无论你懂不懂技术,它都会根据你的具体个性来调整。这就是我们这样做的原因。

主持人: 不过,这是否意味着最终必然会变成一个统一界面?不再有下拉菜单让人选择不同产品?想到我妈妈可能会使用和我完全相同的界面,确实很不可思议。

当然,它会按我的需要进行定制。如果我在做更复杂的工作,可能需要更多信息。但对你来说,最终形态是什么?

Tibo: 没错,就是同一件东西。你和你妈妈会使用同一个东西。它会是你们各自的个人 AGI。你们会有非常不同的任务、从中获得不同的效用,也会把它连接到生活中不同的工具,带来不同的想法和需求。然后,它会持续调整自己,尽可能地让你受益。它也会以同样的方式服务你的朋友和所有其他人。

人机交互的未来

主持人: 我想回到你刚才说的一点。你在描述最终状态时,好几次用了“幻觉”这个词。对普通用户来说,那个完美的“幻觉”是什么?如果你设想一下几年后,AI 和人类之间的互动会是什么样?

Tibo: 对我而言,它会是一种极其贴合人类的东西。这也是大型语言模型成功的原因:它使用自然语言。自然语言本就是人类的概念,对吧?我们习惯彼此交谈。如果明天你给我写一封