作者:Stephan Rabanser、Sayash Kapoor、Rishi Bommasani、Andrew Schwartz、Arvind Narayanan
本周早些时候,在 Google 的开发者大会上,该公司发布了最新模型 Gemini 3.5 Flash,以及一款新的智能体应用 Antigravity 2.0。为了展示这套新智能体系统的能力,Google 声称,一个智能体团队构建出了完整的操作系统。据报道,这项工作只需要一个提示词,API 费用约为 900 美元,并由数十个协同工作的子智能体完成。
这是否意味着,现在 AI 可以低成本地构建复杂的软件了?先别急:
-
“单一提示词”的说法具有误导性。 博文称,这个操作系统是通过单个提示词构建的。但在文章中段,Google 披露该提示词“最终长达数千行”。生成这个提示词尝试了多少次?对智能体的指令有多具体?如果缺少这些关键细节,我们很难判断,真正的秘诀究竟是更好的模型,还是在提示词上投入了更多精力。此外,这次运行是在一个脚手架(scaffold)1上进行的,其中包含专门化角色、向子智能体进行任务委派,以及用于检测和防止作弊的智能体。在发布博文中,Google 将这个脚手架视为产品功能。但我们不知道,这个脚手架是否针对“从零开始构建操作系统”这一任务进行了过度拟合,或者它在其他复杂的软件工程任务上是否也能取得同样好的表现。
-
Google 的文章没有明确说明哪些情况算作人工干预。 文章提到,开发操作系统的最终运行过程“不需要人类提供额外指导或纠正”。但它并未定义这一标准。文章描述了用于终止并重启卡住的智能体的基础设施;还提到,在更早的一次运行中,智能体似乎出现了作弊行为,随后团队加入了反作弊措施并重新运行任务。但文章没有将这些试运行纳入方法论说明。它也没有明确说明:是否有智能体向人类升级求助,最终运行是否需要人工重启、批准或修复,以及智能体成功之前尝试了多少次。
-
文章没有报告任何分析,以判断智能体是从零编写代码,还是从互联网上复制了现有代码。 值得肯定的是,Google 在博文中指出,玩具操作系统是本科课程中常见的项目,公开实现也很容易找到。文章本身也提出了这样一个担忧:智能体可能只是复述已有信息,而不是从零构建操作系统。但它没有回应这一担忧——没有进行相似度分析或日志分析来检查智能体是否复制了现有代码。即便不存在直接复制,由于训练数据中已经记忆了相关模式,编写操作系统对智能体而言也可能相对容易,因此这并不能充分说明智能体创建新颖软件的能力。
-
Google 没有发布那份冗长的提示词、智能体编写的代码,或运行日志,因此无法对这些声明进行独立评估。 如果发布源代码或智能体日志,独立研究人员就可以评估产物的质量,并回答诸如智能体是否复制了现有代码等问题。博文只包含一段较短的视频,用来记录开发进度的某个片段,以及对整个实验的概述。
另一方面,博文确实报告了构建该操作系统的准确费用(916.92 美元),以及总 token 预算(总计 26 亿个 token)。这些数据提供了有用的背景信息,这一点值得肯定。我们此前调查的许多评估都完全没有披露成本,因此它们的核心结论很难与其他评估进行比较。
不过,Google 的博文实际上是一篇新闻稿。我们理解,要求它达到科学严谨程度并不现实。类似这样的评估——在真实世界中执行一项长周期任务,仅运行一次,并由实验者讲述智能体所做的事情——已经变得很常见。由于其中许多评估由 AI 公司完成,人们很容易将这一整类评估斥为自我吹捧。
但这样做是错误的。我们将这一正在形成的范式称为开放世界评估(open-world evaluations),并在最近的一篇论文及其配套的博文中讨论了这一趋势。关键在于,我们认为开放世界评估需要一套全新的方法论规范。如果实施得当,它们能够提供一种有价值的视角,而这是基准测试评估无法提供的。
Google 的实验进一步增加了相关证据:智能体或智能体团队能够在很长一段时间内,自主或近乎自主地处理某些类型的任务,在不陷入停滞或困惑的情况下持续取得进展。正如我们在论文中所论证的,对于这类任务,由于成本等诸多原因,基准测试评估实际上难以实施。因此,现在正是学术界、非营利组织和政府中的独立评估者介入的好时机,为开放世界评估提供严谨性与可信度,而这些品质不太可能出现在 AI 厂商自己的声明中。
Footnotes
-
脚手架是围绕 AI 模型构建的一层代码、提示词和工具,使模型具备自主行动的能力,包括处理记忆、工具访问,以及与环境交互等功能。例如,Claude Code 就是让 Anthropic 的 Claude 模型能够作为编程智能体运行的脚手架。 ↩