跳转到内容
主站 新闻 控制台

Open-world evaluations for measuring frontier AI capabilities

分析实践

本文长达 8,000 词——这是我们关于一种新兴 AI 评估类型的合作论文。论文也已以 PDF 格式发布,可在此处查看。

摘要:AI 模型已经开始在大多数主流基准测试上接近饱和。但这是否意味着它们能够构建并交付一个真实产品,或者端到端地开展一项科学实验,或穿梭于政府官僚体系之中?研究人员已经开始在这些真实世界场景中测试 AI。我们将这类评估称为“开放世界评估”(open-world evaluations)。本文定义了开放世界评估,综述了迄今为止的经验教训,并提出了开展此类评估的最佳实践。

我们还介绍了 CRUX——一个由来自学术界、政府、公民社会和产业界的 17 位研究者组成的协作项目,将通过开放世界评估定期评测前沿 AI 能力。在我们的首次实验中,一个 AI 代理构建并发布了一款 iOS 应用到 App Store,仅犯了两个错误,其中一个需要人工干预。这让我们初步看到了潜在的有用能力;更重要的是,也为 AI 驱动的应用商店垃圾内容带来了早期预警(我们在发表前一个月已将这一结果披露给苹果)。

我们希望在其他真实世界领域开展类似实验,以发现早期预警信号;这将是我们未来一年主要的实证项目之一。

作者包括:Sayash Kapoor、Peter Kirgis、Andrew Schwartz、Stephan Rabanser、J.J. Allaire、Rishi Bommasani、Magda Dubois、Gillian Hadfield、Andy Hall、Sara Hooker、Seth Lazar、Steve Newman、Dimitris Papailiopoulos、Shoshannah Tekofsky、Helen Toner、Cozmin Ududec、Arvind Narayanan


我们应该如何跟踪并预测 AI 能力?当下 AI 社区的主流答案是基准测试。例如,METR 的时间跨度图已被政策分析人士、行业领袖以及研究 AI 风险的机构用来论证 AI 能力正在快速提升。

但基准测试既可能高估,也可能低估进展。要把一个任务变成基准测试,它需要被精确定义并且能够自动验证。问题在于,任何足够精确、可以做成基准的任务,也足够精确、可以被优化,于是 AI 代理就可能在这类任务上表现出色。反过来,基准上的低准确率也可能来自偶发性失败,比如在网站上遇到 CAPTCHA,即使代理实际上有能力解决底层任务。

为应对这些局限,许多研究者正在转向一种新的评估方式:超越基准测试的、冗长而复杂的真实世界评估。Anthropic 的 Nicholas Carlini 使用 Claude 代理构建了一个能够编译 Linux 内核的C 编译器。Anthropic 和 Andon Labs 设计了一项自由形式实验,让 Claude 负责管理办公室里的一个小商店。基准测试通常由几十个任务组成,并以自动化方式评估;而开放世界评估往往只包含少量样本,通常需要人工介入,并以开放式方式进行评估,例如分析代理日志。

人们很容易把这类评估斥为不科学:每次评估的样本量都是 1,而且缺乏标准化和可复现性。尽管存在这些局限,我们仍认为这类评估对于收集关于 AI 能力的证据非常重要。它们可以为新兴能力提供早期预警,从而为建设社会韧性的工作提供信息;帮助评估者发现现有基准中的盲点;并让企业更清楚地了解 AI 系统很快能够执行哪些任务,从而为关于 AI 的战略决策提供依据。我们将它们称为开放世界评估

在本文中,我们对开放世界评估进行概念化,回顾过往案例以识别开展此类评估的最佳实践与陷阱,并介绍 CRUX——一个旨在定期开展新的开放世界评估的项目。以下是我们的主要洞见:

  • 开放世界评估是 AI 评估中一个重要的新兴类别。随着 AI 系统变得更强,对前沿能力的评估也必须更加复杂。开放世界评估是复杂度不断提升的一长串评估方法中的最新一环。我们调研了过去一年中开展的 10 个知名开放世界评估,以总结最佳实践和关键结论。

  • CRUX(Collaborative Research for Updating AI eXpectations,协作研究以更新对 AI 的预期)是我们系统开展开放世界评估的尝试。团队成员来自政府、学术界和非营利组织,其中许多人主导过开放世界评估,并且对 AI 的未来持有不同预期。我们的目标是为 AI 系统的当前能力提供实证证据,即使这些评估目前成本较高;同时为那些可能很快普及的能力提供早期预警。我们计划定期发布新的开放世界评估。

  • 在我们的首个 CRUX 实验中,我们要求一个 AI 代理开发并将一款简单的 iOS 应用发布到 App Store。 许多基准测试考察的是代理编写代码的能力。但发布一款 iOS 应用还涉及许多其他步骤:对应用进行签名、在网页上发布隐私政策、填写苹果的表单,以及完成应用审核流程。我们更关注代理是否满足发布应用的真实世界要求,而不是其编写代码的能力,因此我们让它构建一个简单应用并完成 iOS App Store 的提交流程。

  • 该代理在成功后共犯了两个错误,其中一个需要人工干预 (忘记正确凭据存放在哪里,以及在 App Store 审核流程中编造了一个虚假的电话号码)。开发并发布这款应用的总成本约为 1,000 美元。这款应用现已上线 iOS App Store。我们认为成本本可以低得多:应用开发和提交只花了 25 美元;绝大多数 token 都花在了监控应用状态上。我们在本文发表前一个月联系了苹果,披露了这项实验的结果。应用商店运营方应为垃圾提交做好准备并加以治理,因为他们可能很快会看到成千上万的应用通过代理自主提交。

  • 我们如何改进开放世界评估?下一步是什么?为了提高开放世界评估的实用性,评估者应明确规定允许多少、何种形式的人类干预,公开代理解决任务过程中收集的日志,并分析日志以报告代理在完成任务过程中具体做了什么。在未来的 CRUX 项目中,我们将评估 AI 研发自动化、AI 治理以及许多其他领域。

开放世界评估是 AI 评估中一个重要的新兴类别

在本节中,我们定义开放世界评估,并调研这类评估的新兴格局,以提炼其成功经验和局限。我们讨论开放世界评估在哪些方面能够弥补基准测试的一些盲点。在我们看来,随着 AI 系统变得更强,用于激发前沿能力的评估也必须随之提升复杂度。