本文长达 8,000 字——这是我们关于一种新兴 AI 评估类型的最新合作论文。论文也已以 PDF 格式发布于此处。
摘要:AI 模型已经开始在大多数主要基准测试中达到饱和。但这是否意味着它们能够构建并交付一个真实产品、端到端地开展科学实验,或在政府官僚体系中办事?研究人员已经开始在这类现实世界环境中测试 AI。我们将这类评估称为“开放世界评估”(open-world evaluations)。本文将定义开放世界评估,总结目前为止的经验教训,并提出开展这类评估的最佳实践。
我们还将介绍 CRUX。这是一个由来自学术界、政府、公民社会和产业界的 17 名研究人员组成的合作项目,旨在通过开放世界评估,定期评估前沿 AI 的能力。在我们的首次实验中,一个 AI 智能体构建并将一款 iOS 应用发布到 App Store,仅犯了两个错误,其中一个需要人工干预。这一结果初步表明,AI 可能已经具备潜在的实用能力;更重要的是,它也提前警示了 AI 驱动的应用商店垃圾内容可能带来的风险(我们在论文发表前一个月已将这一结果披露给苹果公司)。
我们希望在其他现实世界领域开展类似实验,以尽早发现风险;这将是我们未来一年主要的实证研究项目之一。
作者:Sayash Kapoor、Peter Kirgis、Andrew Schwartz、Stephan Rabanser、J.J. Allaire、Rishi Bommasani、Magda Dubois、Gillian Hadfield、Andy Hall、Sara Hooker、Seth Lazar、Steve Newman、Dimitris Papailiopoulos、Shoshannah Tekofsky、Helen Toner、Cozmin Ududec、Arvind Narayanan
我们应当如何追踪和预测 AI 的能力?如今,AI 社区的主流答案是基准测试。例如,METR 的时间跨度图已被政策分析师、产业领袖以及研究 AI 风险的组织用于论证 AI 能力正在快速提升。
但基准测试既可能高估进展,也可能低估进展。要将一项任务转化为基准测试,就必须对其进行精确规定,并能够自动验证结果。问题在于,任何足够精确、可以被纳入基准测试的内容,也足够精确到可以被专门优化,这会让 AI 智能体在此类任务上表现出色。另一方面,基准测试中的低准确率可能源于一些偶发性失败,例如在网站上遇到 CAPTCHA,即使智能体本身具备解决底层任务的能力。
为了解决这些局限,许多研究人员开始转向一种新型评估:超越基准测试、持续时间更长且更加混乱的现实世界评估。Anthropic 的 Nicholas Carlini 曾使用 Claude 智能体构建一个能够编译 Linux 内核的C 编译器。Anthropic 与 Andon Labs 还设计了一项自由形式实验,让 Claude 负责经营公司办公室里的一家小商店。基准测试通常包含数十项任务,并以自动化方式进行评估;而开放世界评估的样本量较小,往往需要人工干预,并以开放式方式进行评估,例如通过分析智能体日志。
人们很容易认为这类评估不够科学:每项评估的样本量都是 1,而且缺乏标准化和可复现性。尽管存在这些局限,我们仍认为这类评估对于收集有关 AI 能力的证据十分重要。它们可以提前警示正在出现的新能力,为构建社会韧性的工作提供信息;帮助评估人员发现现有基准测试中的盲点;并让企业更清晰地了解 AI 系统很快可能执行哪些任务,从而为有关 AI 的战略决策提供依据。我们将其称为开放世界评估。
本文将对开放世界评估进行概念化,回顾过去的案例,以识别开展这类评估时的最佳实践和潜在问题,并介绍 CRUX 项目——该项目旨在定期开展新的开放世界评估。以下是我们的主要观点:
开放世界评估是一类重要的新兴 AI 评估。随着 AI 系统能力不断增强,用于激发前沿能力的评估也必须变得更加复杂。开放世界评估是众多复杂度不断提升的评估类型中的最新一类。我们调研了过去一年开展的 10 项具有代表性的开放世界评估,以识别最佳实践和关键经验。
CRUX(Collaborative Research for Updating AI eXpectations,更新 AI 预期的协作研究)是我们系统开展开放世界评估的一次尝试。团队成员来自政府、学术界和非营利组织,其中许多人曾主导过开放世界评估,并且对 AI 的未来发展持有各种不同预期。我们的目标是提供关于 AI 系统当前能力的实证证据,即使这些能力目前使用成本高昂;同时,为可能很快普及的能力提供早期预警。我们计划定期发布新的开放世界评估。
在 CRUX 的首次实验中,我们要求一个 AI 智能体开发一款简单的 iOS 应用,并将其发布到 App Store。许多基准测试会评估智能体编写代码的能力。但发布一款 iOS 应用还涉及许多其他步骤:对应用进行签名、在网页上发布隐私政策、填写苹果公司的表格,以及让应用通过审核流程。相比智能体编写代码的能力,我们更关注它是否能够完成发布应用所需的现实世界要求,因此我们要求它构建一款简单的应用,并完成 iOS App Store 的提交流程。
智能体在犯下两个错误后成功完成了任务,其中一个错误需要人工干预(忘记正确凭证的存储位置,并在 App Store 审核流程中虚构了一个不存在的电话号码)。开发和发布这款应用的成本约为 1,000 美元。该应用目前已经上线iOS App Store。我们认为成本本可以低得多:应用开发和提交仅花费了 25 美元;绝大多数令牌都消耗在监控应用状态上。我们在本文发表前一个月联系了苹果公司,披露了实验结果。应用商店运营方应当为垃圾应用提交做好准备并加强治理,因为他们可能很快就会看到数千款由智能体自主提交的应用。
我们如何改进开放世界评估?下一步是什么?为了提高开放世界评估的实用性,评估人员应明确规定允许进行何种以及多少程度的人工干预;发布智能体解决任务期间收集的日志;并分析这些日志,报告智能体在解决任务过程中采取了哪些行动。在未来的 CRUX 评估中,我们将评估 AI 研发自动化、AI 治理以及许多其他领域。
开放世界评估是一类重要的新兴 AI 评估
本节将定义开放世界评估,并调研这一类评估正在形成的生态,以提炼其成功经验和局限性。我们将讨论开放世界评估能够克服基准测试部分盲点的领域。我们认为,随着 AI 系统能力不断增强,用于激发前沿