领先的 AI 实验室 的目标是递归式自我改进(recursive self-improvement,RSI):利用 AI 智能体实现 AI 研究自动化。RSI 也是关于 AI 进展将会爆炸式增长的预测的基础。我们如何评估自己距离这一里程碑还有多远?
一种方法是使用基准测试,检验智能体能否开展 AI 研究。鉴于 AI 社区对基准测试的重视,基准测试一直是评估 RSI 进展的主要方式。在过去一年中,许多此类评估发现,智能体如今已经能够在成功容易验证的任务上取得进展,这也引发了人们对 RSI 即将到来的猜测。
但这些评估虽然很有帮助,却局限于狭窄且可验证的任务。AI 研究可能更加开放。成功往往无法立即明确或验证;为了取得进展,研究人员需要检验有前景的假设、回溯,或考虑新的、非常规的方法。我们该如何评估智能体开展开放式 AI 研究的能力?我们在一篇新论文中迈出了回答这一问题的第一步。
我们与两篇尚未发表的 AI 论文的作者合作,请他们拟定论文的主要研究问题。随后,我们让前沿 AI 智能体开展研究,以回答这些问题,并为其提供数千美元的 API 额度和算力,以及六天的实际运行时间。原论文作者对智能体撰写的论文进行了评审。
作者明确拒绝了两篇智能体论文。 为了更好地理解这些结果,我们的团队花费了超过一百个小时分析智能体的日志。我们的主要结论如下:
- 智能体缺乏开展开放式研究所需的判断力。 虽然智能体提出了一些令专家评审者印象深刻的研究方向,但它们很快就基于质量低下或合成的数据否定了自己提出的方向。
- 智能体不了解自己可用的资源。 两次实验结束时,API 预算的使用量都不到 50%,距离截止时间也还剩数小时,尽管智能体能够监控资源使用情况,并且被鼓励用完预算。
- 智能体无法创造性地回应反馈。 尽管智能体自身的 AI 自评审发现了许多后来被专家评审者指出的问题,但智能体并没有创造性地解决这些问题。面对负面反馈时,它们只是给已有发现添加限定条件,并继续坚持没有前景的研究方向。
- 智能体无法有效回溯。 它们在实验第一天内就放弃了最具雄心的研究目标,此后两个智能体都没有从根本上改变方法。
- 智能体没有遵循具体指令。 它们忽略了关于探索阶段应投入多少时间、应多频繁地从 AI 自评审工具获取反馈,以及论文篇幅上限等明确规定。
两年前,我们发布了一项基准测试,研究智能体能否用于提升研究的可复现性。自那时起,我们就一直希望评估 AI 开展开放式研究的能力。但我们希望把方法设计得更加完善。我们的方法理念由论文的一些英国人工智能安全研究所(UK AISI)合著者提出,并由普林斯顿大学的核心团队进一步完善。
我们将这种方法称为“影子评估”(shadow evaluations),因为智能体会跟随原始研究开展工作。除我们两人之外,核心团队还包括 Peter Kirgis、Andrew Schwartz 和 Stephan Rabanser。完整作者名单位于本文末尾。
影子评估具有重要优势:它让我们能够在智能体未曾训练、也无法在线访问的研究结果上测试智能体。它还允许那些花费数月回答相关问题的专家来评估智能体的输出。[^1]
但影子评估也存在固有局限。专家评审者知道论文由 AI 生成,因此可能更偏好他们自己采用的方法,而不是智能体采用的方法。由于我们会对每篇论文进行深入评估,样本量较小(在本研究中,我们只使用了两篇论文)。此外,这类评估在设计、执行和解释过程中必然需要研究人员拥有很大的灵活性。
事实上,我们在递归式自我改进和超级智能的讨论中,以持有一种特定立场而闻名。这可能会影响我们的研究开展方式。论文中有一节详细讨论了我们可能存在的偏见,以及我们如何应对这些偏见。我们寻找了一组并不完全共享我们先验观点的合作者,并明确呈现了由此产生的分歧。[^2] 未来开展评估时,我们有兴趣让“对抗性合作者”(adversarial collaborators)成为核心团队的一部分。
对 AI 进展爆炸式增长的影响
我们的结果表明,对于前沿 AI 智能体而言,开展开放式研究仍然充满挑战。不过,这些发现仍属初步结论,我们正在努力解决其中的局限,例如扩大样本量、使用新模型进行测试,以及可能改进支架(scaffold)。但如果这些发现经得起进一步检验,那么其影响是什么?
首先,我们需要了解,前沿 AI 的进展(以及 RSI)在多大程度上可以仅通过在可验证任务上不断爬坡(hill climbing)来实现。我们的看法是,虽然在狭窄任务上(例如提升效率)取得更快进展当然是可能的,但我们不认为这会带来广泛的 RSI 或爆炸式进展。不过,我们仍计划密切关注 AI 智能体在可验证任务上的能力将如何影响 AI 进展的演变。
其次,我们需要衡量,当前智能体开展开放式研究时所面临的限制(例如缺乏创造力和判断力)能够以多快的速度被克服,例如通过更有针对性的训练和支架改进。我们计划定期继续开展影子评估,以帮助回答这一问题。
最后,即使这些限制能够被克服,也可能存在其他瓶颈,从而减缓 AI 进展的速度。