最先端の AI 研究所 が目指しているのは、再帰的自己改善(recursive self-improvement、RSI)です。つまり、AI エージェントを活用して AI 研究を自動化することです。RSI は、AI の進歩が爆発的に加速するという予測の基盤でもあります。では、私たちはこのマイルストーンまであとどれほどの距離にいるのでしょうか。
その一つの方法は、エージェントが AI 研究を実行できるかどうかをベンチマークで検証することです。AI コミュニティがベンチマークを重視していることもあり、これまで RSI の進展を評価する主な手段はベンチマークでした。過去 1 年の間に、数多くの評価によって、エージェントが現在では、成功を容易に検証できるタスクで成果を上げられることが明らかになっています。これを受けて、RSI が間近に迫っているのではないかという憶測も広がっています。
しかし、こうした評価は有用である一方、対象が狭く、検証可能なタスクに限られています。AI 研究は、よりオープンエンドなものになり得ます。成功はすぐには明確にならず、検証もできないことが少なくありません。進展を遂げるには、研究者は有望な仮説を検証し、方針を撤回し、あるいは新しく型破りなアプローチを検討する必要があります。では、オープンエンドな AI 研究を実行する能力を、エージェントについてどのように評価すればよいのでしょうか。私たちはこの問いに答えるための第一歩を、新しい論文で踏み出しました。
私たちは、未発表の AI 論文 2 本の著者と協力し、それぞれの論文における主要な研究課題を策定してもらいました。その後、最先端の AI エージェントにこれらの課題に答えるための研究を行わせ、数千ドル相当の API 利用枠と計算資源、さらに現実の時間で 6 日間の実行時間を提供しました。元の論文の著者には、エージェントが執筆した論文を評価してもらいました。
著者は、エージェントが執筆した 2 本の論文を明確に不採択としました。 これらの結果をより深く理解するため、私たちのチームは 100 時間以上を費やしてエージェントのログを分析しました。主な結論は以下のとおりです。
- エージェントには、オープンエンドな研究に必要な判断力が欠けている。 エージェントはいくつかの研究の方向性を提案し、専門家の評価者に強い印象を与えました。しかし、その後すぐに、質の低いデータや合成データに基づいて、自ら提案した方向性を否定しました。
- エージェントは、自分が利用できるリソースを把握していない。 2 回の実験では、いずれも API 予算の使用量が 50% 未満にとどまり、期限まで数時間を残して終了しました。エージェントはリソースの使用状況を監視でき、予算を使い切るよう促されていたにもかかわらずです。
- エージェントは、フィードバックに創造的に対応できない。 エージェント自身による AI 評価では、後に専門家の評価者が指摘した問題の多くが見つかっていました。それにもかかわらず、エージェントはそれらを創造的に解決しませんでした。否定的なフィードバックを受けると、既存の発見に条件を付け加えるだけで、見込みのない研究の方向性に固執し続けました。
- エージェントは、効果的に方針を撤回できない。 最も野心的な研究目標を実験初日に放棄し、その後、どちらのエージェントも根本的にアプローチを変更しませんでした。
- エージェントは、具体的な指示に従わない。 探索フェーズにどれだけの時間を割くべきか、AI 評価ツールからどの程度の頻度でフィードバックを得るべきか、論文の文字数上限など、明確に示された規定を無視しました。
2 年前、私たちは、エージェントを研究の再現性向上に活用できるかを調査するベンチマークを公開しました。それ以来、AI がオープンエンドな研究を実行する能力を評価したいと考えてきました。ただし、そのためには、より緻密に設計された手法が必要だと考えました。私たちの手法の理念は、論文の共著者でもある英国 AI 安全研究所(UK AISI)の研究者らによって提案され、プリンストン大学の中核チームによってさらに洗練されました。
私たちはこの手法を「シャドー評価(shadow evaluations)」と呼んでいます。エージェントが元の研究を追う形で研究を行うためです。私たち 2 人以外の中核チームのメンバーは、Peter Kirgis、Andrew Schwartz、Stephan Rabanser です。著者名と所属の完全な一覧は本稿末尾に記載しています。
シャドー評価には重要な利点があります。エージェントが学習したことも、オンラインでアクセスしたこともない研究成果を対象に、エージェントをテストできるのです。また、関連する課題に数か月を費やして取り組んだ専門家に、エージェントの出力を評価してもらうこともできます。[^1]
一方で、シャドー評価には固有の限界もあります。専門家の評価者は、その論文が AI によって生成されたことを知っているため、エージェントが採用した手法よりも、自分たちが採用した手法を好む可能性があります。また、各論文を詳細に評価するため、サンプル数は少なくなります(本研究では 2 本の論文のみを使用しました)。さらに、この種の評価では、設計、実施、解釈の各段階で、研究者に大きな柔軟性が必然的に求められます。
実際、私たちは再帰的自己改善や超知能に関する議論において、特定の立場を取っていることで知られています。これは、私たちが研究をどのように進めるかに影響を与える可能性があります。論文では、私たちにどのようなバイアスがあり得るのか、また、それらにどう対処したかを詳しく論じています。私たちは、私たちの先入観を完全には共有していない協力者を探し、そこから生じた意見の相違を明確に示しました。[^2] 今後の評価では、「敵対的な協力者(adversarial collaborators)」を中核チームの一員に加えることにも関心があります。
AI の進歩が爆発的に加速することへの含意
私たちの結果は、最先端の AI エージェントにとって、オープンエンドな研究の実行が依然として難しい課題であることを示しています。ただし、これらはまだ初期的な結論にすぎません。現在私たちは、サンプル数を増やすこと、新しいモデルを使ってテストすること、スキャフォールド(scaffold)を改善できる可能性など、さまざまな限界への対処に取り組んでいます。では、もしこれらの発見が今後の検証にも耐えた場合、どのような含意があるのでしょうか。
第一に、最先端 AI の進歩(ひいては RSI)が、検証可能なタスク上での継続的なヒルクライミング(hill climbing)だけで、どの程度実現できるのかを理解する必要があります。私たちの見方では、狭いタスク、たとえば効率の向上において、より速い進展が実現する可能性はもちろんあります。しかし、それが広範な RSI や爆発的な進歩につながるとは考えていません。それでも、検証可能なタスクにおける AI エージェントの能力が、AI の進歩の展開にどのような影響を与えるのか、今後も注意深く見守るつもりです。
第二に、現在エージェントがオープンエンドな研究を行う際に直面している制約(創造性や判断力の不足など)が、より的を絞った訓練やスキャフォールドの改善によって、どの程度の速さで克服され得るのかを測定する必要があります。私たちは、この問いへの回答に役立てるため、今後も定期的にシャドー評価を実施する予定です。
最後に、こうした制約を克服できたとしても、AI の進歩を減速させる別のボトルネックが存在する可能性があります。