本文は全8,000字に及びます。これは、新たに登場したAI評価の一類型に関する、私たちの最新の共同研究論文です。論文はPDF版もこちらで公開しています。
概要:AIモデルは、主要なベンチマークの大半ですでに性能の飽和に達し始めています。しかし、それはAIモデルが実際の製品を構築して提供したり、科学実験をエンドツーエンドで実施したり、政府の官僚機構の中で手続きを進めたりできることを意味するのでしょうか。研究者たちはすでに、こうした現実世界の環境でAIのテストを始めています。私たちは、このような評価を「オープンワールド評価」(open-world evaluations)と呼びます。本稿では、オープンワールド評価を定義し、これまでに得られた知見をまとめ、こうした評価を実施するためのベストプラクティスを提案します。
また、CRUXについても紹介します。CRUXは、学術界、政府、市民社会、産業界から集まった17名の研究者による共同プロジェクトであり、オープンワールド評価を通じて最先端AIの能力を定期的に評価することを目的としています。最初の実験では、あるAIエージェントがiOSアプリを開発し、App Storeに公開しました。犯したミスはわずか2つで、そのうち1つには人間の介入が必要でした。この結果は、AIがすでに潜在的な実用能力を備えている可能性を示す初期的な証拠です。さらに重要なのは、AIが生成したアプリによるApp Storeのスパムがもたらし得るリスクを、早い段階で警告するものでもあるという点です(この結果については、論文発表の1か月前にAppleへ開示しました)。
私たちは、リスクを早期に発見するため、他の現実世界の領域でも同様の実験を行いたいと考えています。これは、今後1年間における私たちの主要な実証研究プロジェクトの一つとなる予定です。
著者:Sayash Kapoor、Peter Kirgis、Andrew Schwartz、Stephan Rabanser、J.J. Allaire、Rishi Bommasani、Magda Dubois、Gillian Hadfield、Andy Hall、Sara Hooker、Seth Lazar、Steve Newman、Dimitris Papailiopoulos、Shoshannah Tekofsky、Helen Toner、Cozmin Ududec、Arvind Narayanan
AIの能力を、どのように追跡し、予測すべきでしょうか。現在、AIコミュニティで主流となっている答えは、ベンチマークです。たとえば、METRのタイムホライズン図は、AIの能力が急速に向上していることを論じるために、政策アナリストや業界のリーダー、AIリスクを研究する組織によって利用されています。
しかし、ベンチマークは進歩を過大評価することもあれば、過小評価することもあります。あるタスクをベンチマークに変換するには、そのタスクを正確に定義し、結果を自動的に検証できなければなりません。問題は、ベンチマークに組み込めるほど正確に定義された対象は、専門的な最適化の対象にもなり得るということです。その結果、AIエージェントは、そうしたタスクに対して非常に高い性能を示す可能性があります。一方で、ベンチマークの精度が低い原因は、ウェブサイト上でCAPTCHAに遭遇するといった偶発的な失敗にあるかもしれません。これは、エージェント自体には基礎となるタスクを解決する能力がある場合でも起こり得ます。
こうした限界に対処するため、多くの研究者が新しいタイプの評価に目を向け始めています。それは、ベンチマークを超え、より長い時間をかけて、より混沌とした現実世界の状況で行う評価です。AnthropicのNicholas Carliniは、Claudeエージェントを使ってLinuxカーネルをコンパイルできるCコンパイラを構築しました。AnthropicとAndon Labsはまた、Claudeに会社のオフィスにある小さな店舗の運営を任せる自由形式の実験を設計しました。ベンチマークには通常、数十件のタスクが含まれ、自動化された方法で評価されます。一方、オープンワールド評価ではサンプル数が少なく、人間による介入が必要になることも多いうえ、エージェントのログを分析するなど、オープンエンドな方法で評価が行われます。
このような評価は科学的ではないと考えたくなるのも無理はありません。評価ごとのサンプル数は1件であり、標準化や再現性にも欠けるからです。それでも私たちは、AIの能力に関する証拠を収集するうえで、こうした評価は重要だと考えています。オープンワールド評価は、新たに現れつつある能力を早期に警告し、社会のレジリエンスを構築する取り組みに情報を提供し、既存のベンチマークに潜む盲点を評価担当者が発見する助けとなります。また、企業がAIシステムによって近い将来どのようなタスクを実行できるようになるのかをより明確に把握し、AIに関する戦略的意思決定に役立てることもできます。私たちは、これをオープンワールド評価と呼びます。
本稿では、オープンワールド評価を概念化し、過去の事例を振り返ることで、この種の評価を実施する際のベストプラクティスと潜在的な問題を明らかにします。さらに、オープンワールド評価を定期的に実施することを目的としたCRUXプロジェクトを紹介します。主な論点は以下のとおりです。
オープンワールド評価は、重要な新興AI評価の一類型です。AIシステムの能力が向上し続けるにつれて、最先端の能力を引き出すための評価も、より複雑にならなければなりません。オープンワールド評価は、複雑さを増し続けるさまざまな評価手法の中で、最新の類型です。私たちは、過去1年間に実施された代表的なオープンワールド評価10件を調査し、ベストプラクティスと重要な知見を明らかにしました。
CRUX(Collaborative Research for Updating AI eXpectations、AIに対する期待を更新するための共同研究)は、オープンワールド評価を体系的に実施するための私たちの試みです。チームのメンバーは政府、学術界、非営利組織から集まっており、その多くがこれまでにオープンワールド評価を主導してきました。また、AIの今後の発展についても、さまざまに異なる見通しを持っています。私たちの目標は、たとえ現時点では実施コストが高くても、AIシステムの現在の能力に関する実証的な証拠を提供することです。同時に、近い将来に普及する可能性のある能力について、早期警告を発することも目指しています。新たなオープンワールド評価は定期的に公開する予定です。
CRUXの最初の実験では、AIエージェントに簡単なiOSアプリを開発させ、App Storeに公開させました。多くのベンチマークは、エージェントがコードを書く能力を評価します。しかし、iOSアプリを公開するには、その他にも多くの手順が必要です。たとえば、アプリへの署名、ウェブ上でのプライバシーポリシーの公開、Appleのフォームへの記入、審査プロセスへの対応などです。私たちが重視したのは、エージェントがコードを書けるかどうかではなく、アプリの公開に必要な現実世界の要件を満たせるかどうかでした。そのため、簡単なアプリを構築し、iOS App Storeへの申請手続きを完了するよう求めました。
エージェントは2つのミスを犯したものの、タスクを成功裏に完了しました。そのうち1つには人間の介入が必要でした(正しい認証情報の保存場所を忘れたこと、そしてApp Storeの審査プロセスで存在しない電話番号をでっち上げたことです)。このアプリの開発と公開にかかった費用は約1,000ドルでした。アプリは現在、iOS App Storeで公開されています。費用は本来、もっと低く抑えられたはずです。アプリの開発と申請にかかった費用はわずか25ドルで、大半のトークンはアプリの状態の監視に消費されました。私たちは、論文発表の1か月前にAppleへ連絡し、実験結果を開示しました。App Storeの運営者は、スパムアプリの申請に備え、ガバナンスを強化すべきです。近い将来、エージェントが自律的に申請したアプリが数千件も見られるようになる可能性があるからです。
オープンワールド評価をどのように改善すべきでしょうか。次のステップは何でしょうか。オープンワールド評価の有用性を高めるため、評価担当者は、どのような、またどの程度の人間による介入を許可するのかを明確に定めるべきです。また、エージェントがタスクを解決する過程で収集されたログを公開し、そのログを分析して、タスクの解決中にエージェントがどのような行動を取ったのかを報告する必要があります。今後のCRUX評価では、AI研究開発の自動化、AIガバナンス、その他多くの分野を評価する予定です。
オープンワールド評価は、重要な新興AI評価の一類型です
本節では、オープンワールド評価を定義し、この種の評価によって形成されつつあるエコシステムを調査することで、成功事例と限界を明らかにします。また、オープンワールド評価がベンチマークの盲点の一部を克服できる分野についても論じます。私たちは、AIシステムの能力が向上し続けるにつれて、最先端の能力を引き出すために用いられる