コンテンツにスキップ
メインサイト ニュース コンソール

GoogleのAIエージェントは本当に916ドルでOSを構築したのか?

· Normal Tech (AI Snake Oil) 翻訳済
分析实践

著者:Stephan Rabanser、Sayash Kapoor、Rishi Bommasani、Andrew Schwartz、Arvind Narayanan

今週初め、Google は開発者向けカンファレンスで、最新モデルの Gemini 3.5 Flash と、新たなエージェントアプリケーション Antigravity 2.0 を発表しました。この新しいエージェントシステムの能力を示すため、Google はエージェントのチームが完全なオペレーティングシステムを構築したと主張しました。報道によれば、この作業に必要だったのは1つのプロンプトだけで、API 費用は約900ドル、数十のサブエージェントが連携して作業を実行したとされています。

これはつまり、AI が今や低コストで複雑なソフトウェアを構築できるということなのでしょうか? 結論を急ぐべきではありません。

  • 「単一のプロンプト」という説明は誤解を招きます。 ブログ記事では、このオペレーティングシステムは単一のプロンプトによって構築されたと説明されています。しかし記事の中ほどで、Google はそのプロンプトが「最終的には数千行に及んだ」と明らかにしています。このプロンプトを生成するために何回の試行が行われたのでしょうか? エージェントへの指示はどの程度具体的だったのでしょうか? こうした重要な詳細がなければ、本当の秘訣がより優れたモデルにあるのか、それともプロンプトにより多くの労力を投入したことにあるのかを判断するのは困難です。さらに、今回の実行は、専門化された役割、サブエージェントへのタスク委任、不正行為の検出・防止を担うエージェントなどを含むスキャフォールディング(scaffold)1上で行われました。発表ブログで、Google はこのスキャフォールディングを製品機能の一部として扱っています。しかし、このスキャフォールディングが「ゼロからオペレーティングシステムを構築する」というタスクに対して過度に特化されていたのか、あるいは他の複雑なソフトウェアエンジニアリングのタスクでも同じように優れた成果を上げられるのかは、分かっていません。

  • Google の記事では、どのようなケースが人間による介入に当たるのかが明確に示されていません。 記事では、オペレーティングシステムの開発における最終実行について、「人間による追加の指示や修正を必要としなかった」と説明されています。しかし、この基準は定義されていません。記事では、停止したエージェントを終了して再起動するための基盤について説明しています。また、より初期の実行ではエージェントが不正行為をしていたようで、その後チームが不正防止策を追加してタスクを再実行したとも述べています。しかし、こうした試行は方法論の説明には含まれていません。さらに、エージェントが人間に支援を求めてエスカレーションしたかどうか、最終実行に人間による再起動・承認・修正が必要だったかどうか、エージェントが成功するまでに何回試行したかについても、明確に説明されていません。

  • エージェントがコードをゼロから記述したのか、それともインターネット上の既存コードをコピーしたのかを判断するための分析を、記事は一切報告していません。 もっとも、Google がブログ記事で、玩具的なオペレーティングシステムは学部課程でよく扱われるプロジェクトであり、公開された実装も容易に見つかると指摘している点は評価できます。記事自体も、エージェントがゼロからオペレーティングシステムを構築したのではなく、既存の情報を単に再現しただけではないかという懸念を示しています。しかし、この懸念には答えていません。エージェントが既存コードをコピーしたかどうかを確認するための類似度分析やログ分析は行われていないのです。仮に直接的なコピーがなかったとしても、関連するパターンがすでに学習データに記憶されているため、エージェントにとってオペレーティングシステムの記述が比較的容易だった可能性はあります。したがって、この結果だけでは、エージェントが新規性のあるソフトウェアを作成する能力を十分に示したとは言えません。

  • Google は、長大なプロンプト、エージェントが記述したコード、実行ログのいずれも公開していないため、これらの主張を独立に評価することはできません。 ソースコードやエージェントのログが公開されれば、独立した研究者が成果物の品質を評価し、エージェントが既存コードをコピーしたかどうかといった問題にも答えられるようになります。ブログ記事に含まれているのは、開発の進捗を記録した短い動画の一場面と、実験全体の概要だけです。

一方で、ブログ記事はこのオペレーティングシステムの構築にかかった正確な費用(916.92ドル)と、トークンの総予算(合計26億トークン)を報告しています。こうしたデータは有益な背景情報を提供しており、この点は評価できます。私たちが以前調査した評価の多くはコストをまったく開示していなかったため、それらの中心的な結論を他の評価と比較することは困難でした。

とはいえ、Google のブログ記事は実質的にはプレスリリースです。これに科学論文と同等の厳密さを求めるのが現実的でないことは、私たちも理解しています。今回のように、現実世界で長時間にわたるタスクを一度だけ実行し、実験者がエージェントの行動を説明するタイプの評価は、すでに一般的になりつつあります。その多くを AI 企業が実施しているため、この種の評価全体を自己宣伝だとして退けたくなるのも無理はありません。

しかし、それは誤りです。私たちは、現在形成されつつあるこのパラダイムを*オープンワールド評価(open-world evaluations)*と呼び、最近発表した論文と、それに付随するブログ記事でこの傾向について論じました。重要なのは、オープンワールド評価にはまったく新しい方法論上の規範が必要だと、私たちが考えていることです。適切に実施されれば、オープンワールド評価は、ベンチマーク評価では得られない有益な視点を提供できます。

Google の実験は、関連する証拠をさらに積み重ねるものでもあります。すなわち、エージェント、あるいはエージェントのチームは、特定の種類のタスクに長時間にわたって自律的またはほぼ自律的に取り組み、行き詰まったり混乱したりすることなく、継続的に進展できるということです。私たちが論文で論じたように、この種のタスクでは、コストをはじめとするさまざまな理由から、ベンチマーク評価を実施することは実際には困難です。だからこそ今、学術界、非営利組織、政府に属する独立した評価者が関与し、オープンワールド評価に厳密性と信頼性をもたらす絶好の機会なのです。こうした性質が AI ベンダー自身の主張から得られる可能性は、あまり高くありません。

Footnotes

  1. スキャフォールディングとは、AI モデルを中心に構築されたコード、プロンプト、ツールの層であり、モデルに自律的な行動能力を与えるものです。これには、メモリの処理、ツールへのアクセス、環境とのインタラクションなどの機能が含まれます。たとえば Claude Code は、Anthropic の Claude モデルをプログラミングエージェントとして動作させるためのスキャフォールディングです。 ↩