コンテンツにスキップ
メインサイト ニュース コンソール

Atariから『EVE Online』へ:15年にわたるゲームAI研究を基盤に新たな成果を生み出す

· DeepMind 翻訳済
DeepMind

2026年8月21日 研究

Alexandre Moufarek、Adrian Bolton

Atariから囲碁、そして『StarCraft』に至るまで、ゲームは人工知能分野における数々の重大なブレークスルーを後押ししてきました。現在、私たちはゲーム開発者と協力し、新たなゲーム体験のプロトタイプを開発することで、ゲームと人工知能の共進化を推進しています。

DeepMindが2010年に設立されて以来、ゲームによって構築された、制約がありながらも豊かな世界は、知能を理解するうえで重要な役割を果たしてきました。Atariのゲームを習得することから、タンパク質構造予測の問題解決に至るまで、ゲームはAI分野における私たちの最大級のブレークスルーを後押ししてきました。そして現在もなお、ゲームは私たちの活動の中核を担っています。

ゲームはGDMのDNAに組み込まれています。Google DeepMindの共同創設者の一人であるDemis Hassabis自身、かつてゲーム開発者でした。また、GDMチームにも同様の経歴を持つメンバーが数多くいます。私たちは合わせて数十年にわたるゲーム開発の実践経験を積み重ね、ゲーム制作という技術に対して深い敬意を抱き続けています。

私たちは、ゲームを活用してAI研究を行うには、ゲーム開発者との深い協力関係が不可欠だと一貫して考えてきました。たとえば、今年初めに発表した、Fenris Creationsとの重要な研究提携およびEVEユニバースとの協力や、Hello Games、Coffee Stain Studios、Foulball Hangoverをはじめとする著名なスタジオとの取り組みが挙げられます。

ゲーム:AI研究の原動力

私たちの探究は、深層ニューラルネットワークを訓練し、元のピクセル画像だけを見てAtari 2600のゲームをプレイさせる小さなチームから始まりました。深層Qネットワーク(Deep Q-Network、DQN)は、Pong、Breakout、Space Invadersなど、49種類の異なるゲームを習得しました。その過程で、特定のゲームに合わせたエンジニアリング上の最適化は一切行われていません。DQNに関する 2015年の『Nature』論文は、現代の深層強化学習時代の幕開けを後押ししました。

その後、私たちはさらに複雑なゲームの習得に取り組みました。節目となる進展のたびに、より高い能力と優れた汎化性能を備えたシステムが実現しました。AlphaGoは2016年、囲碁の世界チャンピオンである李世乭(イ・セドル)九段を破りました。多くの専門家は、この偉業の実現には少なくともあと10年はかかると考えていました。AlphaGo Zeroは、人間のデータを一切使わず、完全に自己対局のみで学習し、それまでのすべてのバージョンを上回りました。AlphaZeroはこの手法をチェス、将棋、囲碁へと拡張し、1つのアルゴリズムだけでこれら3種類のゲームを習得しました。そしてMuZeroは、ゲームのルールを知らない状態からでもゲームを学習しました。2019年には、AlphaStarがStarCraft IIでグランドマスター級のレベルに到達し、リアルタイムの複雑性や不完全情報に対応できることを示しました。

それぞれのゲームにおいて、AIはプレイヤーの体験を豊かにしました。AlphaGoの有名な37手目はあまりにも意外な一手だったため、プロの解説者でさえ最初はミスだと思ったほどです。この一手は、数百年にわたって囲碁界で形成されてきた従来の常識を覆し、専門家たちに新たな戦略の探究を促しました。AlphaZeroもまた、チェス界にまったく新しい指し手の可能性を示しました。さらに重要なのは、ゲームで成功した探究の精神が、他のAIシステムにも大きな影響を与えたことです。AlphaFoldは、こうした基盤技術をタンパク質構造予測という50年にわたる重大な課題の解決に応用しました。このブレークスルーは最終的に、2024年のノーベル化学賞によって認められました。

ゲームの習得からゲームの理解へ

私たちの初期の研究は、明確な目標と十分な訓練があれば、AIはあらゆるゲームを習得できることを示しました。しかし、現実世界にはスコアもルールブックもありません。そこで私たちは、根本的に異なる問いを立てました。AIは、人間のようにあらゆるゲーム世界を理解し、そこに関わることができるのでしょうか。

これこそが、SIMAが解決しようとしている課題です。SIMAは、Scalable Instructable Multiworld Agent(拡張可能で指示可能なマルチワールドエージェント)の略称です。SIMAは高得点の獲得を最適化するのではなく、汎用エージェントとして動作します。プレイヤーが画面上で見ているものを「見て」、自然言語による指示を理解し、一般的なキーボードとマウスを使って操作できます。APIの利用も、ソースコードへのアクセスも必要ありません。

Geminiの最先端AIモデルを基盤とするSIMA 2は、インタラクティブなパートナーとして、リアルタイムの推論と対話を行えます。No Man’s Sky、Valheim、Hydroneerなどのゲームを含む、複雑な3D研究環境やビデオゲームにおいて、人間に近いゲームプレイを実現できます。

ゲーム開発者にとって、真に汎用的なゲームエージェントは、既存のゲームに適用できるAI機能を解放するものです。しかも、ゲームコードを変更する必要はありません。これにより、ゲーム世界を真に理解するAIコンパニオンや、従来のスクリプトシステムでは実現できなかった方法で適応し、反応するノンプレイヤーキャラクター(Non-Player Characters、NPC)など、まったく新しいゲームプレイが可能になります。

汎用ゲームエージェントは、ゲームの制作方法そのものを変える可能性もあります。開発中、ゲームはコードをコミットするたびに変化します。このようなエージェントは、真に堅牢な品質保証(QA)テストを実現できます。ゲームのリリース後も、新しいコンテンツが追加されたり、プレイヤーが予測不能な行動を取ったりした際に、リアルタイムで適応し、スクリプトを書き直すことなく新たな状況へ汎化できます。

SIMAエージェントを安全かつ責任ある形で開発するため、私たちは著名なゲームスタジオと協力し、AI研究に活用するゲームのラインアップを段階的に拡大しています。これにより、より複雑なタスクでエージェントを試し、その能力を高めることができます。将来的には、こうした能力を現実世界の問題解決へ応用できる可能性があります。

ゲーム開発者と協力し、AIとゲーム研究の新たなフロンティアを探る

ゲームスタジオは、専門的な制作技術、他に類を見ないゲーム世界、そしてプレイヤーへの深い理解をもたらします。私たちは、Geminiから生成的インタラクティブ環境、エンボディドエージェント研究に至る最先端のAIに加え、研究の専門知識、チーム独自のゲーム開発経験、インタラクティブ環境向けAIを構築してきた長年の経験を提供します。両者は力を合わせ、画期的な体験を見いだし、AIがあって初めて可能になる前例のないゲームプレイを生み出すことに注力しています。

重要なのは技術そのものではなく、面白い体験です。そのため、私たちはパートナーとともに「語るのではなく、見せる」アプローチを取っています。私たちのチームはゲーム開発者と肩を並べて新しいアイデアを探り、プレイ可能なプロトタイプを構築し、そこから本当に面白いゲームプレイを見つけ出します。

Fenris Creationsとの最新の研究提携は、ゲームAI研究の歴史における新たな章の幕開けとなりました。Fenris Creationsは、EVEユニバースを生み出した独立系スタジオです。

20年以上にわたり、Fenris Creationsはゲーム業界で最も類まれな永続的世界の一つを築いてきました。2003年にリリースされたEVE Onlineは、大規模マルチプレイヤー型の宇宙シミュレーションゲームです。数千人のプレイヤーが一つの宇宙を共有し、その宇宙は20年以上にわたって進化を続けています。プレイヤー主導の経済システムには、現実の需要と供給が存在し、数千の星系にまたがる交易ネットワークが構築されています。勢力間の同盟、紛争、外交によって形作られるこの世界は、人々の相互作用によって発展しています。

AI研究にとって、これは絶好の機会です。絶えず動き、進化し続けるこの世界には、私たちが最先端AIに不可欠だと考える能力が求められます。

  • 継続学習(Continual learning):変化し続ける世界で新たなスキルを獲得しながら、これまでに学んだ内容を忘れないこと。
  • 記憶(Memory):現在のモデルのコンテキストウィンドウでカバーできる範囲をはるかに超える時間スケールで、知識を蓄積し、取り出すこと。
  • 長期的な計画(Long-horizon planning):数週間、数か月、さらには数年にわたる時間軸で推論すること。
  • 複雑なマルチエージェント・ダイナミクス(Complex multi-agent dynamics):大規模な環境において、協力、競争、交渉、経済活動、そして創発的な社会行動に対応すること。

これらの課題は、私たちのより広範な研究計画の中核を成しています。この計画は、経験から継続的に学習し、その学習速度を時間とともに高め続けるシステムの構築を目指すものです。私たちは、こうした最先端の能力によって、.