コンテンツにスキップ
メインサイト ニュース コンソール

1本の論文がAI研究の評価基準を刷新:中国企業が実践データで2部門首位に

· 量子位
国内AI

世界の大手企業が相次いで注目する AI for Science に、ついに統一基準が登場

今年 8 月、Google のチーフサイエンティストである Jeff Dean 氏が退任し、AI4S 企業 Discovery Loop を設立しました。

同じく今年、OpenAI、Anthropic、NVIDIA などのテクノロジー大手も相次いで AI4S 分野への参入を発表しました。

こうした「異分野からの参入」を果たした大手企業の目標は、非常に明確です。単なる研究支援ツールにとどまらず、「仮説の構築→実験設計→実行・検証→反復的な最適化」という研究サイクル全体を自律的に完遂できる「AI 科学者」を生み出すことです。

こうしたテクノロジー大手だけでなく、早い段階から参入している企業も数多く存在します。2024 年設立の中国企業深度原理は、世界で最も早くから AI による自律的な科学研究に注目してきた企業の一つです。

この分野の先には、広大な「金鉱」が広がっています。AI が自律的な研究サイクルを実現すれば、AI は「ソフトウェアを売る」段階から、新素材や新薬といった兆ドル規模の実体産業を支える生産基盤へと進化できます。

国家戦略の観点からも、この分野は非常に重視されています。AI による科学的発見は、中国の新たな科学技術強国戦略に組み込まれています。

業界が盛り上がるほど、避けて通れない問いがあります。それは、こうした「AI 科学者」がどれほど優れた成果を上げているのかを、どのように評価するかという問題です。

従来の評価基準では、もはや不十分

長らく、AI の科学研究能力を測る業界共通の指標は、HLE のような知識を問う筆記試験でした。

こうした試験は本質的に、最終的な答えだけを評価するテストです。結果だけを見て、答えに至るまでの過程は考慮しません。

高得点を獲得した AI 研究ツールでも、実際の実験を一度行わせるだけで、問題が露呈することが少なくありません。文献を流暢に引用できても、異常なデータを前に立ち止まって検証・反省できない場合があります。また、一見もっともらしく筋が通っているように見えても、実際には実行できない実験計画を提示することもあります。

8 月 19 日、『Measuring AI Scientists: From Exams to Discovery』と題する論文が発表され、「AI が実際の科学研究をどの程度遂行できるか」を評価するための、体系的かつ包括的な評価パラダイムが初めて提案されました。これにより、従来欠けていた評価基準が正式に補われました。

この論文は、中国の AI4S 企業である深度原理(Deep Principle)が、Microsoft Research、スタンフォード大学、FutureHouse、Edison Scientific、アレン人工知能研究所、カリフォルニア大学バークレー校など、世界有数の産学官研究機関と共同で執筆したものです。

世界最大級の材料オープンデータプロジェクト Materials Genome とデータベース Materials Project の創設者である Kristin Persson 氏、FutureHouse と Edison Scientific の創設者であり、最近『Nature』誌に掲載された Co-Scientist 論文の中心著者である Andrew White 氏、科学研究エージェント評価のベンチマークである ScienceWorld の中心開発者 Peter Jansen 氏、2023 年に『Nature』誌で発表された AI4S 総説論文の筆頭著者 Yuanqi Du 氏、Terminal Bench の最終責任著者 Ludwig Schmidt 氏など、AI4S 分野を代表する研究者たちが参加し、このフレームワークの学術的権威性を支えています。

深度原理は、中国から参加した唯一の産業界代表として、実際の研究開発パイプラインで蓄積してきた現場経験を生かし、このフレームワークに実装可能な実用性をもたらしました。

論文には、ノーベル化学賞受賞者 Frances Arnold 氏の署名も含まれています。AI を専門としているわけではなく、AI4S 分野で公に活動することもほとんどなかった同氏が参加したことは、科学界の権威がこの分野をますます重視していることを示しています。

2026 年、テクノロジー大手からスタートアップまで、さまざまな企業が AI 科学研究の分野に参入し、業界の競争は激しさを増しています。このタイミングで今回の評価体系が登場したのは、必然ともいえるでしょう。

AI の科学研究能力を体系的かつ包括的に評価する方法

この論文の中核となる革新は、**発見エピソード(discovery episode)**という評価体系を提案したことです。

この体系の基本的な考え方は、「総合評価」の形式で、研究サイクル全体における AI の意思決定を一つひとつ記録し、最終的に一連の完全な軌跡について、科学性、厳密性、有効性を総合的に評価することです。

この評価方法は、従来の「試験対策型」のロジックとは大きく異なります。

科学研究の閉ループを構成する 3 つの段階――研究仮説、計画の実行、実験結果の解釈――を中心に、この評価体系ではそれぞれに対応する評価軸を設けています。最終的には「全プロセスの閉ループテスト」も実施し、AI が実際の科学的発見を生み出す総合能力を測定します。

△論文では知識評価と発見評価の違いを示し、「発見エピソード」に含まれる評価項目を定義している

この体系では、失敗データの価値も改めて定義されています。失敗した実験データこそが、AI の科学研究能力を訓練・評価するための中核的な資産なのです。

人間の科学者は、失敗から経験を学び、同じ遠回りを避けることができます。AI が科学研究を行う場合も、失敗から学ぶ能力を身につけるべきです。

さらに、この評価では AI による研究成果の真正性と独立性にも高い基準を設けています。実験結果が検証不能な「自己申告の成果」ではなく、「正真正銘」の新発見であることを保証するためです。

深度原理の MIRA は、この体系を体現する実例

この標準論文が発表される以前から、トッププレイヤーたちは製品の中で閉ループのロジックを実現していました。深度原理の MIRA プラットフォームは、その最も代表的な産業界の実例です。

一般的な科学研究 AI は、「質問に答えるツール」として位置づけられています。研究者が明確な質問を提示し、AI が対応する答えを返すというものです。

MIRA の設計思想は、一般的な科学研究 AI とは大きく異なります。MIRA は「仮説生成→シミュレーション計算→実験検証→知識の蓄積」までを網羅する完全な閉ループシステムを構築し、3 層のアーキテクチャによって、実際の研究チームにおける協働プロセス全体を実現しています。

  • 上層は、役割分担しながら協働するマルチエージェントチームで、研究プロセス全体を一元的に計画・調整できます。
  • 中層は、高性能コンピューティングと自動化実験室を接続する 2 つの実行エンジンで、ウェットラボとドライラボの連携を実現します。
  • 下層は、蓄積・再利用が可能な研究メモリシステムです。各プロジェクトのデータや試行錯誤から得られた結論を保存し、後続研究の基盤にできます。

△AI Scientist MIRA の実際の操作画面

この設計が持つ産業上の価値は、公開ベンチマークテストでも検証されています。

化学・エネルギー・材料分野を対象とした総合評価 Research Claw Benchmark と、創薬評価 Science Agent Arena において、MIRA はいずれも 1 位を獲得しました。個別タスクの平均完了コストも業界最低水準にあり、性能とコストの両面で優位性を確立しています。

△Research Claw Benchmark などの評価における MIRA の結果

△Science Agent Arena 創薬ランキング:MIRA は総合スコア 81.1% で 1 位を獲得

深度原理が以前発表した React-OT モデルは、0.4 秒以内に化学反応の遷移状態を計算でき、プラットフォームの基盤となる高精度な計算能力を確立しました。

MIRA は、こうした専門モデルを基盤として、研究プロセス全体をさらに接続しています。この進化の道筋は、AI4S 業界全体がツールからプラットフォームへ、単一機能から閉ループへと発展していく過程を象徴しています。

この評価体系の中核となる産業界の共同創設パートナーとして、深度原理は MIRA と自社構築したハイスループット実験プラットフォームによるウェットラボ・ドライラボの閉ループを活用し、リチウム電池、工業用冷却液、新エネルギー材料などの分野で複数の自社研究開発パイプラインを展開しています。AI が研究の全サイクルを主導し、実際の閉ループデータを蓄積することで、プラットフォームと評価フレームワークの継続的な相互検証と反復改善を実現しています。

ウェットラボとドライラボをまたぐ完全な研究実践データは、AI が仮説の適用範囲を迅速に把握し、同じ試行錯誤を繰り返すことを避けるための中核的な資産です。今後、AI for Science の次なる発展を支える重要なインフラになると見込まれます。

おわりに

この標準的なパラダイムの発表は、AI for Science 分野における一つの画期的な出来事です。挑戦を続けるすべてのプレイヤーに対して、明確な評価基準が示されました。

ただし、この新たな基準を検証するためのデータを用意するのは容易ではありません。深度原理や Edison Scientific のように、化学・材料・生物にわたる研究開発プロセス全体を担う能力を持ち、かつ AI ネイティブな企業でなければ、実現は難しいでしょう。

これまでの前半戦で業界が競っていたのは、「誰がより多くの知識を持っているか」でした。大手企業は基盤モデル、パラメータ数、試験の点数を競い、ますます難しい問題集によってモデルの知識量を証明してきました。

こうした取り組みは AI 科学研究の基礎を築きましたが、同時に、徐々に限界にも近づきつつあります。

これからの後半戦で競われるのは、「誰が本当に成果を生み出せるか」です。

今年に入ってから、海外の大手企業が相次いで参入し、Jeff Dean 氏が Discovery Loop を設立し、さらに中国国内でも深度原理などの企業が研究の閉ループを実践しています。業界全体が、「AI に仮説から発見に至る完全な閉ループを実際に完遂させる」という方向へ進んでいます。

いまや、AI 科学研究の評価基準は、科学そのもののロジックにますます近づいています。AI が真に信頼できる研究開発の生産力となる日は、確実に近づいています。

「発見エピソード」評価体系の設計詳細、テストシナリオ、定量的な基準について詳しく知りたい方は、論文原文をご覧ください。

『Measuring AI Scientists: From Exams to Discovery』

https://doi.org/10.26434/chemrxiv.15007582/v1

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/478568.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →