コンテンツにスキップ
メインサイト ニュース コンソール

[AINews] 性能差は10%、コストは100分の1、速度は1万倍:なぜシミュレーションが主流になりつつあるのか

· Latent Space 翻訳済
播客深度访谈

今日の AI 業界の基準からすると、今日はかなり穏やかな金曜日です。だからこそ、ここで一歩引いて、いったい何が起きているのかを考えてみる時です。私たちの「2025 年の読書リスト」を読んだことがあり、Z.ai GLMに関する私たちの報道を追い、Poolside の方向転換を理解し、私たちの AI for Science 特集を継続的に追い、そして今日の Simile ポッドキャストを聴いたのであれば、あなたは Latent Space の最大の読者層の一人であるだけでなく、おそらく次のようなメンタルモデルを形成していることでしょう。

画像

2022 年以降、生成機械知能のパイプラインを構成する要素は、毎年ひとつずつ、人間が作るものからモデルが作るものへと移行してきました。この変化は段階的でも一様でもありませんでした。転換のたびに、いわば「患者ゼロ」が存在します。ある論文や製品によって、合成されたバージョンが最先端の研究所で初めて基幹構造として採用され、その時点で未来はすでに到来しているのです。ただし、まだ製品化されていないだけです。

少し目を細めて見れば、私たちがこれまで「合成データ」「合成評価基準」「AI 研究員」「エンドツーエンド強化学習環境」と呼んできたものは、実のところすべて、ますます野心的になっていく人間のシミュレーションにすぎないことが分かります。性能は 10% 劣るものの、コストは 100 分の 1、速度は 10,000 倍です。

フェーズ 1:報酬シグナル(2022 年)

最初に合成へと移行したものは、意外にも評価者でした。InstructGPT は、今や古典的となった手法を確立しました。人間の嗜好を一度だけ収集して報酬モデルを訓練し、その後は人間ではなくモデルに対して方策を最適化するのです。方策の視点から見れば、承認を与える存在はすでに LLM です。

Constitutional AI はさらに一歩進み、AI に一連の原則に基づいて自己批評を行わせました(RLAIF)。その後、Lee らは、AI によるフィードバックが、極めて低いコストで人間によるフィードバックに匹敵する効果を達成できることを示しました。LLM-as-judge がデフォルトの評価手法(MT-Bench、AlpacaEval)になる頃には、報酬、批評、評価という一連の承認メカニズムは、すべてモデルがモデルを評価する仕組みになっていました。

フェーズ 2:学習データ(2023 年)

Microsoft の Phi シリーズは、タイトルそのものですでにこの主張を打ち出していました。「必要なのは教科書だけ」。LLM によって合成された教科書レベルのデータで学習した小規模モデルは、パラメータ数から予想される水準をはるかに超える能力を示し、phi-1.5 は、これが偶然ではないことを裏付けました。

Apple の WRAP は、このアプローチをさらに推し進めました。単にデータを生成するのではなく、LLM を使ってインターネット全体を書き換えるのです。これにより、事前学習の効率はおよそ 3 倍に向上します。その後、このパイプラインは産業化へと向かい始めました。NVIDIA は、緩やかなライセンスの下で利用できる合成データ生成パイプラインを主要な売りとして、Nemotron-4 340Bを発表しました。2025 年になると、改めて