8月19日午後、世界ロボット大会の分科会「具身知能大規模モデルの進化の道:技術の段階分けから産業実装まで」が、北人亦創国際コンベンションセンターで開催された。生数科技の創設者兼チーフサイエンティストであり、ACM/IEEE/AAAI Fellowでもある朱軍氏が基調講演を行い、チームの最新研究成果を発表するとともに、汎用世界モデルの5段階の発展ロードマップについて体系的に説明した。
朱軍氏は次のように述べた。「大規模モデルの発展という観点から、私たちが構築したいのは、特定のタスクやシーンに特化したモデルではありません。世界を理解し、未来を予測し、行動できる汎用基盤モデルです。」

第一原理から出発し、汎用世界モデルを定義する
世界モデルは、動画生成、環境シミュレーション、ロボットの意思決定、動作制御などの分野へと広がっている。しかし、どのような世界モデルを「汎用」と呼ぶべきかについて、業界ではいまだ共通認識が形成されていない。
人が自転車に乗ったり車を運転したりする際、最初はぎこちなくても、徐々に安定して正確に操作できるようになる。その重要な理由の一つは、脳が外界との継続的な相互作用を通じて、世界がどのように動いているのかについての「内部モデル」を形成することにある。
汎用世界モデルにも、相互に関連する次の3つの能力が求められる。
- 世界を理解する:環境を認識し、現在の状態を判断する。
- 未来を予測する:次に何が起こり得るのか、また異なる行動がどのような結果をもたらすのかを予測する。
- 行動する:デジタル環境や物理環境に影響を与え、現実のフィードバックを利用して理解と予測を修正する。
「汎用世界モデルは、単一の生成器、シミュレーター、ロボット動作モデル、あるいは方策モデルではありません。また、これらの能力を分断した断片や、単純に直列接続したものでもありません。3つの能力が結合した閉ループのフィードバックシステムです。」 朱軍氏はそう強調した。行動は単なるモデルの出力ではなく、環境を変化させ、新たな情報を生み出し、次の理解・予測・意思決定へとつながっていく。

データ、アーキテクチャ、計算能力:汎用世界モデルを構築する3大要素
汎用世界モデルを構築するには、大規模モデルの基本となる3つの要素、すなわちデータ、アーキテクチャ、計算能力が欠かせない。
データについては、汎用世界モデルには、観察から徐々に行動へと進む多層的なデータピラミッドが必要となる。その起点は膨大なウェブ動画であり、そこから特定分野の動画、一人称視点の人間の動画、動作記録付きの人間によるデモンストレーション、そして実際のロボットのインタラクションデータへと段階的に広がっていく。
下層に近いほどデータ規模は大きく、カバー範囲も広い。一方、上層に近づくほどデータは希少でコストも高くなるが、タスク、動作、物理的結果の関係をより直接的に構築できる。合成データは、ピラミッドのあらゆる層を通じて活用できる。また、「不完全なデータ」にも重要な価値がある。失敗した試行、修正動作、リカバリーの過程には有効な学習シグナルが含まれており、ロボットが失敗から回復する方法を学ぶのに役立つ。

アーキテクチャの面では、汎用世界モデルは画像、動画、言語、ロボットの動作など、異なるモダリティの情報を統一的に処理する必要がある。MoT(Mixture-of-Transformers)は、モダリティごとに専用パラメーターを割り当て、共有アテンションによってモダリティ間の情報交換を実現する。これにより、環境理解、世界の状態予測、動作生成を同一モデル内で連携して実行できる。生数科技の世界動作モデル Motubrain は、まさにこのアーキテクチャに基づいており、理解・予測・行動を統一的にモデル化することで、従来のモジュール分割型アプローチにおける能力の分断を解消するとともに、異種データの活用効率とタスク間の転移能力を高めている。
計算能力は、大規模な事前学習とリアルタイム展開の双方に影響を与える。オフラインの動画生成では一定の待ち時間が許容されるが、リアルタイムのインタラクションやロボット制御では、環境が変化する前に予測と意思決定を完了しなければならない。そのため、学習インフラ、推論の高速化、モデル蒸留、高効率アテンション機構は、汎用世界モデルを実用化へと導く重要な支えとなる。
汎用世界モデルはどのように進化するのか? 5段階のロードマップで進化の方向性を明確化
汎用基盤モデルという目標に基づくと、汎用世界モデルは5つの段階に分けて進化していく。これらは互いに分断された製品の方向性ではなく、世界への理解が深まり、世界とのインタラクションが強化されるにつれて、モデルの自律性が継続的に高まっていくプロセスである。過去数年にわたり、生数科技の研究開発と実装の取り組みは、すでにこのうち最初の3段階をカバーしている。

L1:世界生成(World Generation)
第一段階は、モデルに一貫した世界の変化の過程を生成させることである。動画はこの段階における最も典型的な媒体であり、モデルが対象、運動、空間的関係、時間的変化を学習するのを助け、世界をさらに理解・予測するための基盤を築く。
**2024年、生数科技は動画生成大規模モデル Vidu を発表した。**動画品質、時間的一貫性、世界のダイナミクスのモデリング能力を継続的に向上させることで、L1段階における初期的な実践を完了した。
L2:世界とのインタラクション(Interactive World)
生成能力を土台として、モデルはリアルタイム入力を受け取り、言語、音声、制御信号に応じて後続の内容を継続的に変化させるようになる。これは「一度きりの生成」から「継続的なインタラクション」への移行である。
2026年7月に発表された Vidu S1 は、この能力をリアルタイムインタラクションの段階へと進化させた。ユーザーは音声を通じて生成プロセスにリアルタイムで介入し、その後の展開に継続的な影響を与えられる。これにより、モデルは外部入力に応じて世界を動的に変化させることが可能になった。
L3:世界内での行動(Actionable World)
さらに一歩進むと、モデルはデジタル世界から物理世界へと踏み出す。この段階では、環境理解、未来予測、動作生成を真に統合しなければならない。モデルは世界で何が起きているかを判断するだけでなく、ロボットが実行可能な動作を直接生成し、現実のフィードバックに基づいて継続的に修正できる必要がある。
Motus と Motubrain は、生数科技が動画生成から物理的な行動へと進んだことを示すものである。Motus は2025年12月に発表され、全面的にオープンソース化された。 2026年4月に発表された Motubrain は、環境理解、世界の状態予測、動作軌道生成を単一のモデルに統合し、汎用世界モデルを「視覚的な推演」から「物理的な意思決定」へと前進させた。
Motus と比べて、**Motubrain は推論速度が約10倍向上している。**新たなロボット本体に適応させる際も、人間によるデモンストレーションデータはわずか50~100件で済む。 RoboTwin 2.0 ベンチマークでは、**96.1点を獲得して首位となった。**現在、Motubrain は銀河通用、星塵智能、千尋智能などを含む約10種類のロボット本体で検証を完了しており、長期タスク、多タスクのシナリオ、異なるロボット形態にまたがる汎化能力を示している。
L4:自律型ワールドエージェント(Autonomous World Agent)
現実世界で行動できるようになった後、モデルはさらに自律的な意思決定へと進む必要がある。長期的な目標に向けて環境を能動的に認識し、タスクを分解し、未知の状態を探索しながら、行動を継続的に計画できなければならない。
L5:ワールドオーケストレーター(World Orchestrator)
さらに高い段階では、モデルは単一のエージェントを制御するだけでなく、ロボット、デジタルエージェント、人間、ツール、その他のリソースを統括し、より複雑なタスク配分とマルチエージェント協調を実現する。
L1からL5にかけて、能力は段階的に高度化していく。世界の変化の法則を学習・予測できなければ、安定した継続的なインタラクションを形成することは難しい。また、現実の行動から得られる環境フィードバックがなければ、自律学習、長期計画、複雑な協調能力をさらに発展させることも困難である。
L4、L5に向けて、さらに突破すべき6つの重要課題
現在、L1からL3については、比較的具体的な技術実践が形成されている。しかし、より高度な世界知能の実現にはなお隔たりがある。動画モデルは、生成品質、制御性、時空間的一貫性を継続的に高める必要がある。また、世界動作モデルは、より複雑で開かれた現実環境において、安定性、汎化能力、実行効率をさらに向上させなければならない。
L4とL5へ進むには、次の6つの重要課題を突破する必要がある。
- 理解、予測、行動、転移能力を網羅する統合評価体系を構築する。
- 接触、摩擦、作用力、介入後の結果など、現実の物理法則を学習する。
- 持続的かつ修正可能な記憶を形成する。
- 現実世界とのインタラクションを通じて、オンライン学習と自己進化を実現する。
- 現実のレイテンシーとリソース制約を満たす、高効率な閉ループ展開を実現する。
- 安全性と制御可能性をさらに強化する。
この方向性に沿って、生数科技は今後も世界生成、世界とのインタラクション、世界内での行動という3つの段階を継続的に強化するとともに、目標形成、能動的探索、継続学習、長期記憶などの能力をさらに補完し、より高度な自律型ワールドエージェントの基盤を築いていく。より長期的な目標は、世界を継続的に理解し、異なる行動の結果を予測し、明確な制約のもとで自律的に行動し、現実のフィードバックから絶えず学習・進化できる汎用基盤モデルを構築することである。
理解、予測、行動が真の閉ループを形成したとき、世界モデルはもはや単にコンテンツを生成するモデルでも、タスクを実行するロボットの方策でもなくなる。それはデジタル世界と物理世界をつなぎ、汎用的な具身知能へと進むための重要な基盤となる。
ブログリンク:https://www.shengshu.com/zh/general-world-model/
本稿は生数科技が提供し、量子位が許諾を得て転載したものです。見解は原著者に帰属します。