8月19日、世界ロボット大会(WRC 2026)の期間中、跨维智能が主催し、『財経』誌が協催する「Physical AIリーダーフォーラム暨2026『財経』中国AI 100ランキング始動式」が北京で開催された。フォーラムは「Physical AIの現在進行形」をテーマに、具現知能分野を代表するトップクラスの研究者、企業創業者、第一線の技術責任者が一堂に会し、汎用物理知能の技術進化と産業化への道筋について議論した。
ネイティブなフルモダリティ世界モデルを代表する企業である智象未来(HiDream.ai)の創業者兼CEO、梅涛氏は、「ネイティブなフルモダリティ世界モデル:“世界のシミュレーション”から“世界とのインタラクション”へ」と題した基調講演を行った。AI大規模モデルの技術進化の潮流を起点に、大規模モデルがマルチモーダルからネイティブなフルモダリティへ、シミュレーション世界からインタラクティブな世界へと進化する核心的なロジックを体系的に説明し、Physical AIの基盤能力を構築するための新たな技術的視点と道筋を示した。
01 高いIQは万能を意味しない:AIは「世界を理解する」段階から「世界を変える」段階へ
梅涛博士は講演の中で、過去数年間におけるAI大規模モデルの発展は、まさに日進月歩だったと指摘した。大規模言語モデルからマルチモーダルモデル、さらに具現知能へと、かつては独立して進化していた3つの技術路線が急速に融合しつつあり、2026年は多くの人から「世界モデル元年」と呼ばれている。

同氏は、次のようなデータを紹介した。今年初めの時点で、最先端の大規模モデルのIQは約130で、中国科学技術大学の少年班に在籍する天才児に相当する水準だった。それが現在では、最新の大規模モデルのIQは140近くに達している。しかし梅涛氏は、ここで重要な点として「高いIQは万能を意味しない」と強調した。子どもの成績が良いからといって総合的な能力が高いとは限らないのと同じように、試験で優れた成績を収めるモデルが、現実の物理世界で長期にわたり安定して信頼性の高いタスク遂行能力を持つとは限らない。これこそが、Physical AIが重要である根本的な理由だ。
大規模言語モデルは世界の理解、知識の圧縮、推論に優れ、マルチモーダルモデルは世界の生成と予測に優れ、具現インタラクションモデルは世界とのインタラクションに優れている。真の世界モデルには、世界の状態を完全に表現する能力、物理法則と因果関係を推論する能力、そして世界を再構成する能力が同時に求められる。テキスト、マルチモーダル、具現化へと、これまで独立して進化してきた3つの路線は、現在、急速に融合しつつある。

02 DiTからUiTへ:ネイティブなフルモダリティ・アーキテクチャが業界の上限を突破
自社開発のUiT(Unified Transformer)アーキテクチャを基盤として、智象未来は先ごろ、ネイティブなフルモダリティ対応のインタラクティブ世界モデルHiDream-O1-Worldを正式に発表した。同モデルは初参加ながら、権威あるベンチマークWBenchのNaviサブランキングで首位を獲得した。
HiDream-O1-Worldは、テキスト、画像、インタラクティブな操作などのマルチモーダル入力に対応し、ローミング、編集、インタラクションという3つの主要機能を備えている。また、多様な主体やスタイルのシーン構築にも対応しており、現実空間を高精度に再現できるだけでなく、二次元カートゥーンやAAAゲームのレンダリングなど、さまざまなスタイルの世界も生成できる。
技術的な中核を見ると、HiDream-O1-Worldの最大のブレークスルーは、長時間にわたる時空間的一貫性と物理的一貫性にある。これにより、モデルは長期的なインタラクションの中で探索済みのシーン構造を「記憶」し、複雑なインタラクションにおいても高い物理的妥当性を維持できる。
HiDream-O1-Worldは、まったく新しい産業応用の可能性を切り開きつつある。AIインタラクティブ映画・ゲームでは、ユーザーが物語の能動的な参加者となる。具現知能のシミュレーションでは、高忠実度の仮想トレーニング基盤を構築できる。3Dシーン生成では、クリエイターが構造の整った3D空間を効率的に生成でき、アイデアから完成品に至るまでの反復プロセスを大幅に短縮できる。
これを起点として、智象未来は世界モデルの定義をめぐって継続的に領域を拡張し、画像モデル、動画モデル、インタラクティブ世界モデルなどを網羅するモデルマトリクスを段階的に整備している。
03 データ・モデル・エージェント・具現システム:物理世界をつなぐ閉ループ
**具現知能の能力基盤について、梅涛博士は重要な関係を次のように要約した。「世界モデルと具現知能の発展には、データ、世界モデル、エージェント、そして具現システムをつなぐことが必要です。」**データが認知を構築し、世界モデルが世界の状態を理解して物理法則を推論し、エージェントが予測結果に基づいて意思決定と計画を行い、具現システムが現実世界で実行する。そして、現実環境からのフィードバックが再び戻り、新たな学習データとなる。こうして、「データ―認知―行動―フィードバック」という閉ループのフライホイールが形成される。梅涛博士は、世界モデルこそがこのフライホイールにおける認知中枢であり、高品質な世界モデルがなければ、シミュレーションを現実の物理環境に近づけることは難しく、具現知能のデータフライホイールも真に回り始めないと述べた。
最下層に位置するのはデータ基盤であり、「インターネット上の事前学習データ、シミュレーションによる物理的試行錯誤データ、行動閉ループから得られる実際のインタラクションデータ」の3種類が含まれる。これらはいずれも欠かすことができない。現実環境における行動のフィードバックは再び戻り、新たな学習データとなってフライホイールを加速させ続ける。インターネット上の事前学習データを例に挙げると、智象未来はすでに1,000万時間近くに及ぶ動画データを蓄積している。
中間層は世界モデルであり、具現知能の中核として、世界の法則を推論し、「世界とは何か」「次に何が起こるのか」という問いに答える。最上層はエージェントと具現システムで、世界モデルの予測結果に基づいて自律的に意思決定し、具現システムが物理的な動作を実行することで、認知から行動までの完全な閉ループを実現する。
梅涛博士は、Physical AIにおけるシミュレーションデータの価値を特に強調した。智象未来とNOITOM Roboticsの協業を例に挙げ、実際に収集した人体動作データをネイティブなフルモダリティ大規模モデルで拡張処理することで、物理的制約に適合した大量の動画を生成できると説明した。つまり、同じ動作を異なる背景、異なるシーン、異なる肌の色で再現しても、一貫性を保つことができる。このデータ拡張能力により、実データの収集にかかるコストと負担を大幅に軽減できるため、ロボットはまずシミュレーション環境で学習し、その後、現実環境で訓練を行えるようになる。
こうした取り組みの背景には、AIの今後の進化の方向性に対する智象の一貫した判断がある。大規模モデルはAIに世界を理解させ、エージェントと具現システムはAIを世界で行動させる。そして、ネイティブなフルモダリティ世界モデルは、認知、行動、フィードバックを一体化し、AIが物理世界で継続的に学習・進化する能力を真に備えることを可能にする。
シミュレーション世界から世界の理解へ、世界の推論から世界とのインタラクションへ。智象未来は今後もネイティブなフルモダリティ世界モデルに注力し、技術革新とエコシステム連携の両輪で、デジタル知能に貢献するとともに、現実の物理環境における具現知能の訓練と実行の実装を加速させていく。これにより、Physical AIが技術探索の段階から、大規模化・商用化という新たな発展段階へと移行することを後押ししていく。