1枚の画像から直接シーン生成、トップ会議の最優秀論文が実用化
鷺羽 凹非寺発
すごすぎる!3D生成が、ついに**「モノをつくる」段階から「世界をつくる」**段階へ、一歩踏み出した!
『インセプション』を見たことがあるだろうか?夢の設計士が両手を軽く動かすだけで、物理法則に従って街路が折り畳まれ、建物が次々と立ち上がっていく。
いま、3D生成の世界でも似たような光景が現実になりつつある。
シーン画像を1枚アップロードするだけで、2~3分後には、完全な3Dシーンがそのまま生成される。
テーブルの上の器は単独で持ち上げられ、椅子は回転させたり移動させたりできる。気に入らない家具も、いつでも置き換えられる……
ただ眺めるだけの3D映像とは違い、ここではすべてのアセットが**「生きている」**。

牛だけでなく、馬も来るし、虎も来る!

この一歩を踏み出したのは、3D生成分野の有力プレイヤーである影眸Hyper3Dだ。同社はこのほど、世界生成モデルWorldGenを正式リリースし、3D生成を単一アセットから完全なシーンへと押し広げた。
業界で広く使われている「世界モデル」という概念に比べ、WorldGenの位置づけはより具体的で明確だ。
単に眺めるだけの世界を生成するのではなく、インタラクティブで、編集可能、そして実際の制作環境に投入できる3Dシーンを提供する。
レゴブロックのように、モジュールを継続的に追加できるだけでなく、任意のブロックをいつでも取り外したり交換したりできる。しかも、それぞれのブロックには物理属性が備わっている。誤って重要な支えを取り除けば、周囲の物体も移動したり落下したりする。
簡単に言えば、ここにある各アセットは背景と完全に固定されているわけではなく、アセット同士の間にも明確な物理的関係がある。
より具体的であるからこそ、実際の業務にも近い。
ゲームにはステージが必要で、映像制作には撮影現場が必要、ロボットには訓練環境が必要だ……いまや、これらすべてをWorldGenから始められる。すでに実際の制作現場に投入できるだけの生成能力を備えている。
この道のりも、決して突然現れたものではない。昨年、影眸Hyper3Dは自社開発のシーンレベル生成技術CASTによって、グラフィックス分野の国際トップカンファレンスSIGGRAPH 2025最優秀論文を受賞している。
同時期に受賞した企業は、GoogleとMetaだけだった。
そしてCASTこそが、WorldGenの技術基盤である。

つまり、AI 3Dの第一歩が「物体はどのような姿をしているか」という問いへの回答だとすれば、WorldGenが答えるのは次の問いだ。
複数の物体が、空間的な関係と物理属性を備えながら、どのように1つのシーンを構成するのか。
1枚の画像→複数のアセット→1つのシーン
現在、ほとんどの一体型シーン生成には、共通する問題がある。
見栄えはいいが、実用性に乏しい。
ユーザーがシーン内でできることは限られており、基本的には歩き回って眺めるだけだ。変更したい?残念ながら、最初から作り直すしかない。

問題の根本は、生成方式にある。影眸Hyper3Dの創業者兼CEOである呉迪氏の言葉を借りれば、次のとおりだ。
従来の手法では、シーン全体を1つのモデルとして直接生成するため、すべての内容が分解できない一体物に統合されやすく、シーンをその後も活用するのが困難でした。
WorldGenの重要な変化は、シーンを個別に操作できるアセットへと分解しながら、それらの空間的・物理的な関係を維持することです。
生成プロセスを分解すると、次のようになる。
公式サイト(https://hyper3d.ai)を開き、WorldGen生成を選択する。

ここでは、カートゥーン調のキッチンの一部を写した画像をアップロードする。
システムが画像内の主要な物体を自動認識するほか、手動で範囲を選択し、生成対象を個別に指定することもできる。
続いて、前景にある各物体が独立したアセットとして1つずつ生成され、約2~3秒でプレビューが完成する。

背景環境には3D Gaussian Splattingを用いて補完を行い、視覚的な一貫性を保つ。生成プロセス全体は2~3分に短縮できる。

SimReadyモードをオンにすると、各アセットにコリジョン形状が追加され、質量、摩擦係数、反発係数など、シミュレーションに必要な物理属性も推定される。

最終的に、**3D版『Overcooked!』**が見事に再現された。
シーンの初稿が手に入れば、業界での活用も容易になる。
まずは、データ需要が最も切迫しているEmbodied AIから見てみよう。

実環境でのデータ収集では、場所、設備、人員にかかるコストを負担しなければならないうえ、火災や崩落といった危険な環境を安全に再現することもできない。一方、従来のシミュレーションは代替手段になり得るものの、エンジニアが長時間かけてシーンを手作業で構築する必要があり、コストが高く、現実とのずれも大きかった。
WorldGenは、この両者の間で絶妙なバランスを実現する。
影眸Hyper3D、地瓜机器人、谋先飞が今年7月に共同発表したクローズドループのソリューションを例に見てみよう。
WorldGenは実画像からインタラクティブな3Dシーンを生成し、シーン内の3Dオブジェクトはすべてシミュレーション環境へインポートできる。

谋先飞のMotrixSimエンジンは、物理演算と並列シミュレーションを担い、ロボットがその中で移動、物体把持、インタラクションを行えるようにする。

地瓜机器人は、コンピューティングリソースと開発ツールチェーンを提供する。

3社の統合により、シーンの準備、シミュレーションの実行、データ収集、ポリシー検証までを網羅する完全なワークフローが形成された。
NVIDIA Inception(スタートアップ向けアクセラレーションプログラム)の一員でもある影眸Hyper3Dは、WorldGenを通じてNVIDIAのグローバルなシミュレーションエコシステムとの連携をさらに進め、「単一アセットをIsaac Simで利用する」段階から、**「シーン全体をIsaac Simで利用する」**段階へと拡張している。
ゲーム業界での使い方は、さらに直接的だ。
これまでは、1枚のレベルコンセプト画像を受け取った後、アーティストとプランナーが数多くの作業をこなす必要があった。
画像から3Dを生成する技術によって、単一アセットの制作時間は短縮できるようになったが、最終的には人間がそれらのアセットを1つずつ組み立てなければならない。
WorldGenは、この作業をさらに前倒ししようとしている。
まずコンセプト画像から、オブジェクト化されたシーンを生成する。プランナーは動線や空間を確認でき、レベルデザイナーは小道具を移動・置換できる。アーティストは、どの重要アセットをさらに精密に仕上げる価値があるかを判断できる。
さらに便利なのは、WorldGenで生成された独立アセットを、Blender、Unity、PlayCanvas、团结引擎、Unreal EngineなどのDCCやリアルタイムエンジン環境へ直接取り込み、マテリアル調整、アニメーションのリギング、レベル編集、パフォーマンス最適化などの二次制作を行える点だ。

今年7月、影眸Hyper3DはすでにUnity Chinaと提携し、3D生成からリアルタイムゲームへの応用までをつなぐエンジニアリング上の閉ループを共同で構築している。
チームによると、WorldGenはベータテスト期間中から、複数のゲーム関係者から関心を寄せられていたという。

映像業界が注目しているのは、WorldGenが**「監督席」**となる可能性だ。
呉迪氏は、非常に具体的な例を挙げている。
監督が、画面左側の皿にあるリンゴを右側の皿へ移したいとします。純粋な動画生成では、これを安定して制御するのは困難です。
WorldGenで制御可能な3D基盤を構築し、そのうえで動画生成モデルを使って最終的な画質を高めれば、より直接的に実現できます。

すでに、WorldGenとSeedance 2.5を組み合わせて利用しているクリエイターもいる。
WorldGenで3Dシーンを用意すれば、カメラワークや構図の調整を簡単に行える。その後、動画生成モデルに渡して、人物の演技、マテリアル、光と影、最終的なスタイルを補完する。

WorldGenのAI Renderモジュールには、AIレンダリングや自由なカメラワークなどの機能も備わっている。同じシーンで複数のビジュアルスタイルを切り替えられるため、製品コンセプトのデモンストレーションや空間案内などのコンテンツでも、制作効率と品質を同時に高められる。

この新しい使い方によって、映像生成は「制御性」と「見栄え」のどちらかを選ぶ必要がなくなり、最初から大作クラスの映像を生み出せるようになる。
関係者によると、WorldGenはすでに実際の映像制作プロジェクトのワークフローに導入されており、関連作品は完成後、順次公開される予定だ。

XRと空間コンピューティングは、その汎用性を実証する分野だ。
シーンを任意の視点から観察でき、主要なオブジェクトを置き換えたり移動したりできるのであれば、普通の写真1枚が、入り込んで見回し、調整できる没入型空間へと変わる可能性がある。
インテリアデザイン、没入型教育、空間展示などが、その有望な活用先となる。
Apple Vision ProなどのXRデバイスと組み合わせれば、『レディ・プレイヤー1』の世界が現実になる。

もちろん、これらはWorldGenの活用方法のほんの一部にすぎない。その可能性は無限に広がっており、さらなる探索が待たれている。
トップ会議の最優秀論文から製品化へ、WorldGenが丸一年かけて積み上げたもの
WorldGenがどのようにして一気に飛躍したのかを理解するには、まず昨年発表されたCAST論文から振り返る必要がある。
シーン生成は、なぜ難しいのか?
画像から3Dへの変換を十数回連続で実行すれば実現できる、というものではない。1枚の画像にはそもそも、奥行き、実寸、物体の背面に関する情報が欠けているうえ、遮蔽や透視歪みも存在する。
たとえば、リンゴが皿に隠れている場合、モデルはまず見えない部分を補完しなければならない。サイズが少し大きく生成されるだけで、テーブルに戻した際に皿へめり込む可能性がある。位置が少しずれるだけでも、その後のコリジョン形状や支持関係が崩れてしまう。
シーン内のエラーは連鎖する。最初の一歩を誤れば、次々と誤りが広がり、最終的には製品におけるユーザーの手戻りという、現実のコストとして跳ね返ってくる。

CASTの発想は、次の4段階にまとめられる。まず理解し→次に補完し→それから配置し→最後に物理的な誤りを修正する。
Step 1:モデルが入力画像を複数のオブジェクトに分解し、相対的な奥行きを推定する。構造情報に乏しいRGB画像を、オブジェクトのリストと空間的な手がかりへと変換する。
Step 2:各物体について、完全な3Dジオメトリを個別に生成する。遮蔽認識メカニズムが、見えている部分とシーン情報を参照し、画像では見えない領域を補完する。
Step 3:生成した物体を、統一された空間内に戻す。システムは回転、平行移動、スケールを推定し、元画像の構図と位置関係をできる限り維持する。
Step 4:より詳細な物体関係グラフを構築し、接触、支持、吊り下げなどの関係を記述する。そのうえでSDFと組み合わせて物理補正を行い、相互貫通、浮遊、不自然な積み重なりを減らす。
こうして、このフレームワークは昨年のSIGGRAPHで最優秀論文を受賞した。審査委員会は次のように評価している。
CASTはオープンボキャブラリーの再構成タスクに対応し、遮蔽の処理、物体の正確な位置合わせ、物理世界と入力画像の整合性の確保において卓越した性能を示した。バーチャルコンテンツの制作やEmbodied AIに関わる分野に、新たな可能性を切り開くものである。

しかし、製品化までには、CASTにはまだ最後のひと押しが必要だった。
チームはその後、約1年をかけて、複数モジュールを連結することによって生じるエラーの累積問題に専念して取り組んだ。
冗長なモジュールを削減し、基盤となる処理フローを再構築し、各工程の安定性を高めることで、WorldGenはようやく完全体としてリリースされた。

では、なぜこれを広義の「世界モデル」や「シーン生成モデル」ではなく、「世界生成モデル」と呼ぶのか。影眸Hyper3Dの共同創業者兼CTOである張啓煊氏は、次のように定義している。
私たちは、世界生成モデルとは、テキストプロンプトや1枚の画像を通じて、そこに描かれたシーンを利用可能な3D世界として復元するものだと考えています。
オープンなシーンを生成できるだけでなく、より**「世界」**という表現に近いものでもあります。
もちろん、広義の世界モデルを構成する重要な要素の1つでもあります。真の「世界モデル」には、世界の外観や属性を保持する何らかの媒体が必要です。影眸が選んだ媒体が、3Dなのです。
3D生成、シーンレベルの時代へ
最初の問いに戻ろう。WorldGenはいったい何を解決したのか?
その答えは、アプリケーションの中ですでに明確に示されている。
WorldGenが、リリース可能なゲームをそのまま生成したり、完成した映画を丸ごと制作したり、Embodied AIの訓練や意思決定を代行したりするわけではない。しかし、これらすべての産業が共通して抱える、制作前段階の課題を解決する。
つまり、発想と膨大なアセットをどのように結び付け、素早くシーンとして実用化するかという課題だ。
Hyper3D Rodin Gen-2.5に代表される3D生成モデルは、単一アセットの制作期間を数日から数分、さらには数秒へと短縮した。しかし実際のプロジェクトでは、孤立したアセットだけが必要になるケースはほとんどない。
その後には必ず、形状や物理属性の異なるアセットを組み合わせる工程が待っている。認識、調整、エンジンへのインポートなどの作業は、依然として人間が行わなければならない。
WorldGenが変えたのは、AI 3Dにおける基本的な納品単位だ。
生成済みの1つの物体から、初期構築まで完了した1つのシーンへ。
最終成果物にはまだ改善の余地があるものの、ゲームデザイナー、映像クリエイター、シミュレーションエンジニアにとって、そこから編集を続けられる出発点がすでに提供されている。

そしてシーンを本当に使えるものにするには、「それらしく見える」だけでは不十分だ。
物理法則のシミュレーションこそが、WorldGenの上限を決める。生成されるディテールが増えるほど、シーンはよりリアルになり、より実用的になる。
生成されたシーンがコンテンツを受け止め、インタラクションをシミュレートし、既存のワークフローに接続できるようになれば、関心を寄せるのは新しいものを試したい一般ユーザーだけではない。生産性の向上を真に必要としているプロフェッショナルなクリエイターも惹きつけられる。
3D生成はもともと、制作プロセスに最も近いAIアプリケーションの1つだった。生成結果を継続的に編集・再利用し、実際の制作に投入できるようになって初めて、その価値が本当の意味で解き放たれる。
これまで3D生成の実用化を阻んでいたのは、まさにWorldGenがいま埋めようとしているシーンレベルの空白だった。
その登場は、まさに時宜を得たものだ。
こうして、物体の生成から世界の組み立てへ。3D生成はこれをもって、シーンレベルの時代へと突入した。