球技は滑らか、会場は満員
聴雨 凹非寺発
ロボットも卓球を始めた!
今回は、卓球台がそのまま世界ロボット大会(WRC)の会場に運び込まれた。
超维动力のブース前では、等身大の人型ロボットが飛んでくる卓球ボールを見つめてラケットを振り、腰をひねり、さらにボールの落下地点に応じて素早く動きを調整している。

何ラリーか続くと、ブースの周囲はすぐに観客で埋め尽くされた。
卓球台の横には、さらに大規模なシステムも展示されていた。
等身大の人型ロボット KAI Bot、高自由度の器用なハンド KAI Hand、データ収集用ヘッドセット KAI Halo、KAI World Model、そしてデータとトレーニングプロセスをカバーする KAI Embodied AI Infra。

ハードウェア、モデルからデータ収集、Infra に至るまで、具身知能に必要なフルスタックシステムが、すべて会場に持ち込まれていた。
この構成を見ると、Figure を思い浮かべる人も多いだろう。世界で最も高い評価額を持つ具身知能企業の一つである Figure は、今回の人型ロボットブームで最も注目を集めるスター企業の一つだ。
同社が資本市場から評価された本当の理由は、人型ロボットを1台作ったことだけではない。ロボット本体、モデル、そして現実の利用シーンに同時に投資した点にある。
自社でロボットを開発し、自社で Helix モデルを訓練し、さらにロボットを BMW の工場に送り込む。そこで現実のタスクから得られたデータをモデルに還元することで、Figure は本体、モデル、現実のシーン、データのフィードバックまでをつなぐフルスタックの連携を実現した。
同じく、超维动力もフルスタック路線を選んでいる。
設立から約1年のこの中国企業は、ロボット本体、器用なハンド、データ収集装置、世界モデル、トレーニング Infra を同時に市場へ送り出した。
しかし、なぜこれらのピースは同時に存在しなければならないのか。そして、それらはどのようにかみ合い、継続的に進化する一つのシステムになるのか。
その答えは、超维动力が選んだフルスタック路線に隠されている。
具身知能の分野で、フルスタック路線が共通認識に
過去数年間、人型ロボットが最も注目を集める方法は、十分に派手な動きを披露することだった。
走る、跳ぶ、服をたたむ。数十秒の動画だけでも、大きな話題を呼ぶことができた。
しかし現在、誰もが Demo だけを見ているわけではない。
ロボットが一度タスクを完了したとしても、そのタスクを実行できたということしか分からない。異なる環境や異なる本体でも安定して再現できるかどうかが、製品化の可能性を左右する。
世界に目を向けると、主要プレイヤーはそれぞれ異なる出発点に立ちながらも、フルスタック能力の補完を進めている。
Figure は「本体+大規模モデル」から出発し、自社開発の Helix VLA モデルを訓練する一方、ロボットを BMW の工場に送り込み、現実のタスクを通じて経験を蓄積し、そのデータをモデルにフィードバックしている。
Tesla Optimus の切り札は、Tesla の垂直統合能力だ。
FSD で蓄積したアルゴリズムの経験、成熟したサプライチェーン、そして自社工場という実装環境を組み合わせることで、ロボット本体の開発、モデルの訓練、大量生産を同時に推進できる。
Physical Intelligence(π)はモデル側から出発し、汎用的な具身基盤モデルに注力している。同じモデルを異なるロボットに適応させ、形状の異なる本体に汎用的な操作能力を提供することを目指している。
路線はそれぞれ異なるが、目標は次第に一致しつつある。本体、モデル、データ、現実のシーンを一つの反復サイクルにつなぐことだ。
一方、超维动力は、ハードウェアとしてのロボット本体、具身大規模モデル、高品質なデータ収集、そして基盤 Infra を同時に展開している。
超维动力の共同創業者であり、香港大学コンピューティング・データサイエンス学部教授でもある羅平氏は、これについて非常に分かりやすく説明している。
言語モデルのユーザーは一般の人々ですが、具身知能における「大脳と小脳」のユーザーはロボットです。
両者が受け取るフィードバックはまったく異なります。言語モデルが出力するのは Token ですが、具身モデルが出力するのは、ロボットが次の1秒に実行する動作です。一度のミスは、単に回答が不正確になるだけではありません。把持の失敗や衝突、バランスの喪失につながる可能性があります。
これが、具身知能がインターネット上のデータだけで学習することはできない理由でもある。モデルには現実世界の動作データが必要であり、ロボット本体上で繰り返し訓練と検証を行う必要もある。
データがモデルに入り、モデルが本体を駆動し、本体が実行した結果が再びトレーニングシステムに戻る。どれか一つでも欠ければ、閉ループは途切れてしまう。
この観点から見ると、フルスタック化は企業が事業領域をむやみに広げたいからではない。具身知能が現実世界に進出した後に求められる、必然的な要件なのである。
ハードウェア、モデル、データを、どのように一つの閉ループへつなぐのか?
超维动力のフルスタック能力は、最終的に具体的な製品へ落とし込まれなければならない。
同社が本当に解決しようとしているのは、ロボットを1台作ることではない。人間の経験を、よりスムーズにロボットの能力へ変換することだ。
まず、人間のデータを受け止められる身体を作る
超维动力が開発した等身大人型ロボット KAI Bot は、身長173cm、体重70kgで、全身に117の自由度を備えている。
全身の約80%を触覚皮膚で覆い、約18,000個の触覚ポイントを統合している。理論上は、0.1N 以上の微細な接触を感知できる。

これらの数値が意味するのは、単にロボットの動きを人間らしく見せることではない。
より重要なのは、ロボットの訓練が人間による実演データにますます依存している点だ。人間が肩、腰、手を使って初めて実行できる動作を、ロボットの構造上まったく再現できないのであれば、どれほど大量のデータがあっても本体へ直接マッピングすることはできない。
動作をリターゲティングする際、重要な自由度が一つ欠けるたびに、モデルはさらに一段階の妥協を強いられる。
羅平氏によれば、ロボット本体が人間の身体構造に近いほど、ファーストパーソンデータから人間の操作方法を学習しやすくなる。
人間社会にある机や椅子、道具、空間もまた、人間の身体に合わせて設計されている。高い人間らしさを追求するのは外観のためではなく、人間の経験をロボットが再利用する際のハードルを下げるためだ。
これが、KAI Bot が高い自由度を追求する核心的な理由である。自由度は単にパラメータを積み上げるためのものではない。モデルが学習した動作を、本体上で完全に実行できるかどうかを実質的に決める要素なのだ。
手は、最も精密な物理的インタラクションを担う。単体販売される KAI Hand は37の自由度を持ち、その内訳は20の能動自由度、1の受動自由度、16の柔軟自由度で、指先の力は30Nを超える。
10分間連続して把持した後も、ハンド全体の最高温度は人体の体温を超えない。

高い自由度が動作の幅を生み、柔軟な構造が衝突を緩和し、力と熱の管理が長時間稼働の可否を左右する。
この4つがそろって初めて、具身モデルのために本当に用意された手になる。
SMASH から KAI World Model を見る――ロボットはいかに現実世界を理解し、予測するのか
KAI Bot と KAI Hand が「身体は十分か」という問いに答えるものだとすれば、KAI World Model が解決するのは、ロボットが物理世界をどのように理解し、自分の動作がどのような結果をもたらすかを予測するという問題である。
羅平氏は、これをリアルタイムに生成される VR 世界にたとえている。人間が生成された環境の中で両手を使って物体を操作し、モデルが人間の動作と一人称視点の映像に基づいて次の状態を生成する。そこで生まれたデータを、人型ロボットの訓練に利用するという考え方だ。
このアプローチは、単一の技術に賭けるものではない。チームは JEPA 型のアプローチ、3D 手法、動画生成を同時に探究し、それらを4D世界モデリングとしてまとめている。
しかし、インタラクティブな環境を生成することは出発点にすぎない。世界モデルは最終的に現実世界へ戻り、速度、衝突、本体の違いによる検証を受けなければならない。

SMASH の人型ロボット卓球システムは、まさに KAI World Model の能力を分かりやすく示すものだ。
卓球はボールの速度が速く、回転も変化に富み、落下地点もランダムだ。ロボットはあらかじめ用意された動作だけでタスクをこなすことはできない。環境を継続的に観察し、飛んでくるボールを予測し、その結果に基づいて次の動作をリアルタイムに調整する必要がある。
具体的には、SMASH は一つの大規模モデルにすべてを最初から任せるのではなく、視覚認識、軌道予測、動作計画、全身制御を一つの閉ループソリューションとしてつないでいる。
システムはまず、ミリ秒単位で飛来するボールを捉えて軌道を予測する。次に、視覚データと高頻度で取得される機体の状態をリアルタイムに融合し、打球のタイミング、速度、角度を継続的に計算する。
しかも少し前、SMASH は最新の成果を発表した。「人類史上初となる、人型ロボットが自律的に行った卓球の完全対戦」だ。

ロボット同士で、11点制の試合を最後まで戦い抜いたのである。
次の一手を予測するだけでは不十分で、それを動作に変えなければならない。
チームは数十時間に及ぶ人体動作データを収集し、ロボットに人間の動作から打球を学習させた。さらに全身協調戦略によって、肩、肘、手首、腰、脚を連動させて打球を実行する。
さらに注目すべきは、SMASH が自社の本体だけに導入されているわけではない点だ。関連アルゴリズムは、Unitree G1 や智元远征 A3 などのロボットにも対応している。
見る、予測する、行動する。このシステムが示した卓球 Demo は、まさに世界モデルに必要な閉ループ能力と、その能力を異なるロボット本体で再利用できる可能性を示している。
データの閉ループが、モデルの進化速度を決める
身体の準備が整ったら、次はモデルに現実世界の経験を継続的に与える番だ。
具身知能のデータは、ウェブ上のテキストのように直接収集することはできない。人がどのように戸棚を開けるのか、スーパーでどのように商品を取るのか、指が物体に触れたときにどのように力を調整するのか。こうした情報は、現実のシーンで改めて記録する必要がある。
KAI Halo は、超维动力が現実世界へ伸ばすデータ収集の入口だ。
数百人のデータ収集スタッフがデバイスを装着して家庭、スーパー、商業施設、小規模工場に入り、一人称視点のマルチモーダルデータを収集する。
同社の発表によると、現在までに10万時間を超える動画データを蓄積しており、20以上のシーンと300種類以上の全身の原子動作をカバーしている。

これらのデータはさらに処理され、人体全身の関節軌道、3Dシーン、手の姿勢、動作の意味ラベルなどが生成される。できるだけ、データをトレーニングプロセスに投入する前の重複した加工を減らすためだ。
しかし、データを収集してきたことは始まりにすぎない。数百万規模のデータ断片が次々とバックエンドに入ってくるなか、処理、訓練、評価を依然として人手でつなぎ合わせていては、反復速度はすぐに行き詰まる。
KAI Embodied AI Infra プラットフォームは、その後半の工程を担う。データ処理、モデル訓練、シミュレーション評価、実機へのデプロイまでをカバーし、さらにロボットの稼働結果をシステムへ送り返す。
公式データによれば、このプラットフォームによって高品質なデータの生産効率は10倍に向上し、モデルの訓練と評価の速度は平均で5~7倍に高まるという。
ここまで来ると、KAI Halo が収集を担い、Infra が加工を担い、World Model が学習を担い、KAI Bot が先行検証とアルゴリズムの実装を担い、最後に異なるロボット本体が実行を担うことになる。
現実世界からのフィードバックが次の訓練サイクルに戻って初めて、5つのピースが本当にかみ合う。
資金と計算能力で圧倒的な優位に立てない場合、閉ループの効率性こそが、中国のスタートアップが差を縮めるための重要なレバーになる。
1年で、3年かけて完成する技術の骨格を構築
大西洋の向こうに目を向けると、Figure は2022年に設立され、数年をかけてロボット本体、Helix モデル、工場への導入を段階的に整備してきた。その結果、現在の比較的完成度の高い閉ループが形成された。
一方、超维动力の進展ははるかに速い。
同社は2025年7月、深圳で設立された。それから約1年の間に、ロボット本体、器用なハンド、データ収集装置、世界モデル、トレーニング Infra が相次いで実用化され、具身知能に必要な主要なピースが基本的な輪郭を見せ始めている。
この推進速度には、チームが過去に蓄積してきた経験も関係している。
超维动力のチームは、具身モデル、コンピュータビジョン、モーション制御、自動運転、ロボットハードウェアなどの分野にまたがっている。メンバーはこれまで、医療用リハビリテーション外骨格の量産、L4レベルの鉱山用トラックの導入、エンドツーエンド自動運転モデルなどのプロジェクトに携わってきた。
同時に、香港大学 MMLab、深圳河套学院などの研究チームとも連携し、具身モデルとモーション制御の研究を進めている。
ただし、製品ラインを広げることは第一歩にすぎない。
人型ロボットが最終的に直面するのは、長時間稼働の信頼性、製品を量産して納品できるかどうか、そして現実のシーンに導入した後に価値を生み出せるかどうかだ。設立から約1年の企業にとって、本体、モデル、データ、Infra を同時に推進することは、資金面でも組織面でも小さくない負担となる。
そこで超维动力は、システム全体が完全に成熟するまで商用化を待つのではなく、その中から比較的独立した能力を切り出した。
2026 WAIC の期間中、KAI Hand と KAI Halo Lite の一般販売が始まった。
ロボット本体以外にも、器用なハンドは他社のロボットに搭載でき、データ収集装置はモデル開発チームに提供できる。Infra も技術サービスとして展開できる。

独立した各製品が商業化への入口となる一方で、社内の閉ループにより多くのデータとシーンを持ち帰ることもできる。
ここが、超维动力の最も注目すべき点でもある。
Figure とは、資金規模、シーンの蓄積、商業化の進捗において差があるものの、両社が描く業界の最終形は非常に近い。
具身知能で競われるのは、単一のロボットの性能だけではない。本体、モデル、データ、現実のシーンを、誰がより速く回転させられるかである。
超维动力の強みは、このフルスタック構成を最初から、しかも集中的に整備している点にある。設立から約1年で、技術全体の骨格を構築しただけでなく、その中のいくつかの能力については、市場へ進出する入口も見つけている。
もしこれらの製品が相互にデータを持ち帰ることができれば、