ロボットがカートで連続コーナリング、一気通貫の完全自律走行
週末、自宅でSNSを眺めていたとき、ある動画に目を奪われた。
ロボットがカートを運転し、サーキットを疾走している。コーナーを曲がり、加速し、ステアリングを切る。そのすべてがワンカットで収められていた。
まさか、ロボットがもうカートコースで腕前を披露できるようになっていたとは!

……と思ったが、少し待ってほしい。
これは、私が WRC で見てきた光景とはずいぶん違う。
展示会で見るロボットは、走ったり、火花と電撃をまとったりするものだ。ところが、この動画のロボットは、いつの間にか人間に隠れてレーシングスクールに通っていたのだろうか。
まるでベテランドライバーだ。高速コーナリングに、巧みな障害物回避。1周を、最初から最後までよどみなく走り切っている。
これまでのロボットのデモといえば、ゆっくり歩いたり、かがんで物を拾ったりするものが中心だった。それに対して、この動画のロボットは本当に自分で車内に乗り込み、手・目・足を同期させて協調動作し、全速力の状態で複数の接触点におけるバランス制御と精密な力制御を実現している。
動画を載せるので、ぜひ見てほしい。
このような二足歩行の人型ロボットは、目・手・足を全身で協調させ、高速運動や複雑な姿勢変化の中でも細かな操作を実行できる。これまでの人型ロボットのデモでは、ほとんど見られなかった性能だ。
この動画を公開したのは、「共生知行」という会社だ。
共生知行が開発しているのは、二足歩行の人型ロボット向けのエンドツーエンド感覚・制御統合型「頭脳」、つまり基盤モデルである。
創業者の丁鹏翔氏は 1996 年生まれ。中核チームの他のメンバーは全員が 2000 年代生まれで、全員が博士課程に在籍中だ。会社設立から、まだわずか 2 か月しか経っていない。
一見すると少し「本業から外れている」ようにも見えるこのデモについて、丁氏は次のように説明する。
ロボットには、機械的なサービス機能だけでなく、もっと人間らしいことをしてほしいと思っています。人間がカートを運転できるなら、ロボットもできていいはずです。
ここで、ひとつの疑問が浮かぶ。まだ卒業証書すら手にしていない若者たちが、なぜ具身知能の中でも最も難しく、最先端の領域に挑もうとしているのだろうか。
最も難しい道に賭ける:階層型を研究し、今はエンドツーエンドに挑戦
「エンドツーエンド」の二足歩行人型ロボットモデルという分野は、どれほど新しいのか。
市場に既存の人材が見つからないほど新しい。
丁氏によれば、この方向性が注目され始めたのはここ 2 年ほどのことだ。技術を理解している人材は、まだ博士課程で研究を続けている。そのため、必要な条件を満たす人材を人材データベースから見つけるのは、ほとんど不可能だという。
博士課程を修了してから何年も経った人は変化の速さについていけず、博士号まで進んでいない人は、基礎レベルの理解があと一歩足りない。最先端のブレークスルーは、まさにこのトップクラスの博士課程の学生たちの手に握られている。
共生知行のチームは、まさにそのような若く、最先端を走る人材の集まりだ。
中国国内の具身知能分野で最も権威ある学術賞である Best Paper を 2 件受賞し、さらに 1 件が Best Paper Candidate に選出されている。また、中国国内で初めて GitHub Stars が 2K を超えた具身知能基盤モデルも開発した。
さらに重要なのは、彼らがブームの到来後に参入した追随者ではなく、中国国内でいち早く具身知能の基盤モデルを探究してきた先駆者であり、この分野で最も揺るぎない長期的視点を持つチームの一つだということだ。チームはこれまでにトップカンファレンスで 40 本以上の論文を発表し、認識、意思決定、制御、データ、システムまで、フルスタックにわたる技術領域をカバーしている。二系統化、軽量化、多構成化など、業界初となる一連の成果も、この若いチームから生まれている。

彼らの見解は明確だ。ロボットが最終的に人間の生活へ最も広く入り込む形態は、二足歩行になる。
自動運転や大規模モデルの進化の道筋に照らせば、エンドツーエンドは最も効率の高い技術方式である。
この判断の背景には、彼ら自身の最前線での研究経験がある。
丁氏は早くも 2023 年 12 月には、四足歩行ロボットに「頭脳」を搭載し始めていた。
第一著者として発表した QUAR-VLA は、四足歩行ロボット向けとして初めての VLA タスク・パラダイムだ。上位モデル(頭脳)が視覚、言語、タスクの意図を理解し、その判断を下位の運動システム(小脳)に渡して実行させる。
この「頭脳が意思決定を担い、小脳が運動実行を担う」という階層化の考え方が、業界でいう階層型アーキテクチャである。現在では、Figure のような企業もこの方式を採用している。
しかし、その後の研究を通じて、丁氏は徐々に問題に気づいていった。
彼は階層型について、「理論上は実現可能だが、あまりエレガントではない方式」と表現している。
頭脳と小脳がそれぞれ別々に動作するため、新しいタスクを 1 つ追加するたびに、上流からの出力を個別に微調整しなければ、十分な性能を引き出せない。
さらに根本的な問題は、構造そのものにある。
頭脳と小脳を別々に学習し、デプロイ時に組み合わせる場合、各部分の性能を高めても、全体として最適になるとは限らない。
2 つの層の間で情報を翻訳するたびに、カスケード誤差と情報損失が新たに発生する。
丁氏はこう判断した。
「階層型である限り、その間には情報ボトルネックが存在します。このインターフェース設計では、階層型アーキテクチャは真の意味での Scaling を実現できません」
この判断は、自動運転と大規模モデルの発展を長年観察してきた経験からも導かれている。
初期の自動運転は、認識、予測、計画、制御といった複数のモジュールを連携させていた。その後、データから運転能力を直接学習させる方式が模索されるようになった。

Tesla FSD がエンドツーエンドへ移行すると、性能は大幅に向上した。
丁氏の見方では、ロボットも同じような変化を経験する可能性がある。つまり、モデルがデータから「認識―理解―行動」という一連のプロセスを学習するようになるということだ。
彼の論理はこうだ。2023 年以降、階層型のアプローチは繰り返し検証されてきた。将来的にデータのスケール化によって最終的にシステムがエンドツーエンドへ向かうと判断するなら、わざわざ一度遠回りする必要はない。
この変化は、2026 年に起きつつある。
Google の Gemini Robotics 2 は、単一のポリシーによって、足先から指先までの全身動作を 1 つのモデルに統合した。
一方、RSS 2026 のトップカンファレンスにおけるコンセンサスでは、エンドツーエンドの単一モデルでは全身の複雑なダイナミクスをカバーできず、現段階で最適な実装方式は階層型のモジュール構成だと明記されている。
共生知行が賭けている純粋なエンドツーエンドは、より大胆で、実際に挑む人の少ない道だ。

なぜ二足歩行なのか。丁氏の答えは、第一原理に基づいている。人間社会の建築物、道具、環境は、すべて人間の身体構造に合わせて作られているからだ。
車輪型ロボットは生産ラインやショッピングモールなど、整備された環境でしか働けない。一方、二足歩行ロボットなら屋外へ出て、階段を上り下りし、車を運転し、異なる環境にまたがってさまざまなタスクをこなせる。
汎用性があればコストを分散できるうえ、二足歩行ロボットには人間に近い親しみやすさもある。
タイミングも重要だった。2026 年 4 月以前、二足歩行の人型ロボットには、汎用的な遠隔操作モデルすら存在しなかった。データソースがなければ、基盤モデルを訓練することもできない。
NVIDIA の Sonic がオープンソース化されて初めて、業界は大規模なデータ生成の基盤を手に入れた。
この分野は、もはや「訓練したくてもデータがない」という初期段階ではない。一方で、成熟してルートが完全に収束した段階にも達していない。共生知行が狙っているのは、その中間にあるこの機会だ。
技術の分水嶺:他社が運動学を学ぶ中、彼らは動力学に挑む
まず、重要な分水嶺を理解しておきたい。現在、ロボット基盤モデルの大半が学習しているのは、実は運動学だ。
運動学が扱うのは、A 地点から B 地点への移動、手をどこへ動かすか、物体をつかめたかといった問題である。固定基盤のロボットアームなら、これで問題はない。ロボット自体が倒れないからだ。
二足歩行ロボットが手を伸ばして物体を取ろうとすると、同時に身体の重心も変化する。
しゃがんで物体を取るときには、腰を前に傾け、足首と脚にかかる力を再配分し、バランスを保たなければならない。
さらに摩擦、衝突、慣性、接触が加わると、モデルが直面するのは、もはや全身の動力学そのものだ。
丁氏によれば、G1 の二足歩行人型ロボットには29 の自由度があり、ロボットアームの 7 自由度よりはるかに複雑だという。
これまでのロボットが学習してきたのは「動作軌道」だった。人型ロボットが学ぶべきなのは、**「身体が物理世界の中でどのように行動するか」**である。

運動学から動力学へ、タスクの完遂から安定性の維持へ。ここにこそ、二足歩行ロボットモデルにおける本当の技術的な分水嶺がある。
これが、共生知行がモデルを Joint Target、つまり関節目標レベルまで作り込んでいる理由だ。
階層型の方式では、頭脳がまず運動学的な目標を出力し、その下流にある小脳が関節動作へ変換する。
一方、共生知行はこの中間段階を取り除き、モデルが数十個の関節からなる身体状態に直接向き合う方式を採用している。
ここで新たな疑問が生じる。小脳を取り除いても、ロボットは安定して立っていられるのか。

模倣学習だけでは、モデルは標準的な動作しか学習できない。実行中に生じるさまざまなよろめき状態を経験していなければ、未知の状態に遭遇した際、そのまま転倒する可能性がある。
不足しているのは、失敗から立て直し、再び安定する能力だ。
共生知行の中核にあるのは、「タスク行動モデリング―運動事前分布蒸留」による二領域協調最適化メカニズムである。
一方の最適化経路は行動クローニングを引き継ぎ、タスクの精度と動作のフィッティング能力を保証する。もう一方の経路では、DriftDistill を通じて、下位コントローラーが蓄積してきた安定性、外乱への耐性、Failure Recovery 能力を、統合モデルに内在する運動事前分布へと変換する。
これは単純に 2 つの Loss を足し合わせるものではない。「タスクを正確に完了する能力」と「身体を安定して制御する能力」を同じモデルに組み込み、大規模モデルにタスク知能と身体知能を同時に獲得させるものだ。
もし DriftDistill がモデルとデータ量の拡大に合わせてさらにスケールできるなら、彼らが解こうとしているのは、より大きな問題になる。
認知能力の Scaling だけでなく、ロボットは運動制御能力も同時に Scaling できるのか。
丁氏は、この運動能力を集約するモジュールを**Motion Expert(運動エキスパートモデル)**と呼んでいる。現在の規模は 1B 近くに達しており、蒸留によって異なる運動制御モデルの能力を継続的に取り込んでいる。

さらに一歩進むと、エンドツーエンドの大規模モデルは、ロボットがどの程度の力を出力すべきかという問題にも取り組まなければならない。
現在、多くのロボットシステムは主に位置を制御している。しかし、ロボットが本当に現実世界へ進出するなら、位置が正しいだけではタスクが完了したことにはならない。
手を引き出しの取っ手まで伸ばしても、どれほどの力を加えるべきかわからなければ、扉は開かない。人に物を手渡す場合も、位置が正しくても力が強すぎれば安全ではない。
共生知行の技術路線では、まず Force Expert を安全な接触の専門家として位置づけ、力の加え方、柔順性、インピーダンス、接触フィードバックを学習させる。そのうえで、ポリシー蒸留を通じて、Motion Expert と最終的なエンドツーエンドモデルへ段階的に統合していく。
位置は、ロボットが「そこへ到達できるか」を決める。力は、ロボットが本当に「物事をうまく成し遂げられるか」を決める。
これが、共生知行のいう「全身物理世界モデル」の意味でもある。モデルに、身体がどのように力を受け、バランスを崩し、接触するのかを理解させ、その制約を動作へ直接落とし込むのだ。
データ、創発、そして冷静なタイムライン
モデルを本格的に訓練しようとすると、まず直面するのがデータ不足だ。
2026 年初頭の時点で、世界全体の規制に準拠したロボットデータはおよそ 50 万時間。これは大規模言語モデルの 2 万分の 1 にも満たない。
厄介なのは、多くのデータが立ったままの操作を収集したものだという点だ。ロボットが区画内でその場作業をしているだけでは、全身を使った移動操作にはあまり役立たない。
共生知行の Blog では 1 万時間を超えるデータが公開されており、そのうち数千時間は自社で収集したデータだ。
全身協調モデルにとって本当に希少なのは、現実の生活における、強く結合した全身移動操作のデータである。たとえば、自転車に乗る、カートを運転する、バスケットボールに空気を入れるといった動作だ。
彼らが用いる解決策がTrajBoosterである。ロボットアームや車輪型ロボットからエンドエフェクターの軌道を抽出し、人型ロボットがシミュレーション環境でその軌道を追跡しながらバランスを維持する。異なるソースの動作を同じ空間に統一し、ロボットアームによってすでに定義されているタスクの多様性を再利用することで、低コストに事前学習用データを生成する。
モデルの能力について語るとき、丁氏はほとんど「汎化」という言葉を使わない。
彼の言葉を借りれば、「この言葉にはあまり中身がない。人間を『優れている』とだけ言うのと同じで、空疎です」。
彼が求めているのは、**「創発」**だ。関節角度のレベルで、たとえば歩行と跳躍のデータをモデルに学習させたとき、テスト時にはモデルがそれらを自ら組み合わせ、走るという新しいスキルを生み出せることを目指している。
なぜなら、関節レベルまで落とし込んで初めて、一部の動作能力を組み合わせてまったく新しい動作を生み出せる可能性があるからだ。

タイムラインについて、彼の見方は冷静だ。
10 万時間前後のデータは、主に研究室レベルのデモに使われることになる。本当の意味で大規模な商業価値を持つようになるのは、100 万時間を超えてからかもしれないと、彼は推測している。
現在、業界では最適なデータ形式すらまだ定まっていない。筋電、外骨格、モーションキャプチャ、Pico による遠隔操作など、さまざまな方式が競い合っている。
彼の見方では、現在の人型ロボットにおける最も難しい問題は 3 つある。第一に、認識と制御をどのように Combine すべきか。第二に、どのような種類のデータを使うべきか。そして第三に、データの規模そのものだ。
丁氏は、いつの日か中国のチームが設計したロボットモデルのアーキテクチャが、北米の同業者たちにも広く採用されることを望んでいる。
私たちは Follower になりたいのではありません。技術の発展をリードしたいのです。
あのカートに話を戻そう。
それを全速力でコーナリングさせていたのは、まだ卒業していない若者たちだった。
彼らが賭けているのは、具身知能の中でも最も難しく、最先端の方向性だ。
賭けているのは、エンドツーエンドが最終的に階層型に取って代わることである。
業界はまだ、最終的なルートが確立されたと証明できる段階には遠く及ばない。丁氏自身も、二足歩行基盤モデルの業界全体がまだ本当の意味では収束していないと認めている。
それでも、スタートアップチームの先進性は、ときに成熟した答えを同業者より速く実装することにはない。むしろ、同業者よりも早く次の本当に重要な問いを見つけ、答えがまだ明らかでない段階で、その解決に踏み出せるかどうかにこそある。