目新しい変化は何もないのか?
衡宇(凹非寺より)
WRC期間中、会場内のロボット展示ブースで最も人目を引いていたのは、さまざまな斬新な動きだった。
ダンスを踊る、握手をする、あるいは見たことのない複雑なタスクをこなす。直感的で目新しい動きであれば、それだけで観客はスマートフォンを取り出して撮影する。
しかし、ロボットを実際に工場や商業施設、一般家庭へ導入するとなると、現実的な課題が浮かび上がってくる。実際の現場が重視するのは、ロボットが次の作業をより速く、より安定して実行できるかどうか、そして人による介入や補助をできるだけ減らせるかどうかだ。
だからこそ、千尋智能が2026世界ロボット大会で見せたアプローチは、少し変わっていた。
新しいデモシーンを急いで披露するのではなく、Moz1が1か月以上前にWAICで展示した「リビングの片付け」をWRCで再演したのである。
えっと……使い回し?

そこで会場内で千尋智能の社員を見つけ、こう尋ねてみた。本当に同じDemoをそのまま展示しているだけなのか? 目新しい変化は何もないのか?
相手は笑いながら答えた。表面だけを見てはいけない、と。30日も経っていないが、このDemoはすでに大きく進歩しているという。
- コーラを冷蔵庫に入れる自律推論の成功率が、約80%から99%以上に向上。
- ボウルを食器洗い機に入れる成功率が、約90%から99%以上に向上。
- ナビゲーション目標の確認にかかる時間が、約50%短縮。
さらに、色や種類、位置などの条件が変化した場合でも、ゴミ拾いタスクの実行成功率は85%に達している。

これらの変化は、「リビングの片付け」という長時間にわたる複合タスクのさまざまな工程で起きている。単発の把持動作や、固定された作業ステーションでの動作だけではない。
つまり、同じDemoが2度披露されたということは、同じ具身システムの「進化のスナップショット」が2枚示されたということなのだ。
一見すると、やっていることは以前と変わらないように見える。しかし実際には、そこに一つの巨大な氷山が隠れている。水面の上に見えるのはタスク達成度の向上だ。水面の下には、データ、トレーニング、Agent、ナビゲーション、ハードウェア、インフラが一体となった、フルスタック能力の進歩がある。
30日間で、これほど急速な進化はどのように実現したのか。
水面下へ潜ってみよう。
30日でDemoに定量的な飛躍
この30日間の変化を理解するには、「時間密度」という言葉が欠かせない。
これは千尋智能が**具身知能の分野で初めて提唱した学術的概念だ。いわゆる「時間密度」**とは、システムがどれだけ短時間で問題を吸収し、トレーニングと検証を完了し、改善内容を実機へ再びデプロイできるかに注目する考え方である。
単一のデモにおける最高性能ではなく、システムが進化する速度を測る指標だ。

実際、30日前の時点でも千尋智能の成功率は決して低くなかった。WAIC期間中、コーラを冷蔵庫に入れる成功率は80%近く、ボウルを食器洗い機に入れる成功率は90%近くに達していた。
これはかなり目を見張る成果である。展示会のDemoを一つ完成させるだけなら、現場で十分に見栄えのする水準だ。
しかし、長時間タスクにおける90%と、固定された作業ステーションでの90%では、難易度がまったく異なる。
単一ステップのタスクで一度失敗しても、通常は一つの動作が完了しないだけで済む。一方、長時間タスクでは、わずかなずれが次のステップで直面する状態を変えてしまい、そのエラーが後続の工程へ連鎖していく。
ロボットが「リビングの片付け」に含まれる一連の生活動作を実行するには、実際には非常に複雑な工程が必要となる。
曖昧な指示を聞き取り、まず周囲を見渡して環境を把握し、どの物品を元の場所へ戻すべきかを判断し、まだ完了していない手順を記憶しなければならない。その後、空間をまたいで移動し、物品を把持し、ドアを開け、物を置き、ドアを閉める。そして、その過程で自分の動作が正しかったかを絶えず確認する必要がある。
また、長時間タスクでは、物体の姿勢の変化、ロボットの立ち位置のずれ、背景からの干渉、さらにはドアの開き方が不十分であることさえも、後続動作のリズムを崩す可能性がある。
したがって、Demoで高い成功率を出すことは、物語の始まりにすぎない。そのタスクにおいてロボットが完全に失敗しないことを意味するわけではない。
ここで、WRCの会場へ視線を戻そう。
冷蔵庫、食器洗い機、ゴミ拾い、ぬいぐるみの収納という4種類のタスクは、長時間タスクにおける異なる課題をそれぞれ浮き彫りにしていた。連続する操作を安定してつなげられるか、ロボットの位置や物体の状態が変化しても作業を継続できるか、環境が変わった後も対象を正確に認識できるか、といった課題である。

デモを何度か続けて見ていると、会場では実際に難易度が絶えず上がっていることに気づく。
観客の往来や遮蔽、物品の位置の変化によって、経路は一時的に乱される。ロボットは障害物を避け、対象へ再び近づき、ナビゲーションと後続の操作をつなぎ直さなければならない。
見ているだけでも分かるように、展示会場はもともとトラブルを生み出すのが得意な場所だ。
しかし、具身ロボットにとって、こうしたトラブルはまさに価値がある。
(出展者の皆さん、喜んでいいですよ!)
さらに、このような現場での安定した動作は、単一のモデルのパラメーター調整だけで実現するのは難しい。
一つひとつの失敗をシステムが認識し、フィードバックし、再現し、トレーニングし、再びデプロイできるデータのクローズドループが形成されて初めて、30日間での高速な反復開発が可能になる。
水面下に広がるフルスタックの氷山:長時間タスクを動かす仕組み
「リビングの片付け」の実行プロセス全体を分解することは、そのまま千尋智能のフルスタック技術体系を分解することでもある。
ロボットにとって、「リビングを片付ける」という指示は、一連の問いに分解されなければならない。
部屋には何があるのか? どの物を片付ける必要があるのか? 何を先に、何を後に行うべきか? ロボットはどこまで移動すれば操作を完了できるのか? 途中で失敗した場合、次にどうすべきか?
ユーザーが「リビングを片付ける」という目標を出すと、まず知覚システムが全体をスキャンして環境情報を構築する。Agentはコンテキストを保持し、長期目標を記憶しながら、大きなタスクを「先にコーラを片付け、次に食器を洗う」といったサブタスクへ分解する。ナビゲーションシステムはロボットを操作に適した位置へ移動させ、基盤モデルSpirit v1.6は言語、視覚、本体の状態に基づいて動作を生成する。
タスク完了後、システムは振り返りレポートも生成し、データをフィードバックすることで、次回のパフォーマンス向上につなげる。
このように、一つの完全なタスクの背後では、知覚、データ、モデル、Agent、ナビゲーション、本体、インフラが連携している。

△千尋智能の技術アーキテクチャ
この連携は一つひとつが密接につながっており、どれ一つ欠かすことはできない。だからこそ、ロボットは一つひとつのタスクから絶えず経験を吸収できる。
まずは、システム進化の「燃料」となるデータパイプラインから見ていこう。
30日後にロボットをより良くするには、まず一つの問題を解決しなければならない。今回なぜ失敗したのか。そして次のトレーニングでは、いったい何を改善すべきなのか。
たとえば、ゴミの把持に失敗したとしても、それでタスクが終わるわけではない。本当に重要なのは、システムが「なぜ失敗したのか」を理解できるかどうかだ。ゴミを認識できなかったのか、把持位置が適切でなかったのか、それとも動作計画に問題があったのか。
その答えはデータの中にある。
千尋智能のデータプラットフォームには、Web動画、第一視点データ、uDASデータ、遠隔操作データ、実機タスクデータが集約されている。データクリーニング、アノテーション、品質検査、トレーニングタスク管理、モデル評価、結果追跡など、幅広い工程をカバーしている。
現在、千尋智能が独自開発したデータ収集デバイスは第7世代まで進化しており、データ収集コストは従来の遠隔操作方式の10分の1に低減。データの有用性は30%から95%へ向上し、全国30万か所を超える収集拠点と連携して、絶え間なく「燃料」を供給している。

△千尋智能のウェアラブルデータ収集デバイスは、全国各地で同時にデータを収集している
ただし、具身知能にとって本当に価値のあるデータが、必ずしも最も「クリーン」なデータとは限らない。
ここで触れなければならないのが、千尋智能が独自に提唱する「汚れたデータ」トレーニングの理念と、データピラミッド体系だ。

△千尋智能のデータピラミッド
現実世界では、照明が変化し、物品は常に決まった場所に置かれているわけではなく、人が突然通り過ぎ、環境も絶えず変化する。
ロボットのトレーニング時に整然とした標準的なシーンばかりを見せていると、現実世界に向き合った際、かえって無関係な情報に邪魔されやすくなる。
そこで千尋智能は「汚れたデータ」によるトレーニングを重視し、現実世界に存在する雑然とした変化を、モデルの汎化能力の一部として直接取り込んでいる。
この点は、ポストトレーニングのプロセスと合わせて考える必要がある。
ポストトレーニングの仕組みと基盤モデルは、ロボットの動作能力の上限を決める土台となる。
ポストトレーニング段階で解決すべき核心的な課題は、モデルに経験を本当の意味で理解させ、「何に注目すべきか」を学習させることだ。
ロボットはタスク全体を完了するまで、周囲のあらゆる方向に注意を配らなければならない。
「ボウルを食器洗い機に入れる」タスクを例にすると、その背後には少なくとも10の連続した段階が含まれている。
タスク開始時には、グローバルビジョンによってロボットが現在いる位置と食器洗い機の位置を素早く判断する。実際の操作が始まると、注目範囲は徐々に絞り込まれ、ボウルの位置、取っ手の位置、水切りラックの位置がより重要になる。

ポストトレーニングを通じて、チームはモデルに、壁面や照明などの無関係な変化には安定して対応し、ボウルの位置や立ち位置など、動作に本当に影響する変化には敏感に反応することを学習させた。
データとポストトレーニングは最終的にモデルの能力へ落とし込まれる。そして、すべてを支える土台がSpirit v1.6基盤モデルだ。
千尋智能の資料によると、このモデルはVLAと世界モデルを深く統合した融合アーキテクチャを採用している。
従来のロボットは、「知覚—計画—制御」という段階的なプロセスを採用することが多い。地図を見てからルートを考え、最後にアクセルを踏むようなもので、反応が遅く、各工程の連携が途切れやすい。
一方、Spirit v1.6は視覚知覚、言語理解、動作生成、世界状態の予測を統一的なトレーニングに組み込み、知覚しながら判断し、判断しながら調整する。突発的な状況に遭遇したとき、手足が無意識に連動する熟練ドライバーのような動きを実現する。
UCバークレー、スタンフォード大学、NVIDIAが共同で立ち上げたRoboArena国際評価では、このモデルは一時世界1位に立ち、NVIDIAのDreamZeroなどのモデルを上回った。このランキングで首位に立った初の中国発の具身モデルでもある。

Agentの意思決定層では、ロボットが長時間タスクの途中で「本物の金魚」のような記憶力にならないよう、頭脳が状態を管理する必要がある。
具体的には、ロボットが作業中に突然その場で停止し、自分がなぜそこに立っているのかを忘れてしまうことが最も危険だ。
たとえば、ゴミの把持に失敗したにもかかわらず、動作モジュールが「停止シグナル」を出すと、プランナーはこのステップが完了したと誤認し、そのまま「ゴミを置く」タスクへ移行してしまう。このように、単一ステップの誤判断がタスクチェーンに沿って後方へ伝播していく。

こうした連鎖的なエラーを防ぐため、Agentはメモを持った現場監督のように、タスクの状態を継続的に管理しなければならない。
「リビングの片付け」という全体目標と完了済みの進捗を保存するだけでなく、現場の状態に応じて、次に続行するのか、再試行するのか、スキップするのか、あるいは再計画するのかを判断する必要がある。
たとえばゴミの把持に失敗した場合、もう一度試すのか、それとも別の対象に切り替えるのか。誰かが経路をふさいでいる場合、待つのか、それとも迂回するのか。
Agentが常に状態を正しく同期できて初めて、ロボットは途中で「頭の中が真っ白」になるのを防げる。
WAIC会場で起きた一度の予期せぬ試練が、この「現場監督」の真価を示した。
360集団の周鴻禕氏一行がブースを訪れた際、リビングのデモエリアは観客で埋め尽くされ、静的だったリビングが一瞬にして、高い動きがあり遮蔽物も多い環境へと変化した。
Agentは終始タスクの進捗を監視した。ナビゲーションが妨げられた際には待機すべきか迂回すべきかを判断し、誰かが操作エリアに近づくと一時停止して、安全を確認した後に再開した。対象が遮られた場合には、再び知覚を行った。
最終的に、ロボットは人混みの中で障害物を避けながら移動し、連続した操作を完了した。タスクが中断することはなかった。
ナビゲーションと操作の連携は、「到達」の基準が進化したことに表れている。
ロボットが食器洗い機の前で停止したからといって、本当に到達したとは限らない。VLAによってドアを開け、水切りラックを引き出し、ボウルを置く操作ができる位置に立って初めて、この工程を完了したことになる。
ここには、典型的な開発エピソードがある。
初期のデバッグ段階で、ロボットはすでに食器洗い機の前まで問題なく移動できていた。
しかしあるとき、冷蔵庫に近すぎる位置で停止した。ナビゲーションの指標だけを見れば、すでに「到着」している。だが、ポリシーモデルが引き継ぐと、すぐに問題が明らかになった。その立ち位置では食器洗い機を開けにくく、大幅な姿勢補正を追加で行わなければならなかったのだ。

そこでチームは、「到達」の定義を改めた。
ロボットは、単に特定の座標へ到達することを基準にしてはいけない。本当に到達すべきなのは、後続の動作を展開できる位置、つまり「操作可能な姿勢」なのだ。
正しい位置に立つだけでなく、反応も速くなければならない。
もう一つの最適化は、ナビゲーションの起動速度に向けられた。モデル、アルゴリズム、エンジニアリングの各工程を連携させて調整した結果、タスクを受け取ってから最初のナビゲーション目標を生成するまでの時間の中央値を、約50%短縮した。
ここまでの話は、まだソフトウェア層の問題にすぎない。ハードウェアとインフラの存在も忘れてはならない。
WAIC期間中、チームはサーボモーターの異常、電源障害、インターフェースの緩みなどの問題に遭遇した。
十数分間動作した後、最後に一つのインターフェースが機能しなくなり、タスク全体が一瞬で台無しになる。長時間タスクでこのような事態に遭遇すると、決して大げさではなく、チームにとっては本当に「空が崩れ落ちる」ような感覚だ。
そのためWAIC終了後、ハードウェアチームは方針を変更した。「壊れた箇所を修理する」から「設計段階で品質を作り込む」へと転換し、できる限り図面の段階で問題を食い止めるようにした。さらにサーボや電源モジュールの改良を続け、設計レビューと組み立て確認をプロセスとして定着させた。
同時に、モデルが最終的に生成した動作は、26自由度を備え、自社開発の一体型力制御関節を搭載したMoz1という本体によって実際に実行されなければならない。また、新しいモデルをどれだけ早く実機で動かせるかは、デバイス管理、推論のデプロイ、ログのフィードバックといった基盤プラットフォームの能力にも左右される。
こうした目に見えないインフラが、トレーニングと実機の距離をさらに縮め、現場で発生したbad caseをより早く次の反復へ取り込めるようにしている。
成功率が100%に達した後も、「あら探し」を続ける意味とは?
既存のモデル能力を活用し、千尋智能はWRCの新しいシーンに対してゼロショット転移を直接実現した。冷蔵庫の操作、ぬいぐるみの収納、ボウルとコーラの把持、食器洗い機など複数の主要タスクで、実地テストにおける成功率は100%に達し、高いシーン間汎化能力を示した。
しかし、成功率が100%に達した後、チームは逆に積極的に「あら探し」を始めた。たとえば開始位置を動かしたり、物体の姿勢を変えたり、背景を入れ替えたりした。
なぜなら、単一シーンでの100%は、安定して動作できる範囲が十分に広いことを意味しないと分かったからだ。
実機のデバッグで明らかになった細部は、長時間タスクの複雑さをよりよく示している。
あるときゴミの把持に失敗した後、動作モジュールが停止シグナルを出し、プランナーがこのステップは完了したと誤認して、そのままゴミを置くタスクへ移行した。単一ステップの誤判断は、長時間タスクに沿って後続へ伝播していく。
だからこそ、長時間タスクでは動作が終了したかどうかだけを見るのでは不十分だ。「このステップは本当に成功したのか」を絶えず確認しなければならない。そうしなければ、小さな誤判断が後続の工程へ連鎖してしまう。
展示会場のネットワーク環境も、さまざまな問題を引き起こす。
会場には安定した有線ネットワークがなく、クラウド推論では予測不能なロングテール遅延が発生することもある。

そこで、チームは状況に応じた最適化を行った。冗長な判断ロジックを削減し、一部の視覚判定タスクを並列実行へ変更した。また、推論計算とロボットのほかの動作を可能な限り時間的に重ね合わせ、ネットワーク遅延の影響を緩和した。
会場に大量の観客が押し寄せると、比較的静的だったシーンは、高い動きがあり遮蔽物も多い空間へと変わる。歩行者が通過すれば対象が一時的に見えなくなり、計画済みの経路も一時的に使えなくなる可能性がある。ナビゲーションは障害物を避け、対象へ再び近づきながら、AgentやVLAともタスク状態を同期し続けなければならない。
この観点から見ると、展示会場はむしろ、すぐに利用できるストレステストの場となっている。フルスタック能力がどれほど堅牢かを、側面から証明できる場所なのだ。
同時に、展示会場での極限的なストレステストは、産業分野で安定して導入するための予行演習でもある。両者の環境は異なるものの、いずれもロボットが研究室を出た後、長時間にわたって安定稼働できるかどうかを検証している。
千尋智能のこのシステム能力は、すでに展示会のDemoから実際の産業などのシーンへと広がり始めている――
Moz1はすでにCATLの動力電池PACK生産ラインへ導入され、高圧テスト用プラグの接続など、標準化されていない工程を担っている。作業成功率は99%以上で安定し、1日の作業量は熟練作業員の3倍に達する。また、JD.com、Bosch、Schaefflerなどの企業ともシーン別の協業を進めている。
もう一つのモデルであるMoz2は、同一構成の基盤モデルで培った能力を、スーパーマーケット、ホテル・観光、オフィスビルなどの公共サービスシーンへ移転する取り組みを進めている。WRC会場では初めて自然音声によるインタラクションも披露し、手を振る、指でハートを作る、握手するといった人間らしい交流にも対応した。

ここまで振り返ってみると、千尋智能が二つの大会で同じDemoをもう一度実施した理由が理解できる。
具身知能の初期段階で最も注目されやすかったのは、「できるかどうか」だった。しかし、ますます多くのロボットがこうした動作を実行できるようになるにつれ、次の段階で答えるべき問いは変わってきている。
同じ作業を連続して実行できるのか。環境が変わっても実行できるのか。途中で失敗したとき、システムは自分がどこで間違えたのかを理解しているのか。今回発生した問題を次のトレーニングに取り込み、次のバージョンで同じミスを一つ減らせるのか。
結局のところ、具身知能の最終目標は、何でもできるロボットを一台作ることではない。自ら成長し続けられる技術システムを、一つの形として動かし切ることにある。
そして、先ほど述べた「時間密度」が最終的に測るのも、ある期間にタスク成功率が何ポイント向上したかだけではない。
**それは実際の失敗を技術体系がどれだけ速く処理できるかを評価するものだ。**問題をより速く吸収し、改善をロボットへ送り返せる企業ほど、その能力の限界をより速く広げていける。
これは、具身知能企業の長期的な成長力を見極めるうえで、重要な指標になりつつある。