コンテンツにスキップ
メインサイト ニュース コンソール

デモではない!UBTECHが顧客の生産ラインをWRCに1:1で再現し、具身知能の実装への道筋を探る

· 量子位
国内AI

具身知能の競争で重要なのは出荷台数ではない

田晏林 凹非寺発

今年の WRC を一通り見て回って、ある人型ロボット企業が本当に実力を備えているかどうかを見極める、最もシンプルで手っ取り早い方法に気づいた。

顧客の工場で実際に行われている作業シーンを、会場に持ち込む勇気があるかどうかを見ることだ。

プロモーション映像は編集できる。Demo はリハーサルできる。しかし、生産ラインは役者の立ち位置に合わせてくれない。

自動車の板金部品や機械加工部品の搬送・投入・取り出しにおける寸法誤差とサイクルタイムのプレッシャー、物流現場で小型商品がランダムに積み重なる状況、連続作業中の位置決めや移動。どんな細部でも、ロボットをその場で停止させ、異常モードを引き起こす可能性がある。

UBTECH は今回、顧客工場で克服してきたこうした課題を、そのまま 1∶1 で展示台に再現した。

会場では、産業用人型ロボット Cruzr Y1 が継続的に荷下ろしや積み付けを行い、段ボール箱や通い箱を搬送していた。一方、Cruzr S2 は自動車の機械加工部品や板金部品の搬送・投入・取り出しを行い、作業台上でサブミリメートル級の位置決めを完了させていた。

さらに Cruzr S2 は、さまざまな商品が混在する箱の中から規格の異なるスキンケア商品の箱を取り出し、1つずつ Dema の自動仕分けウォールの供給台に投入して、仕分けを完了させていた。概算では、平均ピッキングサイクルは最大で約 1,100 個/時 に達する。

人による介入も、あらかじめ設定されたプログラムもなく、認識から移動、把持、配置まで、すべてをロボットが自律的に実行している。

たとえ把持に失敗しても、ロボットは問題を自律的に認識し、戦略を調整して再び把持を試みることができる。

その背景には、実用化を先行してきた人型ロボット企業が、2026 年の人型ロボット競争をどう見ているかが表れている。

顧客に採用されてこそ、本当の現場だ。

UBTECH 副社長で、具身知能・人型ロボット研究院院長を務める焦継超博士は量子位に対し、顧客がロボットメーカーを選ぶ際、まず見るのは特定の Benchmark でどれだけ優れた成績を出したかではなく、ハードウェアが安定しているか、ロボットメーカーが現場を理解しているか、ソリューションが実際に稼働するかどうかだと語った。

研究室で一度タスクを完了させる場合、試されるのはアルゴリズムの上限かもしれない。

しかし、ロボットが工場に入り、数千回、数万回もの作業を連続して完了させるには、アルゴリズムだけでなく、ハードウェアの信頼性、タスク成功率、サイクルタイム、生産性、導入・保守コスト、そしてロボットメーカーが生産プロセス全体を理解しているかどうかが問われる。

UBTECH が WRC で展示したこれらのソリューションは、すでに実地訓練の段階を終え、小規模な納入段階に入っている。現在は、顧客現場での稼働状況を踏まえながら、段階的に導入規模を拡大している。

実際の現場で完了する作業が増えるほど、UBTECH は独自のエコシステムを構築していく。

焦継超氏は、人型ロボットが本当に顧客の現場に入った後は、1社だけでバリューチェーン全体を担うのは難しいと率直に語る。

チップ、部品、完成機の製造、現場への導入、データのフィードバック。その一つひとつが、ロボットを数台の試験導入から数百台、数千台規模の複製展開へと進められるかどうかを左右する。

展示台が一瞬で工場に変わる、顧客の生産ラインを 1∶1 で再現

今回の WRC で、UBTECH はスター機種を 1 台だけ持ち込んだのではない。産業用、商用、家庭向けの 3 つの製品ラインを、同時に展示台へ並べた。

**産業向けでは、**顧客の実際の作業ラインを 1∶1 で再現した。約 10 台の産業用人型ロボット Cruzr S2 と Cruzr Y1 が、自動車部品の搬送・投入・取り出し、搬送、荷下ろし・積み付け、仕分けなど、単純で反復的かつ単調な工程において、午前 9 時の開場から午後 5 時の閉場まで黙々と作業を続けた。

**商用向けでは、**UBTECH は新たな商用サービス人型ロボット Walker C1 を披露した。主な用途は、受付・案内、エンターテインメント・パフォーマンス、研究開発、スマートアシスタントである。

家庭向けには、「Resonance-LM」感情大規模モデルを搭載した超高生体模倣型人型ロボット「U1」も同時に登場し、感情面のサポートと情緒的な伴走を主な用途としている。

3 つの製品ラインを並べたことは、UBTECH が単純に SKU を拡充したという意味ではない。

会場で最も視覚的なインパクトを与えたのは、すべてのロボットが一列に並んでいたことではなく、Cruzr S2 と Cruzr Y1 が継続的かつ中断のない作業状態に直接入っていたことだ。

人による介入は一切なく、認識→把持→移動→位置決め→配置→検査→フィードバックという一連の工程を、終始自律的に完了させていた。連続したワークフローは非常に滑らかで、産業現場が求める最もリアルで厳しい要件をそのまま示していた。

高負荷、長時間、安定した連続作業。

細部を見ていくと、これは入念に演出された展示台上のパフォーマンスなどではなく、顧客の日常的な生産ロジックを完全に再現したものだと分かる。

たとえば、自動車の機械加工部品の搬送・投入・取り出しでは、2 台のロボットが協調して動作し、1 m を超える大型ワークを搬送する。同時に、部材の供給誤差、キャリブレーションのずれ、ワークの変形、現場の外乱にも対応し、最終的な位置決め精度は 1 mm 未満となる。

自動車板金部品の搬送・投入・取り出しでは、ロボットがベルトコンベヤーと工作機械の間を往復しながら、供給、位置決め、検査、取り出しを行う。VLA モデルはエッジ側で動作し、位置決め精度も 1 mm 未満である。

物流・EC の小型商品の仕分けでは、規格、色、積み重なり方が異なるスキンケア商品の紙箱を、ロボットが継続的に把持する必要がある。平均ピッキングサイクルは約 1,100 個/時に達する。

実際の工場作業の現場は、人型ロボットにまったく異なる能力を要求する。

もはや、動作を滑らかに見せたり、走ったり跳んだりする姿を美しく見せたりするだけでは不十分だ。複雑な現実環境を理解し、タスクの目標を自律的に分解し、不確実な外乱の中でも把持、組立、配置などの操作を安定して完了させ、失敗した場合には自律的に修正して再試行することが求められる。

この点が、作業型の「働くロボット」と、パフォーマンス型の「踊るロボット」との間に、ハードウェア選定や演算能力の構成における大きな隔たりを生み出している。

踊るロボットは、動作の爆発力と軽快さを優先し、走行、宙返り、ダンスのアクロバットなど、視覚的な効果を重視する。

ハードウェアは軽量化を重視した設計で、身長は 1.2 m 前後のものが多い。通常、視覚センサーや力覚センサーは搭載せず、器用なハンドのような末端作業用アクチュエーターも必要としない。

関節には、柔軟性が高くコストも抑えられる遊星減速機が選ばれることが多く、大きな動きを伴う身体パフォーマンスを支えるには十分だ。演算側も、瑞芯微 RK3588 のようなチップで足りる。チップは主に低レイヤーのモーション制御を担い、あらかじめ作成された軌道を実行すればよいため、複雑な具身大規模モデルを動かす必要はない。

一方、「働くロボット」は身長が 1.7 m を超えるものが一般的で、継続的な荷重、長時間の連続稼働、そして物体との頻繁な接触・インタラクションを伴う、現実の作業環境を対象としている。

関節には継続的な負荷に耐え、疲労に強い特性と接触トルクの精密な制御を両立することが求められる。そのため、コストは高いものの、剛性と安定性に優れたハーモニックドライブ減速機が選ばれる。

同時に、ロボットが環境認識、力覚フィードバック、タスクの分解・計画、失敗後の自律的な再試行を行うには、具身大規模モデルや世界モデルをローカルで実行し、リアルタイム推論を行う必要がある。そのため、NVIDIA Thor のような高演算性能チップを演算基盤として用いることが不可欠になる。

簡単に言えば、踊るロボットが競うのは動的なパフォーマンス能力であり、ハードウェア構成全体がステージ上の演出効果のために設計されている。

これに対して、働くロボットが競うのは、完成機としての信頼性と自律知能の水準だ。本体のハードウェアも演算アーキテクチャも、すべて実際の生産作業を中心に設計されており、両者のハードウェア体系をそのまま相互運用・再利用することはできない。

UBTECH が今回、これほど厳しい実際の生産ラインを WRC の展示台へ持ち込んだのは、単に技術を披露するためではない。

ハードウェアが決めるのは、ロボットが「動き出せるか」だ。しかし、ロボットが本当に「仕事をやり遂げられるか」を決めるのは、具身知能の頭脳である。

では、何の保護もあらかじめ設定されていない万人規模の展示会場で、ロボットに高負荷かつ人の介入なしの連続作業を行わせるために、UBTECH はいったいどのような頭脳でこの難題を支えているのだろうか。

ロボットに具身知能の頭脳を搭載する

UBTECH の「具身知能の頭脳」は本質的に、理解、予測、実行からなる 3 層構造である。

第 1 層は Thinker 基盤大規模モデルで、ロボットが世界を「理解する」役割を担う。

ロボットはまず、自分がどこにいるのか、目の前にどのような物体があるのか、ユーザーからどのようなタスクを指示されたのかを把握しなければ、その後の計画や操作には進めない。

Thinker は、ロボットの一人称視点データを通じて、視覚、言語、空間環境を理解する能力を構築する。

△UBTECH の具身知能大規模モデル Thinker の技術アーキテクチャ図

公開資料によると、Thinker は 10B 未満の具身知能脳モデルを対象とした権威あるベンチマーク評価で 9 項目の首位を獲得しており、最大の基盤モデルは 100B に達する。

これらの評価結果は、知覚・理解層におけるモデルの基礎能力を裏付けるものだ。しかし、生産工程に入ると、モデルは常に変化する物理世界に直面することになる。

そこで必要になるのが、第 2 層の能力である「予測」 だ。

Thinker 基盤モデルをベースに、UBTECH は独自開発の「Thinker-WM 世界モデル」 を構築した。その役割は、次の問いに答えることだ。

私がこのように動いたら、次に何が起こるのか?

ロボットが物体を持ち上げたら、落下することはないか。ある場所まで移動したら、衝突することはないか。次の動作は物理法則に適合しているか。

そのため、Thinker-WM はデータパイプライン、モデルのデバッグ、学習 Infra について Thinker が蓄積してきたノウハウを継承しつつ、モデルアーキテクチャをアップグレードした。Diffusion Transformer、Flow Matching などの技術を導入し、動画表現、Action 表現、Prediction を統一された表現空間に配置して学習することで、動作計画を物理世界の法則により適合させている。

現在、Thinker-WM は具身知能評価ベンチマーク LIBERO で首位に立っている。

最後の層は Thinker-VLA で、「実行」を担当する。

WRC で展示された産業用工程において、Thinker-VLA はタスクの理解を連続的な制御信号へ変換し、ロボットアームの軌道、エンドエフェクターの姿勢、把持力、配置位置をリアルタイムで決定する必要がある。

ワークのずれや把持の失敗が発生した場合、モデルはフィードバックに基づいて動作を調整し、ロボットがタスクを継続できるようにする。

VLA は操作に重点を置き、「この作業をどう実行するか」という問いに答える。一方、世界モデルは「このように動いた後に何が起こるか」という問いに答え、その結果を予測する。

焦継超氏によれば、理解、予測、実行という 3 層の能力がつながって初めて、ロボットは「見て、考える」段階から「実際に作業する」段階へ進める。

UBTECH は次の段階として、3 つのモデルを統一したエンドツーエンドアーキテクチャに統合することを検討している。これには、バックボーンネットワークやパラメータ共有も含まれるという。

しかし、実際に工場へ入るロボットにとって、モデルの能力は最初の関門にすぎない。

次の関門は、その頭脳をロボット本体上でリアルタイムに動かせるかどうかだ。

ロボットの動作が毎回クラウドからのフィードバックに依存すると、ネットワーク遅延、通信の安定性、導入コスト、消費電力が、産業用途への導入を妨げる要因になる。

UBTECH の方向性は明確だ。リアルタイム性の高い機能をエッジ側へ移行する。

データによると、Thinker-VLA はエッジ向けに最適化した結果、推論効率が 176% 向上し、ストレージ使用量が 60% 減少した。また、エッジ側の全機能モジュールに必要な GPU メモリは 64GB から 32GB に削減された。

焦継超氏によれば、チームは多数のアルゴリズムを x86 プラットフォームから低消費電力の ARM プラットフォームへ移行するとともに、低レイヤーソフトウェア、演算子、ドメインコントローラーを最適化し、ソフトウェアシステム全体を 1 枚の組み込みボード上で動作させることを目指している。

搭載する回路基板が増えるほど、スペース、稼働時間、信頼性が問題になります。だからこそ私たちは、すべてのソフトウェアアルゴリズムをエッジ側で処理することにこだわり続けています。

焦継超氏の見方では、クラウドは今後も低速推論、複数台のスケジューリング、モデル管理を担い、エッジ側はロボットのリアルタイムな知覚と動作実行を担当する。

そのため、モデル、演算能力、消費電力、通信、モーション制御、ハードウェアの信頼性を、製品設計の初期段階から協調して検討する必要がある。

エッジへの展開によって、具身知能の頭脳を身体に搭載できるかという問題は解決した。では、同じ「頭脳」を産業用、商用、家庭用という 3 種類のロボットに、どのように迅速に適応させるのか。

UBTECH が示した答えは「1+N」だ。

「1」は共通技術基盤、「N」は異なる現場に合わせて定義されたロボット製品を意味する。

焦継超氏によれば、具身技術がまだ真の汎化を実現していない現段階では、異なる現場から逆算して製品を定義するしかない。

産業用ロボットでは、負荷、精度、連続稼働能力が重視される。商用ロボットでは、高い動的性能とインタラクション能力が重視される。家庭用ロボットには、表情、感情、記憶を理解する能力が必要になる。

同じ知能基盤は再利用できますが、ロボットの身体は依然として、それぞれの具体的な現場に合わせてエンジニアリング面で最適化する必要があります。

現在、UBTECH が培ってきたこの再利用能力の価値は、すでに表れ始めている。

商用サービス人型ロボット Walker C1 は、既存の産業用ロボット技術基盤をベースに開発され、ソフトウェアシステムの一部と自社開発のサーボ技術を継承している。製品定義から試作機の完成までにかかった期間は約 4~5 か月 だった。

従来、同種の製品を完全にゼロから開発する場合、通常は 6~9 か月を要していた。

UBTECH が披露した「仲間の輪」

具身知能の頭脳を身体に搭載し、エッジ側へ下ろすことで、ロボットが「作業できる」ようになるための第一歩は解決した。

具身知能の競争が最終的に行き着く先は、必ずデータに戻ってくる。

従来の AI では、モデルの能力は大きくインターネット上のデータ規模に依存していた。しかし具身知能の場合、ロボットが向き合うのは不確実性に満ちた物理世界である。

同じ把持動作でも、物体の重量、配置位置の変化、機械誤差の累積によって、結果はまったく異なるものになる可能性がある。

こうした実環境から得られるフィードバックは、シミュレーションだけで取得するのは難しい。

したがって、ロボットは実際の現場に入り、タスクの実行、失敗の修正、環境とのインタラクションを繰り返す中で経験を蓄積しなければならない。

UBTECH がモデルの学習に用いるデータの内訳では、実機データが 60~70% と大きな割合を占め、Ego(一人称視点)データが約 20%、残りの 10% がシミュレーションデータ だという。

このデータ構成の背景には、具身知能の進化経路に対する UBTECH の見方がある。

世界モデルはデータの利用効率を高め、シミュレーションは極端な状況を補完できます。しかし、ロボットが実際に直面する摩擦力、負荷による変形、物理的な接触、ランダムな外乱を深く学習できるのは、現実のインタラクションだけです。

こうした実際のフィードバックを循環させるため、UBTECH は完全な自社構築型データ・クローズドループを構築している。

ロボットは生産環境に入ると、継続的にタスクデータを生成する。これらのデータは、アップロードと解析、クリーニングとアノテーション、モデル学習、展開検証を経て、次のデータ収集へとフィードバックされる。

このプロセスにおいて、ロボットがタスクを 1 回完了するたびに、それは単なる納入実績ではなく、具身知能の頭脳に新たな経験を蓄積することにもなる。

現在、UBTECH は 1 日あたり数千時間規模の生データを生成できる。クリーニング後は、8 時間分のデータから約 1.5~2 時間分の有効データが残る。

こうしたデータは UBTECH のモデルだけに利用されているわけではない。現在、すでに複数の有力な具身モデル顧客が UBTECH の実機データを購入している。

財務報告によると、2025 年の UBTECH の年間売上高は 20 億元を超え、人型ロボットの総販売台数は 13,838 台だった。

そのうち、フルサイズの具身知能人型ロボットによる売上高は 8.2 億元、販売台数は 1,079 台に達した。その 80% 超が、自動車製造、スマート物流、3C 電子、半導体、航空機製造、産業データ収集など、厳しい産業現場で活用されている。

数字そのものが最も重要なわけではない。

本当に重要なのは、これらのロボットが「高付加価値な生産現場」に入れるかどうかだ。

そうした現場でロボットがより複雑な問題に直面するほど、生成されるデータは豊富になり、モデルの反復速度は速くなり、次の納入における能力も高まる。

だからこそ、具身知能の中核的な参入障壁は、単純な出荷台数ではない。重要なのは、「ロボットの導入→実データ→モデルの最適化→能力向上→さらなる現場への導入」 という正の循環を構築できるかどうかだ。

そして、この循環を継続的に拡大するには、1 社のロボット企業だけでは不十分だ。

具身知能は最終的に、製品に対する理解、データ・クローズドループ、ソフトウェアとハードウェアの協調、大規模製造を網羅するシステムエンジニアリングの競争になる。

焦継超氏によると、UBTECH は「仲間の輪」をチップ、コア部品、完成機の製造、現場への導入といった各領域へ拡大している。

チップ分野では、UBTECH は Mu Xi(MetaX)と「曦選創智」を設立し、具身知能向けエッジチップの研究開発と量産に取り組んでいる。2027 年のテープアウト、2028 年の量産開始を計画している。

部品分野では、A 株上場企業の鋒龍股份を買収し、器用なハンドやサーボドライバーなどのコア部品の研究開発・製造を共同で推進している。

△器用なハンド

△サーボ

製造面では、UBTECH は Siemens と協力して、年間 1 万台規模の生産能力を持つ人型ロボットのスーパー・スマートファクトリーを建設し、今年 8 月に正式稼働させた。

さらにアプリケーション面では、UBTECH はすでに、日立中国、Foxconn、SANY Renewable Energy、Basic Semiconductor、珠城科技などのスマート製造パートナーに加え、BYD、Geely、東風柳汽、本田貿易、富奥股份、永茂泰などの自動車産業パートナー、Dema Technology などのスマート物流パートナーをカバーしている。

今年上半期には、UBTECH は申昊科技、Terra Robotics、徳山 JMR、永達ロボット、ボーシ・グループ、麦迪科技など、国内外のシステムインテグレーターとも提携した。人型ロボットをより多くの産業へ導入する取り組みを継続的に進めている。

これらのパートナーが、完全なバリューチェーンを形成している。

上流は、より安定し、より低コストなロボットの基盤能力を提供する。中流は、ロボットの大規模な導入・納入能力を高める。下流の実際の生産現場は、新たなタスク需要とインタラクションデータを継続的に生み出す。

最終的に、これらのデータは再び具身知能の頭脳へ戻り、モデルの反復を促進する。そしてその結果、ロボットがより多くの現場へ進出する能力が高まっていく。

One more thing

人型ロボット業界には、歩く、跳ぶ、1 回の把持動作を完了するといったことができる製品は、もはや珍しくない。

これから差が広がるのは、ますます現実的な一つの問いに集約されていくだろう。顧客のもとに残り、翌日も働き続けられるロボットはどれか。

実際の現場に入った後、ロボットが向き合うのは一度限りの展示タスクではない。毎日数時間、数百回、場合によっては数万回に及ぶ反復作業である。

ここで試されるのは単一の能力ではなく、システム全体の能力だ。ハードウェアの信頼性、モデルの汎化能力、データ・クローズドループの効率、そしてメーカーが実際の業務を理解する能力。

この意味で、顧客からの注文は単なる売上を意味するだけではない。技術路線を検証する、最も直接的な一票にもなる。

顧客がロボットを導入して初めて、ロボットは実際のフィードバックを得られる。実際のフィードバックがモデルの反復を促し、モデルの性能向上が、ロボットをさらに多くの現場へ導いていく。

ここで、商用化と技術の進化は同じ一つの曲線になり始める。

そう考えると、UBTECH が WRC で再現したあの顧客向けのクレ[generation cut]

#国内AI#具身智能#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/477016.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →