コンテンツにスキップ
メインサイト ニュース コンソール

UnitreeとAgiBotが同じ頭脳を共有:謎のモデルデモが鮮烈登場、10分間ワンテイク

· 量子位
国内AI

現在の具現知能企業は、Demo をまるで広告のように精巧で大げさに撮影しがちです。しかし、編集されていない本物の動画を見たことはありますか?

数日前、業界関係者から10分間の Demo 動画が送られてきました。最初から最後までワンカットで、編集なし、現場外からの遠隔操作なし、人間による指示もなし。むしろ少し粗さすら感じられる動画でした。しかし、そこに映し出されていた内容を見て、私はその場で椅子に崩れ落ち、しばらく気持ちを落ち着けることができませんでした(doge)。

動画の中でロボットは、窓の外に腕を伸ばしてガラスを拭きます。高い場所に手が届かないときは、箱を運んできてその上に乗ります。長時間にわたるタスクの途中で中断されても、正確に作業を再開します……。

さらに衝撃的なのは、動画の中に Unitree と AgiBot、2社のロボット本体が同時に登場していることです。ハードウェア構成、運動自由度、センシングシステムがまったく異なるこの2種類の「競合製品」が、なんと1つの「脳」を共有し、互いに連携しながら密接に協働しているのです。これは世界的に見ても珍しい、異なるロボット本体に対応する汎用脳の実例です。

大げさではなく、これは世界の具現知能業界に対する認識を塗り替え、技術評価そのものを覆す可能性のある Demo かもしれません。Scaling Law さえ変えてしまう可能性があります……。

いったい、どこから現れた「神チーム」なのでしょうか?

動画をコマ送りで分解すると、名場面だらけ

この動画は、あまりにも情報量が多いものでした。じっくりコマ送りで分析してみると、見れば見るほど引き込まれていきます。

  • 狭い空間での作業が、あまりにも安定している

撮影場所は、約15平方メートルの賃貸住宅です。家具が密集し、通路も狭く、体の向きを変えることさえ難しいほどです。このような環境では、そもそも遠隔操作はほぼ不可能です。現場にはオペレーターが入るだけの十分なスペースがないからです。また、完全なスクリプトを事前に用意するのも困難でしょう。

環境設定を見る限り、この動画はほとんど直接こう告げているように見えます。これは、ロボットが完全に自律的に学習し、進化し、意思決定している動画にほかならない、と。

2台のロボットが同じ空間内で並行して家事をこなし、環境の境界をリアルタイムに認識しながら経路を計画しています。

全編を通して、衝突も、迷走も、停止もありません。見慣れない複雑な実環境に完璧に適応しています。牽引ロープにつながれた、いわば「戦損状態」のロボットでさえ、極めて高い柔軟性を見せています。

動画全体にカットも撮り直しもなく、人間による指示の介入もありません。

  • 腕を窓の外に伸ばしてガラスを拭く――力学能力と自律推論の頂点を具現化

最初のタスクから、ロボットは繊細で、人間の想像を超える一面を見せました。

Unitree のロボットの1台が、スクイージーを使って窓ガラスを拭きます。スクイージーを使ったことがある人なら分かると思いますが、力が弱すぎるときれいに拭けず、強すぎると異音がします。雑巾で拭くよりも、力加減の制御と空間認識が求められる作業です。ロボットは開始早々、自分からタスクの難度を上げました。

何度か拭いたところで、拭き残しがあることに気づき、なんと自律的にこう判断したのです。汚れは窓の外側にあるのかもしれない、と。

そして、私がこれまで一度も見たことのない動作を行いました。体を横向きにし、上体を反らし、頭を出し、腕を伸ばして、スクイージーを持った手を窓の外へ突き出したのです。(まるで老練な犬のような安定感)

現在の一部の具現モデルにとって、十分な力制御を実現するだけでも限界です。しかしこのロボットは、正確なトルク制御に加えて、空間環境の認識――腕を伸ばす際に窓枠へぶつからないこと――と、力学計算能力まで完璧に融合しています。

単一の能力を業界トップレベルに高めただけでなく、その3つを統合したパフォーマンスまで見せているのです。

それ以上に、私が長い間動揺を抑えられなかったのは、室内からではきれいに拭けないと判断すると、すぐに推論と意思決定を完了し、窓の外に手を伸ばしてガラスを拭いたことです。モデルが人間のように自ら推論し、自律的に意思決定する姿を見たのは、これが初めてでした。

これは、モデルが視覚、触覚、力学などの情報を統合して統一的な知覚を形成し、自律的に進化する能力を備えていることを十分に示しています。今回、私はようやく、ロボットは本当に仕事ができるのだと信じることができました。しかも将来は、人間よりうまくこなす可能性さえあります。

  • 長時間にわたるタスクを完結させ、誤差の蓄積を防ぐ

ガラスを拭き終えると、Unitree のロボットはスクイージーを元の位置に滑らかに戻しました。置く位置は正確で、動作も途切れません。

この最後の動作を軽く見てはいけません。これは「道具を取る→作業する→片付ける」という一連の工程を、完全なループとして完了したことを意味します。

隣にいた AgiBot のロボットは洗濯機へ近づき、洗い終わった座布団を取り出してソファの後ろに置きます。その後、再び戻って洗い終わったぬいぐるみを取り出し、2段目の衣類棚に正確に収めました。どの物品も、本来あるべき場所に戻されています。

AgiBot のロボットは誤ってガラスにぶつかりましたが、これはむしろ、プロセス全体が自律的な意思決定によるものだったことを示しています。カメラでは、ガラスの反射による問題を解決できないこともあります。一方、人間が遠隔操作していたなら、通常は事前に回避できるでしょう(doge)。

この2つの場面は、10分間の動画全体から見れば、最も基本的な能力の縮図にすぎません。長時間のタスクにおいて、各作業は流れるように正確かつ一度で完了しており、タスクが増えたり長くなったりしたことで誤差が積み重なり、次第にパフォーマンスが悪化することもありません。

これは、従来の VLA モデルが最も苦手としていた長大なシーケンス・タスクの問題を解決しています。

動作だけを見ても、このモデルはまったく新しいアーキテクチャを採用している可能性があります。10分間に及ぶ非常に長いタスクチェーンの中で、継続的に誤差を修正しながら安定した出力を維持し、すべての動作を正確かつ制御可能なものにしています。そのロバスト性は、業界トップクラスと言ってよいでしょう。

  • タスクはいつでも中断可能で、モデルは中断地点から作業を再開できる

次に、画面から目覚まし時計の音が聞こえてきます。(音量を上げて注意深く聞かないと、音はあまりはっきりしません。)

最初、私はこの目覚まし時計の意味を理解できませんでした。何度も見返してようやく、これは何らかの事前設定されたリマインダーであり、2台のロボットの現在のタスクを中断して、テーブルと冷蔵庫を片付ける特別タスクを開始させたのだと気づきました。

驚くべきことに、テーブルと冷蔵庫の片付けを終えると、ロボットは中断前のタスクを再び続行しました。つまりこのモデルは、いつでも中断でき、中断地点から作業を再開し、タスクを復元する能力を備えているのです。

市販のロボットが、1回の Demo で1つのタスクをこなすだけでも細心の注意を必要とするのに対し、一見粗雑に見えるこの動画が示しているのは、ロボットが実際の作業環境で継続的に働けるだけでなく、同時に複数のことまでこなせるという事実です。

続いて、家庭内の片付け作業が一通り行われます。Unitree のロボットは収納袋を取り、テーブルの上に置きます。AgiBot のロボットは冷蔵庫の上にある食べ物を見て、冷蔵保存すべきだと判断し、片付けを実行します。さらに、解凍が必要な食材まで取り出しました。(この謎のチームは、ロボットがもうすぐ四菜一湯――4品のおかずとスープ――を作れるようになると暗示しているのかもしれません。)

作業を細かく指示されることなく、ロボットは自律的にタスクを分解し、動作を計画し、物を取るところから所定の場所へ戻すところまで、一連の工程を段階的に完了させています。

現在、ほとんどのロボットは単一タスクを順番に実行することしかできません。途中で何らかの妨害を受ければ、タスクは基本的に破綻します。しかしこのモデルは、人間に近いタスクの優先順位判断と動的なスケジューリング能力を備え、いつでもタスクの流れを切り替えられるようです。その柔軟性と安定性が示す知能は、現在知られている大半のモデルをはるかに上回っています。

  • AgiBot が Unitree にマフラーを巻く――異なる本体間の協働を象徴する名場面

その後、動画全体のクライマックスが訪れます。

2台のロボットは、まるで事前に相談していたかのように、往復して運ぶ手間を省くため、テーブルの上の雑多な物を一度に片付けることにしました。

Unitree のロボットは次々と物を自分の体に載せていき、両手がふさがって、どう続ければよいのか分からなくなります。すると AgiBot のロボットが優しく近づき、テーブルの上にあったマフラーを手に取り、ゆっくりと Unitree のロボットの首に掛けたのです。

AgiBot のロボットはマフラーが長いことに気づき、両手で持ち上げます。Unitree のロボットもその意図を理解したかのように、自ら腰をかがめます。そして AgiBot はマフラーを Unitree の頭の上に回し、相手の首に掛けました。

いや、ちょっと待ってくれ! この滑らかな動作と、互いの目線のやり取りは何なのでしょう。まるでカップルのような雰囲気まであります!

これは、あらかじめ決められた役割分担ではありません。異なる2つの本体の間で、モデルが自律的に探索して導き出した協働方法です。異なるブランドのロボットが、それぞれの能力の限界を自律的に判断し、完璧に補完し合っています。これはすでに人間の協働に限りなく近く、しかも言葉による意思疎通なしに、より息の合った動きさえ見せています。

これは世界初の異なる本体間のインタラクションかもしれません。また、異なる本体を汎用的に扱えるモデルが登場した世界初の事例かもしれません。

この謎のチームは、互いに競合する2種類のロボット本体を通して、こう伝えようとしているのだと思います。これこそが本当の汎用脳なのだ、と。

  • タオルを肩に掛け、スリッパをひっさげる――ロボットは仕事だけでなく、もう「楽をする」ことまで覚えたのか?

全身に物を載せた Unitree のロボットがゆっくりと遠ざかると、AgiBot のロボットは残りの物を片付け続けます。

すると、1枚のタオルを手に取り、自分の体に掛けようとしました。1回、2回、3回と試した末、ようやくタオルを肩に掛けることに成功します。

三連続の衝撃です!

ロボットは、どうすれば最も楽に作業できるかを理解しているようです。タオルを手に持つよりも、肩に掛けたほうが負担が少ないのです。

モデルは自律的に学習し、1、2回試して失敗した後も改善を続け、成功するまで試行します。

モデルが自分の本体を理解していることこそ、異なる本体に応用できる核心的な理由なのかもしれません。

これは単独の例ではありません。

よく見ると、ロボットがスリッパを片付けるとき、持っているのはスリッパそのものではなく、新しいスリッパの吊りひもです。ひもを持ったほうが楽だからです。

またしても衝撃です! 他のロボットが作業のために動作を念入りに設計している間に、このモデルは仕事を終わらせただけでなく、直接「楽をする」ことまで覚えてしまいました。本当に賢すぎます。

  • さらにクライマックス:ロボットが道具の使い方を学び、箱を踏み台にしようとする

しかし、まだ終わりではありません。次に、最も驚いた場面が登場します。

全身に掛けた物を1つずつ元の場所に戻していく中で、マフラーを3段目の棚に置くことが、身長1.3メートルの Unitree G1 ロボットを悩ませました。

ここで不思議な場面が現れます。ロボットは動けなくなったり、諦めたりしませんでした。人間のように推論し、自分で箱を探してきたのです。そう、箱を見つけ、箱の上に乗って高さを補い、そのうえで片付けようとしたのです。

ロボットはそばにあった箱を見つけ、床へ押し出しました。そして腰をかがめて箱を持ち上げようとしましたが、自分が腰を曲げられないことに気づきます。

何度か試した後、私はさすがに諦めるだろうと思いました。しかしなんと、片足で箱を棚のそばまで蹴り飛ばしたのです。

この一連の動作には、次のことが表れています。

**自律的な推論と意思決定能力。**ロボットは、高い場所にある物体へ手を届かせる方法を理解しており、腰を曲げられない場合に箱をどう動かせばよいかも分かっています。

**自分の身体能力を継続的に探索する能力。**何度も腰を曲げようと試す過程で、ロボットは自分の身体の限界を次第に理解し、その身体能力に合った選択を行ったように見えます。

**自律的な進化の過程。**ロボットは誰からも教えられていないのに、足で箱を蹴る方法を学びました。自分の身体と環境の相互作用を巧みに利用し、その過程で戦略を調整し続けています。

この場面には、本当に背筋が凍りました。

自律的に道具を使うことは、人間を象徴する能力の1つです。

動画のロボットは、本当に道具の使い方を学んだように見えます。箱が荷重に耐えられること、箱の上に乗れば高さを稼げること、そして腰を曲げられないときには足で箱を目標位置まで蹴り動かせることまで理解しているのです。

この一連の動作の背後には、物理世界のルールに対する深い理解、自らの能力を継続的に探索する姿勢、そして自律的な意思決定と戦略の進化が組み合わされています。

  • 異なる本体の能力を補完し、協働作業を行う――個体から集団へ

Unitree は箱を足で蹴って移動させましたが、箱は少しずれてしまいました。ロボットが箱を正しい位置に戻す方法を考えていると、身長1.7メートルの AgiBot 遠征 A3 がやってきます。

AgiBot は Unitree の執念と困難に気づいたかのように、手にしていた小型カートを置き、自らタスクを切り替えて仲間を助けることを選びました。

Unitree が卒業記念の勲章を授与されるかのように腰をかがめて頭を下げると、AgiBot はゆっくりとマフラーを外し、棚の上に置きます。

細部に至るまで、すべての動作が、このモデルが他のモデルと異なる能力を持っていることを示しています。

2台のロボットは、自分自身と相手のハードウェア能力を理解し、互いに連携しています。これは個体知能の段階を越え、集団知能へと踏み出したと言えるでしょう。

AgiBot は Unitree の頭の後ろにマフラーを回し、軽やかにマフラーを取り外しました。そこには、力加減の制御と空間認識に対する極限の理解が表れています。(ここで、他のロボットならこのマフラーをどう引っ張って外すか、想像してみてください。)

ロボットはマフラーを三つ折りにしました。これは、マフラーを衣類棚によりうまく収める方法について、自律的に判断した結果です。これこそが本当の具現「知能」です。

最後に、Unitree を手伝い終えた AgiBot は静かにその場を離れ、最後の衣類を洗濯機の中にしっかりと入れました。(おそらく、洗濯機の上に置かれていたのは汚れた衣類だと判断したのでしょう。)こうして、10分間にわたるワンカット動画はついに終わりました。

このモデルの具体的なアーキテクチャはまだ分かりません。しかし、ここまで見れば、皆さんも私と同じように言葉を失ったことでしょう。

初めての異なる本体間の協働。初めて目にしたロボットの自律的な進化。初めて見た、ロボットが人間のように自律的に意思決定し、最適な経路を選択する姿。そして極めて高度な空間認識と力制御、いつでも可能なタスクの中断、道具の使い方の学習……。

このモデルの一つひとつの動作、一フレーム一フレームの映像が、どれも素晴らしい Demo になり得ます。しかし、それらは10分間のワンカット動画の中に、何気なく静かに現れました。しかも、その見せ方は極めてシンプルで直接的です。

まるで、すべてのことを軽々と、何の苦もなくやってのけているかのような、王者のような余裕さえ感じられます。

基盤技術は主流モデルの既存フレームワークを脱却

なぜ動画のロボットは、これほど多くの名場面を生み出せたのでしょうか?

関係者から聞いたところ、最も重要な理由は、このモデルが現在主流となっている具現モデルの既存フレームワークから脱却していることだそうです。

現段階で、主流の具現モデルはおおむね VLA、WAM、従来型の世界モデルの3種類に分けられます。しかし、いずれも現時点では突破が難しいボトルネックを抱えています。

△画像は AI により生成

具体的に言えば、VLA は「データによる直感派」です。膨大な視覚・言語・動作データに依存し、エンドツーエンドでフィッティングします。しかし、その本質は「画像を見て動作を当てる」ことであり、物理的な推論能力に欠けています。長いシーケンスのタスクでは誤差が継続的に蓄積し、未知の環境に対する汎化能力はほぼゼロです。さらに、特定の本体に強く依存しています。

一方、WAM と従来型の世界モデルは「先読み空想派」に属します。まず世界の法則をモデル化し、そのうえで動作を計画しようとしますが、致命的な「知行の分離」という問題を抱えています。モデルはシーンを理解し、状態を予測できます。しかし、物理力学的な推論が必要な実際の操作に直面すると、依然として学習データに基づく推測に頼るしかなく、現実環境の動的な変化に適応できません。

これら主流の具現モデルには、共通する根本的な欠陥があります。それは、データ駆動によるタスクフィッティングです。

つまり、すべての動作が膨大なデータに基づく「確率的な推測」によって生成されており、物理法則に対する深い理解に基づいているわけではありません。そのため、モデルの能力の上限は、学習データによって厳密に制限されます。

聞くところによると、動画のモデルは数十時間分の動画データしか使って訓練されていないそうです。これほど少ないデータ量で、この驚異的な結果を達成できるのなら、Scaling Law は本当に存在するのでしょうか。疑問符を付けざるを得ません。

細部を見ると、動画のモデルは少なくとも、現段階の VLA や世界モデルでは到達が難しい4つの能力を示しています。

  • 力学モデリング:運動軌道が力学的に実現可能なものとなっており、補償トルクやフィードフォワード項を計算できます。優れた外挿能力と汎化能力を備えています。

  • 自己認知能力:VLA のように条件反射に依存することも、WAM のように時系列統計に依存することもありません。人間のように、「次に目標へ最も近づける動作は何か」と考えることができます。

  • 適応能力:因果推論を補い、ロングテール問題を解決し、タスクを実行しながら継続的に調整・進化できます。

  • 自律進化能力:タスクを完了する過程でスキルが増え続け、戦略が継続的に進化します。まるで自ら学習目標を生み出し、目標達成のために能動的に推論しているかのようです。

これらすべてを支えているのが、3つの基盤技術です。

**物理制約付きの力学学習。**VLA や WAM の純粋なデータ駆動型の学習方式とは異なり、物理法則をあらかじめ組み込み、力学予測によって行動を駆動します。スリッパの吊りひもを持つ、タオルを肩に掛ける、箱を踏み台にして高い場所へ上がるといった動作は、データから直接教えられたものではありません。モデルが環境と相互作用する中で、自律的に探索して導き出した最適解なのです。

**異なる本体の統一モデリング。**統一された動作表現空間と本体適応メカニズムによって、同一のモデルを異なるブランド、異なるアーキテクチャのハードウェアプラットフォームに適応させます。これは、具現知能における「ソフトウェアとハードウェアの分離」を実現するものであり、ハードウェアがアルゴリズムを拘束する時代を終わらせます。

**長時間タスクに対するロバストな閉ループ制御。**全体的なタスクスケジューリングフレームワークに基づき、作業中に発生する突発的な干渉、動作誤差、タスクの切り替えを自律的に処理します。従来のモデルが長いプロセスの中で誤差の蓄積により破綻することを防ぎ、実際の家庭や複雑な環境に展開するための中核能力を備えています。

具現モデルの現状を知っている人なら、ここまで読んだ時点で驚きのあまり言葉を失ったことでしょう。

他のチームの Demo が短時間、入念な編集、単一タスクの積み重ねにとどまっている中、この謎の動画は、10分間ノーカット、ブランド横断、複数ロボットの協働、全工程、自律進化という、現実の作業環境への展開をすでに実現しています。

他のモデルがまだ「データに頼って動作を推測」している一方で、このモデルは完全な自律的意思決定、自律学習、自律進化を実現したかのように見えます。ロボットは本当に仕事ができるだけでなく、その能力自体を急速に自律進化させている。そんな姿を私たちに見せ、無限の想像をかき立てます。

さらに重要なのは、このモデルによって、私たちは次の未来を目の前に見ているように感じられることです。3年後、5年後、あるいは10年後にようやく到来すると熱く議論されていた未来――ロボットが本当に人間に代わって仕事を完遂する日が、今日、私たちの目の前に現れたのです。

まだ名前も知られていないチームが、あらゆる技術的アプローチを覆し、Scaling Law さえ覆し、本物の具現「知能」を生み出し、具現知能における ChatGPT モーメントに近づいているように見えます。

この謎のモデルがどの企業から生まれたものなのか、現時点ではまだ分かりません。しかし、今この瞬間、皆さんの疑問も私と同じはずです。

いったい、誰なのでしょうか?

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/479634.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →