コンテンツにスキップ
メインサイト ニュース コンソール

謎に包まれたエンボディドAIチームが大型デモを相次いで公開:自己進化型モデルの技術ロードマップが明らかに

· 量子位
国内AI

先週、具身知能界隈で話題になった、謎めいた10分間のワンカット動画を覚えていますか?

動画が公開されると、ネット上では次々にこんな声が上がりました。「信じられない。まるで宇宙から来たものみたいだ……」

さらには、最高級の評価まで飛び出しました。

「これ、AIが生成したんじゃないの?!」

同業者たちは、いったいどの企業が作ったのかとこぞって尋ね、トップ企業の中には専門の会議を開いて研究したところもあるといいます……私たちのところにも、さまざまな方から問い合わせが殺到しました。

この10分間のワンカット動画を見た人々は、具身知能の「ChatGPTモーメント」が本当に到来したのかもしれないと口々に語りました。具身知能における重要なマイルストーンだという人もいれば、アーキテクチャの革新だという人もいます。なぜなら、そこには次のような姿が見えたからです。

  • ロボットは、単なる確率予測ではなく、一定の認知能力を備えている。
  • ロボットは、単純な過学習ではなく、人間の行動原理を理解している。
  • ロボットは継続的に自己進化する能力を持ち、数多くの驚くべき瞬間を見せている。

もちろん、ロボットの動きがあまりにも「SF的」だったため、疑問を呈する人もいました。これは遠隔操作ではないのか、と。(ただしチームによれば、あれほど狭い空間では、そもそもどうやって遠隔操作すればいいのか分からないそうです。)

そして、この謎のチームが疑問に答える方法もまた、とてもユニークでした。彼らはさらにいくつかのDemoを続けて公開したのです。相変わらず粗削りで、相変わらずワンカット。まるでこう言っているかのようでした。

「知能は、信じようと信じまいと、本当にやって来る。」

前回の記事をきっかけに、私たちはこの謎のモデルチームと連絡を取ることができ、疑問をぶつけました。なぜ自分たちだと名乗り出ないのか、と。

相手から返ってきた答えはこうでした。モデルも人間と同じで、自分自身に語らせればいい、と。

この謎のモデルには、内部コードネームとして「MVP」が付けられています。これは、モデルの能力が実在の人間のようであること(Make Veritable People)を意味します。チームによれば、「人間になろう」と直訳することもできるそうです(doge)。

「人間になろう」大規模モデル。

今回公開された複数のDemoを見る限り、ロボットは「本当に人間になった」ように見えます。人間のように考え、自律的に意思決定し、動作は滑らかで、ロジックにも一貫性があります。しかもチームによれば、まもなくロボット自身を街中に送り出し、オープンな環境で直接その姿を披露する予定だそうです。

動画1:手と目を切り離さない協調動作、卓越した力学理解

http://www.qbitai.com/wp-content/uploads/2026/09/飞书20260902-135110.mp4

水の入ったボトルを持っているとき、誰かに腕を突かれたら、水をこぼさず瞬時に対応できますか?

ロボットは左手に水の入ったコップを持っています。人間が(無礼にも)棒で押してくると、反対側によけ、その後、何事もなかったかのように元の位置へ戻ります。コップの水は一滴もこぼれていません。

水の入ったボトルを持っているとき、誰かに腕を突かれ、しかも隣にある空き缶まで倒されそうになったら、水をこぼさず、空き缶も倒さずに瞬時に対応できますか?

今度は人間が右側から、テーブル上の3本の空き缶を押します。するとロボットは、右手で空き缶を同時に支えたのです。

その姿は、まるで太極拳の達人です。相手の衝撃を巧みに受け流して無力化する「化勁」を見せる一方で、力加減も正確に見極め、絶妙な強さで動かしています。

さらによく見ると、空き缶が押された時点では、ロボットはまだ左腕に持った水を完全には安定させていません。それにもかかわらず、右手で空き缶を支えています。

この場面は、ロボットどころか、すでに多くの人間を超えているかもしれません。皆さんも、両手でこの2つの作業を同時にできるか試してみてください。(doge)

主流のVLAやWAMモデルには、遮蔽、接触、変形など、物理的推論が必要なタスクに直面すると、簡単に破綻してしまうという問題があります。なぜなら、動作の外形を模倣しているだけで、その背後にある物理法則を理解していないからです。

一方、「人間になろう」モデルは、ロボットに「物理的な脳」を搭載したように見えます。軌道予測と長期的な状態を統合しているからこそ、軌道が自然に力学的な実行可能性を満たすのです。

動作の反応速度と滑らかさを見る限り、ロボットの動きは、データを丸暗記して「当てている」のではなく、人間のように物理法則を理解したうえで「学習した」ものに見えます。

両者の違いは、いわば「見よう見まねで形だけまねる」か、「なぜそうなるのかまで理解している」かの違いです。

動画2:空間と物体の属性の理解、そして人間の習慣の把握

2本目の動画では、ヒューマノイドロボットが正式に家事を引き継ぎます。しかも「人間になろう」モデルのチームによれば、これはロボットがzero-shotでタスクを遂行したときの映像だそうです。(本当なら、この汎化性能はあまりにも強力です!)

チームによれば、モデルのzero-shot成功率はすでに80%に達しているとのことです。

私はこの動画を「強迫症ロボット、リビングを散らかしたくない」(doge)と名付けました。

ロボットはまず、手に持っていた小さなぬいぐるみを玄関の収納台に戻します。まさに「元あった場所に戻す」というわけです。続いて、雑多な物でいっぱいの収納バスケットを自分のそばまで引き寄せ、少しかがみます。そこから黒い帽子と紫色のフラフープを順に取り出し、衣帽ラックにしっかり掛けました。

最後に、バスケットから大きな花柄の座布団を取り出します。もちろん、ロボットは腰をかがめることもできます。しかし今回は、手に取るとそのまま放り投げ、座布団をソファの上に落としました。

一連の動作は、決しててきぱきしているとは言えません。それでも、すべてを掌握しているような雰囲気があります。

ロボットの空間や物体の属性に対する理解は、すでに非常に人間らしいものです。滑らかな床では物体を引きずれること、輪になった帽子やフラフープは掛けられること、平らな座布団は自然に広がることを理解しています。

さらには「手を抜く」ことさえあります。直接投げられるなら、わざわざ腰をかがめることはしません。(まさに、怠け者が科学を発展させ、怠けるロボットが知能を進化させる、ということですね。)

主流モデルは、まだ人間のような汎化能力には到達していません。VLAは「力ずくで奇跡を起こす」かのように計算で押し切るため、未知の状況に遭遇すると簡単に崩れます。WAMは積み木のように動作をつなぎ合わせるため、学習が過度に型にはまり、少し応用を利かせただけで機能しなくなります。

「人間になろう」モデルを搭載したロボットは、非常に安定しているように見えます。空間や物体の属性に対する理解と、人間の習慣に対する理解を一体化し、長期にわたるタスクを見事に完遂しました。

動画3:シーツを伸ばし、振り、置く。ロボットがチームで作業開始

子どもの頃、洗濯したばかりのシーツを振るように、年長者からよく言われたものです。

この動画には、異なる機種のロボットが2台登場します。伝えられるところによれば、両者の訓練はすべて人間の動画を見せることで行われたそうです。そのため、再び「1つの脳、多様な身体」による異なるロボット同士の協調作業が実現し、本当にチームを組んで作業を始めました。

乾燥機から出したばかりと思われるシーツの一方の端は、背の高いロボットが2つの角をつかみ、もう一方の端は、背の低いロボットが2つの角を持っています。

背の低いロボットが一歩踏み出し、さらに腰をかがめると、シーツがぴんと張られます。続いて、背の高いロボットが両手でシーツを軽く数回振りました。

動画のロボットたちの姿勢はまだ少しぎこちないものの、その行動ロジックはあまりにも人間らしいではありませんか!洗濯したばかりの服を、しわにならないように何度か振るのと何が違うのでしょう?

主流モデルには、致命的な欠点があります。それは、人間のように本当の意味で自己進化できないことです。VLAは小さな修正を加えることしかできず、「思考回路」そのものを変えられません。WAMは作業があまりにも型どおりで、環境が変わると適応できません。

しかし、MVPモデルは違います。物理世界に対する理解と、人間の行動ロジックに対する理解を統合しているように見えます。

動画4:エネルギー駆動、最小エネルギーとなる行動解

ロボットが考えることを覚え、一度にすべての物を運んで片付けたほうが、何度も往復するより楽だと理解したら、どのように行動するでしょうか?

動画の中で、このロボットは人間のように物を片付けます。物がどれだけ多くても、できるだけ2往復目をしないようにするのです。

まず、バスケットから黒いマフラーを1本取り出し、店員のように首に掛けます。続いて紫色の輪を持ち上げ、前腕に通します。さらに手を上げて輪を肘の位置まで滑らせ、自分自身を歩く衣類ラックへと変身させました。

次はスリッパとイヤホンです。ひととおりの作業を終える頃には、ロボットの体には物がいっぱい掛かっています。それでも平然と向きを変えて立ち去り、軽やかな後ろ姿を残しました。

1分間の動画の中で、ロボットは4つの物を片付けました。長期タスクを処理する能力を十分に示しただけでなく、それぞれの物を理解し、各物体に対して自分の能力に適した対応を組み立てています。

現在の主流モデルに同じタスクを実行させた場合、おそらく物を1つずつ運ぶでしょう。モデルの本質は依然として統計的フィッティングに基づく推測であり、人間のような世界に対する理解も、自律的な意図も欠いているからです。

もし動画のロボットがその様子を見ていたら、心の中ではこう思っていたかもしれません。「いやいや、せっかく来たのに、なんでそれだけしか持っていかないの? もっと持っていったほうが楽じゃない?」

「人間になろう」モデルを搭載したロボットは、意思決定を行う際、次に何をすべきかをわざわざ「考える」必要がないように見えます。水が低いところへ流れるように、エネルギーが下がる方向へ自然に滑っていくだけです。

この「下り坂」の過程で、思考、探索、行動が一気通貫で行われます。

これこそが、世界を本当に理解し、自律的な意図を備えた知能なのかもしれません。

まとめ

この4つのDemoを見て、なぜモデルが「人間になろう」と名付けられたのか、ようやく理解できました。ロボットの一挙手一投足は、確かに人間の意思決定プロセスにあまりにもよく似ています。長期タスク、外乱のある環境、そして互いの協調作業において、物理世界、人間の行動ロジック、自分自身の能力を継続的に学習し、進化させているのです。

ロボットは人間のように空間や物体の属性を理解し、家事を行う際の思考ロジックや操作の習慣も人間に近いものとなっています。さらに、人間のように自ら動機付けを行い、自律的に学習し、継続的に自己進化することさえできます。

それだけではありません。ロボットは次のような特質も示しています。

  • 動作の一貫性:ロボットはまるで「成熟した人間」のようです。ロジックに一貫性があり、動作は滑らかで、物理法則を理解し、優れた手眼協調能力も備えています。
  • 思考の持続性:ロボットは「途中で投げ出す」ことがなく、しかも「使うほど安定する」ように見えます。長い時系列のタスクが、ひとつひとつ連続してつながっています。
  • さらには個性まである:「人間になろう」大規模モデルを搭載したロボットは、まるで個体ごとに独自の「仕事の流儀」を持っているかのようです。すでに性格まで備えているようにさえ見えます。

ほかにも特徴は数え切れません。しかし今、私は本当に信じ始めています。具身知能が人間のために役立つようになる時は、確実に近づいているのだと。

知能は、本当にすでに創発しているのかもしれません。ただ、それが起きている場所を、私たちがまだ見ていないだけなのです。

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/09/483552.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →