ロボットは3秒のデモを見るだけで学習できる
夢瑶 凹非寺発
助けて、いや本当に……ロボット界のGPT-3モーメントが、ついに来たのかもしれない!?
GPT-3がかつて見せた、いくつかの例を見るだけで新しいタスクを学習できる能力が、今度はロボット上で実現されようとしている――
たとえ一度も学習したことのない作業でも、3~12秒の動作デモを見せるだけで、次の瞬間にはもう実行できてしまう!

しかも、応用まで利く。
まずロボットにブラシで物を掃く動作を教え、次にブラシをバナナへ持ち替えさせてみる。するとなんと、バナナを手に取ってそのまま掃き続けるではないか――

まだ物足りない? では、ちり取りも追加してみよう~
すると今度は、完全な動作を教えていないにもかかわらず、自分で片方の手で掃き、もう片方の手で受けるという両手の連携まで考え出した。すごすぎる:

これが、Generalist AIが先日発表したロボット基盤モデル、GEN-1.5だ。
One-shot Learningを主軸とするロボットモデルであり、大規模な物理データによる事前学習を通じて、ロボットは数秒間のデモを見るだけで新しいタスクを素早く習得できる。
さらにこのモデルは、異なる2つの指導デモを組み合わせて学習することもできる。シミュレーターで一度見せれば、今度は現実世界に移っても、そのまま実行できる。
しかも、学習プロセス全体を勾配更新ゼロ、ファインチューニングゼロで実現できるという。
さらに、こうした能力は誰かが手取り足取り教えたものではなく、大規模なPhysical Dataの事前学習の中で、モデル自身が「悟った」ものなのだ……

これにはさすがに、モデルが発表されるや否や、ネット上では6年前の記憶がよみがえった:
ロボット界のGPT-3モーメントが、本当に到来したのかもしれない。

物理版Prompt Engineeringの登場:ロボットは3秒のデモを見るだけで学習できる!
覚えている人も多いのではないだろうか。
GPT-3が当時、人々を本当に驚かせた能力の一つが、In-Context Learningだった。
モデルに1つ、あるいはいくつかの例を与えると、再学習することなく、文脈を見るだけで新しいタスクのやり方を一時的に理解してしまう。
今回Generalistが実現したのは、これをそのまま「物理世界」へ持ち込むことだった――
GEN-1.5は、チームが8か月以上にわたって継続的に事前学習を行い、開発した次世代ロボット基盤モデルだ。
基盤となる仕組みは従来と同じで、現実世界における物理的なインタラクションデータを大量に吸収し続けている。ただ今回は、非常に重要な新しい能力が現れた:
たった今起きた動作も、Contextに入れられる!



下の「カップのふた重ね」を例に見てみよう。
人間が3~12秒の動作を実演する。この間、勾配更新は行われず、ファインチューニングも一切ない。GEN-1.5はこのPhysical Promptを見終えると、すぐに自分で作業を始められる。
まさに、こちらが実演し終わった次の瞬間には、小さなロボットが「はい、任せてください。見ていてくださいね~」と言わんばかりに動き出す。
ざっくり計算してみたところ、スキルの学習開始からタスク完了まで、かかった時間はおそらく「30秒」ほど???

さらに、GEN-1.5の最も驚くべき点は、その世界観において、**異なるデモによる指導さえも「組み合わせて使える」**ことだ……
たとえば、まずAの動作を見せ、次にBの動作を見せる。するとモデルは、2つのスキルを自分でつなぎ合わせ、1つの連続したタスクにできる。
その間にある、誰も実演していないつなぎの動作も、自ら解決しなければならない。
再配置、持ち方の調整、姿勢の切り替え、さらには途中で失敗した場合にどう続けるかまで、モデルが自分で補完できる可能性がある:

しかも、「先生」が必ずしも人間である必要すらない。
仮想世界のデモも、このモデルは問題なく受け入れられる……(この子、本当に好き嫌いがない.jpg)
スクリプトで生成された戦略に基づく動作、強化学習エージェントが行ったデモ、人間がシミュレーター上でロボットを遠隔操作して完了させた作業――これらはすべて、Physical Promptとしてモデルのコンテキストに入れられる。
次の例は非常に分かりやすい。GEN-1.5はまず左側のシミュレーター内にある仮想デモを見て、その後、右側の現実世界で1∶1に再現する。
さらに重要なのは、このタスクがそれまでシミュレーター上で専門的に学習されたものでも、現実世界で練習されたものでもないという点だ。
今回の一件はまさに――オンラインで学んだ技術を、現場で即実践したということだ。

どうだろう。かなり実感が湧いてきたのではないだろうか。
同じように感じた人もいると思うが、GEN-1.5は、私たちが現在大規模モデルを使っている方法に本当によく似ている。
たとえば今日、Claudeに新しい記事フォーマットを学習させたいと思ったとしても、通常はClaudeを再学習させたりはしない。例をそのままContextに入れて、モデル自身に理解させる。
ただGEN-1.5の場合、そのタスク遂行のロジックが、テキストの続きを生成するところから、ロボットアームの操作にまで拡張されたわけだ。(doge)
Generalistはこの能力を、**「物理版Prompt Engineering」**と生き生きと表現している――
つまり、Promptが一言のテキストから、現実世界における一連の動作へと変わったのだ。
ファスナーの開け閉め、カップのふたの重ね方、財布から物を取り出す方法を実演すれば、そうした動作がそのままロボットのContextに入り、現在のタスクを理解するための「プロンプト」になる~

もちろん、数秒で学習できるとはいえ、現時点ではまだ「百発百中」にはほど遠い。
Generalistは10種類のタスクでテストを行った:
Physical Promptを1回だけ与え、勾配更新を一度も行わなかった場合、GEN-1.5の平均成功率は59%だった。一方、各タスクについてさらに5分間のデータを与え、10ステップの勾配更新を行うと、成功率は83%まで向上した。
また現段階でのテストタスクは、その多くが短時間で完了する、比較的原子的な操作にとどまっている。
チーム自身も、In-Context方式で一時的に学習したスキルは、現時点では本格的なFine-tune後のモデルほど安定していないと述べている。
しかし、研究コミュニティを本当に興奮させているのは、まさにこの点だ――
59%という数字自体はそれほど驚異的ではない。一度も訓練していないのに59%を達成できることこそ、驚くべきなのだ!!!

One-shotを専門的に教えた人はいない。この能力は自ら「芽生えた」
ここまで来ても、GEN-1.5というモデルの驚くべき点はまだ終わらない。
さらにGPT-3らしさを感じさせるポイントがある――
Generalistによれば、GEN-1.5にOne-shot Learningの方法を専門的に教えたわけでは、そもそもまったくない!
In-Context Learning専用のモデルアーキテクチャを用意したわけでもなく、Meta Learningのループを特別に設計したわけでもない。即興的に対応する能力を身につけさせるため、追加の目的関数を設けたわけでもない。
では、こうした能力がどのように生まれたのかというと、実は大規模なPhysical Dataの事前学習の中で自然に現れたものなのだ……(なんてこった.jpg)

GEN-1.5の事前学習を行っていた当初、Generalistはまず、新しいタスクに必要なデータがどんどん少なくなっていることに気づいた。
数百ステップのファインチューニングが、やがて数十ステップになり、数十ステップが10ステップになった。
そして最後には、わずか1分間のデータと、1回の勾配Stepだけで、ロボットが新しいことを学習し始めた。
そこでチームは、さらに大胆な問いを投げかけた。「では、0ステップならどうだろう?」すると、本当に動作してしまった……

これで、多くの人が最初にGPT-3を思い浮かべた理由も分かる。
当時の大規模言語モデルでも、似たような転換点が起きていたからだ――
モデル規模と事前学習の量をひたすら積み上げていくと、Few-shotやIn-Context Learningといった能力が、ある時突然、はっきりと現れ始めた。
Generalistから見ると、ロボットデータにも同じような法則が存在する可能性がある。そしてその鍵は、GEN-1.5が長期にわたって吸収してきた、連続的な現実世界の物理データの中に埋め込まれている。
現実世界の動作は、そもそも単独で発生することがほとんどないからだ。
1本目のネジを締め終えれば、たいていは2本目がある。1つの物体を整理し終えれば、次に別の物体があることが多い。つかむのに失敗すれば、人間は無意識にもう一度つかみ直し、そのまま動作を続ける。
言い換えれば、整理、組み立て、運搬といったデータには、繰り返し、継続、失敗からのリカバリーがもともと大量に含まれている。
モデルがこのような連続軌跡上で長期間にわたって事前学習を行うと、直前に起きた動作とその結果が、後続の動作にコンテキストを絶えず提供することになる。
そうしていくうちに、モデルは非常に重要なことを学ぶ機会を得る。つまり、まず直前に何が起きたのかを確認し、それから次にどう動くかを決めるということだ。
これはすでに、In-Context Learningの原型にかなり近い……

本当にそう思う。
もう少し視野を広げて考えてみよう。
もしGEN-1.5のこの路線が今後もScaleし続けられるなら、将来ロボットが出荷時に備えている最も重要なスキルは、たった4文字になるかもしれない:
見!て!学!べ!(doge)
参考リンク:
[1] https://generalistai.com/blog/gen-1.5#one-shot-in-context