シリコンバレーで今最も注目を集める具身モデル!追加学習なしで、一度見るだけで習得
具身知能は「GPTの瞬間」へと近づきつつあります。
具身知能における大きなブレークスルーが、いよいよ到来しそうです!!!
先週、Generalist が 3〜12 秒の動作を学習できる具身大脳 Gen 1.5 を発表したばかりですが、つい先ほど、北米の具身知能スタートアップ Skild AI が新たなロボット基盤モデル S1 を発表しました。これにより、ロボットがコンテキストから学習できるタスクの長さは、一気に 10 分超まで引き伸ばされました。
今回、S1 が掲げるのはコンテキスト内学習(in-context learning、ICL)です。
追加学習の段階で新たな操作データを専用に学習させる必要はありません。人間による実演動画を一度見るだけで、「見よう見まね」で、これまで見たことのない複雑な一連の操作をそのまま完遂できます。
公式デモでは、ロボットがパンケーキ作り、コーヒーの抽出、植物の植え替え、機器の組み立てなど、長時間にわたるタスクを実行しました。さらに、未知のタスクにおける成功率は 66% に達し、言語プロンプトをベースとする VLA の 9% を大きく上回りました。
また、従来の追加学習によるファインチューニングのアプローチで、S1 が実演を一度見るだけで達成した性能に追いつこうとすると、約 380 回のタスク実演を入力する必要があります。
非常に驚くべき結果です!
最近、コンテキスト内学習に焦点を当てた研究が相次いで発表されており、具身知能に対する期待を改めて呼び起こしています。
X のユーザーからは、汎用ロボットは 7 年後ではなく、2 年後には登場するかもしれないという声も上がっています。

また、Rhoda、先週の Generalist、そして今回の Skild S1 が示した 10 分間のタスクへと続く流れを見て、ロボットの「GPTの瞬間」が近づいているようだという声もあります。

この能力が本当に汎化すれば、将来的にロボットのスキル開発は、ChatGPT 用のプロンプトを書くのと同じようなものになるかもしれません。

本当にそこまで画期的なのでしょうか。詳しく見ていきましょう。
BERT時代からGPT時代へ
S1 が今回、どのようにコンテキストから学習しているのかを理解するには、まず従来のロボットが新しいスキルをどのように学習してきたのかを見ておく必要があります。
従来のパイプラインにおけるロボットの学習プロセスは、実のところ大規模モデルとよく似ています。
まず大量のデータで事前学習を行い、基礎的な能力を身につけます。その後、具体的な環境に入り、特定のタスクのデータを収集し、追加学習によってロボットに専用スキルを習得させます。

ただし、ロボットと大規模モデルはプロセスこそ似ているものの、データコストはまったく異なります。
大規模モデルの事前学習データの多くはインターネットから取得できます。プログラミングや Agent などの専門的な領域であっても、追加学習用のデータの多くはオンラインで迅速に入手でき、場合によっては自動生成も可能です。
しかし、ロボットの場合はそう簡単ではありません。事前学習データも現実世界で収集する必要があり、追加学習用のデータも同じく現実世界で収集しなければならないからです。
そのため、Skild AI は技術ブログで次のように直接問いかけています。
ロボット基盤モデルが新しいタスクを一つ学習するたびに、数十時間、数百時間に及ぶ実機データを必要とし、そのたびに再び追加学習を行わなければならないのだとしたら、いったいその「基盤モデル」の基盤性はどこにあるのでしょうか。
さらに、既存研究を引用し、新しいタスクのデータがすでに十分に揃っているのであれば、ゼロから学習したモデルでさえ、事前学習後にファインチューニングした基盤モデルに追いつく可能性があると指摘しています。
では、具身モデルの事前学習にはどのような意味があるのでしょうか。
これに対する Skild の答えが、コンテキスト内学習です。
Skild は、ひとつの基準として大規模モデルの発展過程を比較対象にしています。
初期の BERT はすでに非常に高性能でしたが、新しいタスクに遭遇するたびに、データを改めて用意し、再度ファインチューニングを行う必要がありました。
ゲームのルールを本当に変えたのは、GPT-3 以降に徐々に明らかになったコンテキスト内学習能力です。
モデルの重みを変更することなく、プロンプトにいくつかの例を提示するだけで、モデルは一時的に新しいタスクを「学習」できるようになりました。

これを踏まえ、Skild は、現在のロボットはいまだ BERT に似た時代にとどまっていると考えています。彼らが本当に目指しているのは、ロボットにも同じパラダイムシフトを実現させることです。
つまり、事前学習の本当の価値は、追加学習で収集するデータを減らすことだけではありません。最終的には、ロボットが「コンテキストから直接学習する」能力を獲得することにあります。
コンテキスト内学習
では、S1 は今回、コンテキストから何を学習したのでしょうか。
Skild によれば、ロボットのコンテキスト内学習能力を検証するには、主に 2 つの観点があります。
1 つ目は、学習時にまったく見たことのない新しいスキルを習得できるかどうか。2 つ目は、既存のスキルを再構成し、非常に長く複雑な新しいタスクを完遂できるかどうかです。
たとえば、ロボットはパンケーキをひっくり返す動画を見るだけで、パンケーキの作り方を学習できます。しかも、そのスキルが事前に学習データへ一度も登場していなくても構いません。
また、先週 Gen-1.5 が示した秒単位の動画と比べ、S1 は今回、コンテキスト内学習の時間を最長 10 分まで一気に延長しました。
植物の植え替えなどのタスクでは、各タスクを連続して完了するために数十の操作ステップが必要です。こうした長時間タスクの実演において、ロボットは単に見よう見まねで動くだけでは不十分です。次のことを理解しなければなりません。
今どのステップまで進んでいるのか、次に何をすべきか、スキル同士をどのように組み合わせるか、途中で失敗した場合にどう続行するか。
つまりロボットには、動画の実演に含まれるタスクと動作の意図を本当に理解し、状況に応じて臨機応変に対応することが求められます。単なる行動クローニングではありません。
さらに植物の植え替えタスクでは、実演の録画開始からロボットが自ら作業を始めるまでにかかった時間はわずか 11 分でした。効率の面でも、従来の追加学習を直接上回っています。
そして一連のプロセスを通じて、S1 は fine-tuning も post-training も使用していません。モデルの重みは完全に固定されたままで、同じ重みだけを用いて、ブログで紹介されたすべてのタスクを完遂しました。
これは、大規模モデルが、特定の環境ごとにファインチューニングを必要とした BERT から、実演を見るだけで OOD タスクを完遂できる GPT-3 へと飛躍した流れと、ほぼ一致しています。
唯一の違いは、使用するプロンプトが言語ではなく、下流タスクとの整合性をより高められる動作動画になっている点です。

実験:ICL はよりスケーラブルなのか?
実験ではまず、Skild は学習データに登場したタスクと、登場していないタスクを対象に、ICL の動画プロンプトと従来の言語プロンプト VLA の性能を比較しました。

テスト結果によると、学習データが 1,000 時間しかない場合は言語プロンプトのほうが優れていました。しかし、データ規模が増えるにつれて、ICL が逆転し始めました。
データ規模が 10 万時間に達すると、学習時に見たことのあるタスクでは、ICL の成功率が 96%、言語プロンプトが 89% となりました。
そして本当に重要な OOD タスクでは、ICL の成功率が 66% に達したのに対し、言語プロンプトはわずか 9% にとどまり、7 倍以上の差が開きました。
S1 の汎化性能を検証するため、Skild はさらに異なる実験条件でテストを行いました。

その結果、言語プロンプト VLA の性能低下幅は、ICL の最大 3 倍に達しました。
つまり、ICL が学習したのは固定された環境における動作の再生ではなく、現在の環境に応じて行動を改めて計画する能力なのです。
最後に、one-shot learning について見ると、S1 は新しいタスクに対して post-training を一切行わず、動画による実演を 1 本見るだけで、成功率 66% を達成しました。

一方、従来の VLA では、同等の水準に到達するために、およそ 380 回の実演を用いた追加学習が必要でした。
もちろん、実演を 2,000 回まで増やせば、従来の post-training でも最終的に 86% に到達できます。
したがって、結論は「これからはロボットを訓練する必要がなくなる」ということではないのかもしれません。むしろ、次のように言えるでしょう。
以前は新しいスキルを数百回教える必要があったのに対し、今では一度見せるだけで、すぐに 60〜70 点程度の成果を出せるようになった。
これが、Skild の言う ICL scaling law です。
データが増えるほど、モデルは単に多くのスキルを学習するだけでなく、「実演からスキルを学ぶ」こと自体にますます長けていきます。
Skild AI とは?
Skild は 2023 年に設立され、CMU のロボット研究分野で知られる 2 人の研究者、Deepak Pathak と Abhinav Gupta が率いています。

2 人はいずれもカーネギーメロン大学ロボティクス研究所の教授です。Deepak は主にロボット学習、強化学習、コンピュータビジョンを研究しており、Abhinav はコンピュータビジョンと自己教師あり学習の専門家です。
2 人は 2022 年という早い時期から、ロボットが人間の動画を見て one-shot imitation を行う WHIRL を共同で発表していました。つまり、S1 のアプローチは突然現れたものではありません。

北米の具身知能分野で注目を集める企業として、Skild は 2024 年にステルスモードを脱すると、3 億ドルのシリーズ A を調達し、評価額は 15 億ドルに達しました。
今年 1 月には、さらに 14 億ドルのシリーズ C を完了し、評価額は一気に 140 億ドルを超えました。このラウンドは SoftBank が主導し、NVIDIA や Bezos らも引き続き参加しています。2 年あまりで、企業評価額は約 10 倍に膨らみました。
同じ北米の具身知能分野で比較してみても、Skild の立ち位置は非常に特徴的です。
一方、PI は「ロボット版 GPT」の構築に近く、Generalist は最近 one-shot learner を強調しています。Genesis AI や Sunday はフルスタックでの発展を見せています。これに対し、Skild が一貫して強調してきたのが、「Any robot, any task, one brain」という言葉です。
Skild は embodiment をまたいだ汎化をより重視しており、同じ Skild Brain をロボットアーム、四足歩行ロボット、人型ロボットなど、異なる身体に搭載して動作させることを目指しています。
平たく言えば、ロボット時代の Android になろうとしているのです。ひとつの知能レイヤーを、さまざまな身体に搭載するという構想です。
これが、Skild のデータ戦略にもつながっています。つまり、すべてを活用するということです。
Skild はロボットデータを、hardware proximity、diversity、scalability という 3 つの軸で整理しています。
実機の遠隔操作データはハードウェアとの距離が最も近い一方で、コストが高くなります。人間の一人称視点動画は最もスケールさせやすいものの、ロボットの身体とは大きく異なります。シミュレーションは低コストで大量のデータを生成できますが、sim-to-real gap という課題が残ります。

そのため、Robot Teleop、UMI、Egocentric Video、Simulation について、Skild は基本的にすべてを活用する戦略を取っています。
そして S1 の ICL も、実はこの方針を自然に発展させたものです。

2025 年 9 月には LocoFormer を発表し、2026 年 2 月には初の In-Domain ICL を実現。5 月にはパンケーキをひっくり返す動作を初めて披露し、8 月には S1 を発表して、コンテキスト内学習を最長 10 分に及ぶ OOD の長時間タスクへと一気に押し広げました。
したがって今、本当に注目すべき問いは、ロボットがさらに多くのスキルを学習できるかどうかではなく、次の点なのかもしれません。
ロボットが新しいスキルを学ぶコストを、本当に「何百回も教える」ことから、「あなたが一度やり、ロボットが一度見る」ことへと変えられるのか。
この scaling law が今後も成立し続けるなら、いわゆるロボットの GPT moment は、単なる新たなマーケティング上のキャッチフレーズではないのかもしれません。
参考リンク: