跳转到内容
主站 新闻 控制台

机器人的 GPT-3 时刻来了:看 3 秒就学会新动作,仿佛卡卡西上身

· 量子位
国内AI

机器人看 3 秒演示就能学会

梦瑶 发自 凹非寺

救啊我说……机器人界的GPT-3 时刻,好像真来了!?

GPT-3 当年看几个例子就能学会一项新任务的本事,现在直接在机器人身上上演了——

哪怕是从没学过的新活,只要给机器人看一段 3~12 秒的动作示范,下一秒它就能直接上手!

甚至,它还会举一反三。

你先教机器人拿刷子扫东西,转头把刷子换成一根香蕉,它居然顺手拿起香蕉继续扫——

还嫌不够?那咱们再给它塞个簸箕~

瞧,这回连完整动作都没教,它自己就琢磨出了一只手扫、一只手接的双手配合,神了:

这就是 Generalist AI 刚刚发布的机器人基础模型——GEN-1.5。

这是一个主打 One-shot Learning 的机器人模型。通过大规模物理数据预训练,它能让机器人只看几秒示范,就快速学会新任务。

此外,这个模型还能把两段不同的教学演示拼起来学习:在模拟器里看一遍,转头到了真实世界,也能直接上手。

整个训练过程甚至可以做到 0 梯度更新、0 微调。

甚至,这些能力根本没人手把手教过,而是在大规模 Physical Data 预训练过程中,模型自己“悟”出来的……

这下好了,模型刚一发布,网友直接梦回六年前:

机器人界的 GPT-3 时刻,可能真的来了。

物理版 Prompt Engineering 来了:机器人看 3 秒演示就能学会!

不知道大家还记不记得。

GPT-3 当年真正把人“看愣”的能力之一,就是 In-Context Learning。

给模型一个或几个例子,它不用重新训练,光看上下文,就能临时 get 到一个新任务要怎么做。

而 Generalist 这次做的事情,则是直接把这套玩法一脚踹进了“物理世界”——

GEN-1.5 是团队连续预训练 8 个多月打造的新一代机器人基础模型。

底子还是那套底子,继续大量吸收真实世界里的物理交互数据,但这回,一个很关键的新本事冒了出来:

刚刚发生过的动作,也可以进入 Context!

就拿下面这个“杯盖堆堆乐”来说。

人类先演示 3~12 秒,整个过程中没有梯度更新,也没有任何微调。GEN-1.5 看完这段 Physical Prompt,转头自己就能上手。

主打一个你前脚刚演示完,后脚小机器人就说:得嘞,您瞧好了哈~

甚至我粗略算了一下,从学习技能到完成任务,大概也就花费“半分钟”的时间???

而且,GEN-1.5 最神的一点还在于,在它的世界观里,不同的演示教学甚至还能“拼起来用”……

比如先给它看一段 A 动作,再看一段 B 动作,模型可以自己把两项技能串成一个连续任务。

中间那些没人演示过的衔接动作,它也得自己搞定。

重新定位、调整抓法、切换姿势,甚至中途出错后该如何继续,都可能由模型自己补出来:

甚至,给它当“老师”的都不一定是真人。

因为虚拟世界里的 Demo,这个模型也照吃不误……(孩子是真不挑.jpg)

脚本策略生成的动作、强化学习 Agent 做出的演示、人类在模拟器里遥控机器人完成的操作,都能被塞进它的上下文里,当成 Physical Prompt。

下面这个例子就很直观:GEN-1.5 先看左边模拟器里的虚拟演示,随后直接去右边的真实世界中 1∶1 复现。

更关键的是,这项任务它此前既没有在模拟器里专门训练过,也没有在真实世界里练过。

这波属实是——云学艺,线下直接上岗了。

怎么样,很有体感了是不是。

不知道大家有没有同样的感觉,GEN-1.5 真的很像现在我们使用大模型的方式。

今天我们想让 Claude 学一种新的文章格式,通常不会重新训练一个 Claude,而是直接把例子扔进 Context,让模型自己悟。

只不过到了 GEN-1.5 这里,完成任务的逻辑从文字接龙,一路卷到了机械臂。(doge)

Generalist 把这种能力生动地形容为**“物理版 Prompt Engineering”**——

也就是 Prompt 从一句话,变成了一段真实世界里的动作。

你先给它演示怎么拉拉链、怎么叠杯盖、怎么从钱包里拿东西,这些动作会直接进入机器人的 Context,成为它理解当前任务的“提示”~

当然,几秒学会这件事,目前还远谈不上“百发百中”。

Generalist 在 10 种任务上进行了测试:

只给一次 Physical Prompt、0 次梯度更新的情况下,GEN-1.5 的平均成功率为 59%;如果每个任务再提供 5 分钟数据,并进行 10 步梯度更新,成功率可以进一步提升到 83%。

而且,现阶段的测试任务大多还是短程、相对原子化的操作。

团队自己也提到,通过 In-Context 方式临时学到的技能,目前稳定性还赶不上真正 Fine-tune 之后的模型。

但真正让研究圈兴奋的点,恰恰在这里——

59% 没那么吓人,0 次训练却能做到 59%,才吓人好吧!!!

没人专门教它 One-shot,这项能力是自己“长”出来的

说到这里,关于 GEN-1.5 这款模型神奇精彩的地方还远没有结束。

因为更有 GPT-3 内味儿的一点来了——

据 Generalist 透露,他们压根没专门教 GEN-1.5 怎么进行 One-shot Learning!

没有为 In-Context Learning 特制模型架构,没有专门设计 Meta Learning 循环,也没有额外增加一个目标函数逼它学会即兴发挥。

至于这些能力是怎么来的,其实是在大规模 Physical Data 预训练过程中自己冒出来的……(老天爷.jpg)

当时在 GEN-1.5 预训练时,Generalist 最开始只是不断发现,新任务所需的数据越来越少。

几百步微调,后来变成几十步;几十步又变成 10 步。

最后甚至只用 1 分钟数据、1 个梯度 Step,机器人也开始能学会新东西。

于是团队顺手问了一个更疯狂的问题:那 0 步呢?结果真能跑……

这也解释了为什么很多人第一时间想到了 GPT-3。

因为当年的大语言模型,也出现过类似的转折——

模型规模和预训练一路往上堆,堆着堆着,Few-shot、In-Context Learning 这些能力突然变得足够明显。

在 Generalist 看来,机器人数据里也许存在类似规律,而关键就埋在 GEN-1.5 长期吸收的连续真实物理数据里。

因为真实世界里的动作,本来就很少是孤零零发生的。

拧完第一颗螺丝,往往还有第二颗;整理完一个物体,接下来通常还有另一个;一次抓取失败,人也会下意识重新抓住,再把动作继续完成。

换句话说,整理、装配、搬运这些数据里,天然就塞满了重复、延续和失败恢复。

当模型长期在这样的连续轨迹上预训练时,前面刚刚发生过的动作和结果,本身就会不断给后面的动作提供上下文。

久而久之,它也就有机会学会一件很关键的事:先看看刚才发生了什么,再决定下一步该怎么做。

这其实已经很接近 In-Context Learning 的雏形了……

我说真的。

咱们的思路再打开一点。

如果 GEN-1.5 这条路真能继续 Scale,那以后机器人出厂时最重要的技能,可能真就四个字:

看!着!学!啊!(doge)

参考链接:

[1] https://generalistai.com/blog/gen-1.5#one-shot-in-context

[2] https://x.com/GeneralistAI/status/2090161945307664621

[3] https://x.com/_joe_harris_/status/2090332664746352872