跳转到内容
主站 新闻 控制台

硅谷热门具身模型:无需后训练,看一遍就学会

· 量子位
国内AI

硅谷今日最热具身模型!无需后训练,看一遍就学会

具身智能正迈向“GPT时刻”。

具身智能的大突破,要来了!!!

自上周 Generalist 发布能够学习 3 至 12 秒动作的具身大脑 Gen 1.5 以来,刚刚,北美具身智能初创公司 Skild AI 又发布了全新机器人基础模型 S1,直接将机器人上下文学习的任务时长拉到了 10 分钟以上。

这次,S1 主打上下文学习(in-context learning,ICL):

无需在后训练阶段专门学习新的操作数据,只需观看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。

在官方演示中,机器人完成了煎饼制作、咖啡冲泡、植物换盆以及设备组装等长程任务,并且在未见过的任务上将成功率提升至 66%,远超基于语言提示的 VLA(仅为 9%)。

另外,即便采用传统的后训练微调路线,想要追平 S1 只看一次演示所达到的效果,大约也需要输入 380 次任务演示。

非常惊艳!

可以说,最近这一波集中于上下文学习的工作,又让不少人重新燃起了对具身智能的希望。

有推特网友表示,通用机器人可能两年后就会出现,而不是七年后。

还有网友表示,从 Rhoda,到上周的 Generalist,再到如今 Skild S1 所展示的 10 分钟任务,机器人的“GPT 时刻”似乎正在到来。

因为一旦这种能力真正实现泛化,未来开发机器人技能,可能真的会变得像给 ChatGPT 编写 Prompt 一样。

真有这么神吗?我们一起来看。

从 BERT 时代迈向 GPT 时代

想要理解 S1 这次究竟是如何进行上下文学习的,得先看看传统机器人是如何学习新技能的。

在传统的 pipeline 中,机器人的学习过程其实和大模型差不多:

先在海量数据上进行预训练,学会一些基础能力;然后进入具体场景,针对某个任务收集数据,通过后训练让机器人掌握专有技能。

只不过,机器人和大模型虽然流程相似,但数据成本却完全不是一回事。

大模型的预训练数据大量来自互联网;即便到了编程、Agent 等专门场景,许多后训练数据也可以在线上快速获得,甚至自动生成。

但机器人就比较困难了:预训练数据得在现实世界中采集,后训练数据同样得在现实世界中采集。

所以,在技术博客中,Skild AI 直接提出:

如果一个机器人基础模型每学习一个新任务,仍然需要几十、几百小时的真机数据,再重新进行后训练,那我请问,这个“基础模型”的基础体现在哪里?

他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。

所以,具身预训练的意义到底是什么?

对此,Skild 给出的答案是:上下文学习。

为了提供一个参考坐标,Skild 将大模型的发展路线作为对照。

早期的 BERT 已经很强了,但每遇到一个新任务,往往仍然需要重新准备数据,再进行一轮微调。

真正改变游戏规则的,是 GPT-3 之后逐渐显现出的上下文学习能力:

无需修改模型权重,只要在 Prompt 中提供几个示例,模型就能临时“学会”一个新任务。

基于此,Skild 认为,机器人目前其实还困在类似 BERT 的时代。他们真正想做的,是让机器人也完成同样的范式转换。

也就是说,预训练真正的价值,不应该只是让后训练少采集一些数据,而是让机器人最终获得“从上下文中直接学习”的能力。

上下文学习

那么,S1 这次究竟从上下文中学到了什么?

Skild 认为,真正能够检验机器人上下文学习能力的,其实有两个维度:

一是能否学会训练时根本没有见过的新技能;二是能否将已有技能重新组合起来,完成一个很长、很复杂的新任务。

比如,机器人只需观看一段翻煎饼的视频,就能学会如何制作煎饼——即便这项技能此前从未出现在它的训练数据中。

与此同时,相较于上周 Gen-1.5 展示的秒级视频,S1 这次直接将上下文学习的时长拉到了最长 10 分钟。

在植物换盆等任务中,每个任务都需要连续完成几十个操作步骤。在这些长程任务的演示中,机器人不仅需要做到照猫画虎,还需要知道:

我现在进行到了哪一步,下一步该做什么,技能之间如何组合,以及中途出错后该如何继续。

也就是说,机器人需要真正理解视频演示中任务与动作的意图,见招拆招、随机应变,而不仅仅是进行行为克隆。

此外,在植物换盆任务中,从开始录制演示到机器人自己上手,只用了 11 分钟,直接在效率上将传统后训练比了下去。

最后,在整个过程中,S1 没有使用 fine-tuning,也没有进行 post-training;模型权重完全不变,仅凭同一套权重,就完成了博客中展示的所有任务。

这基本对齐了大模型从 BERT 需要针对特定场景进行微调,到 GPT-3 只看演示就能完成 OOD 任务的跨越。

唯一的不同是,所使用的 Prompt 不再是语言,而是采用了能够更好对齐下游任务的动作视频。

实验:ICL 是否更具扩展性?

在实验部分,Skild 首先在训练数据中出现过的任务和未出现过的任务上,对比了 ICL 视频 Prompt 与传统语言 Prompt VLA 的表现。

测试结果表明,当训练数据只有 1000 小时时,语言 Prompt 的效果更好;但随着数据规模增加,ICL 开始反超。

当数据规模达到 10 万小时时,在训练时见过的任务上,ICL 的成功率为 96%,语言 Prompt 为 89%。

而在真正关键的 OOD 任务上,ICL 的成功率为 66%,语言 Prompt 仅为 9%,直接拉开了 7 倍以上的差距。

为了验证 S1 的泛化性,Skild 又在不同实验条件下进行了测试。

结果表明,语言 Prompt VLA 的性能下降幅度最高达到 ICL 的 3 倍。

也就是说,ICL 学到的并不是固定场景中的动作复读,而是能够根据当前环境重新规划行动方式。

最后,在 one-shot learning 方面,S1 在新任务上完全不进行 post-training,只观看一条视频演示,成功率就达到了 66%。

相比之下,传统 VLA 大约需要经过 380 次演示的后训练,才能达到同等水平。

当然,继续增加到 2000 次演示后,传统 post-training 最终可以达到 86%。

所以,结论可能并不是“以后机器人不用训练了”,而是:

以前一个新技能可能需要教几百遍,现在先看一遍,就能直接做到六七十分。

这也是 Skild 所谓的 ICL scaling law:

数据越多,模型学会的不只是更多技能,而是越来越擅长“从演示中学习技能”。

Skild AI 是谁?

Skild 成立于 2023 年,背后站着两位 CMU 机器人领域的老熟人:Deepak Pathak 和 Abhinav Gupta。

两人都是卡内基梅隆大学机器人研究所的教授。Deepak 主要研究机器人学习、强化学习和计算机视觉;Abhinav 则是计算机视觉、自监督学习领域的专家。

早在 2022 年,两人就曾合作推出 WHIRL,让机器人通过观看人类视频进行 one-shot imitation。可以说,S1 的这条路线并不是突然出现的。

作为北美具身智能领域的明星企业,2024 年,Skild 刚走出隐身模式,就拿下 3 亿美元 A 轮融资,估值达到 15 亿美元。

到了今年 1 月,公司又完成 14 亿美元 C 轮融资,估值直接达到 140 亿美元以上。该轮融资由 SoftBank 领投,英伟达、贝索斯等继续参与。两年多时间里,公司估值接近翻了 10 倍。

横向对比来看,Skild 在北美具身智能领域的定位也相当特殊。

相比之下,PI 更像是在打造“机器人 GPT”;Generalist 最近强调 one-shot learner;Genesis AI、Sunday 则展现出全栈发展势头。Skild 一直强调的一句话是:Any robot, any task, one brain。

它更强调跨 embodiment,希望同一个 Skild Brain 能够运行在机械臂、四足机器人、人形机器人等不同身体上。

通俗一点说,就是想成为机器人时代的安卓:将一个智能层装进各种不同的身体里。

这也决定了 Skild 的数据策略:全都要。

Skild 将机器人数据归纳为 hardware proximity、diversity 和 scalability 三个维度:

真机遥操作与硬件最接近,但成本高;第一视角人类视频最容易规模化,但与机器人身体相距较远;仿真成本低、可以大量生成数据,却又存在 sim-to-real gap。

所以,对于 Robot Teleop、UMI、Egocentric Video、Simulation,Skild 基本采取了全部使用的策略。

而 S1 的 ICL,其实也是这条路线的自然延伸:

2025 年 9 月,LocoFormer 发布;2026 年 2 月,首次实现 In-Domain ICL;5 月,首次展示翻煎饼;8 月,S1 发布,直接将上下文学习推向最长 10 分钟的 OOD 长程任务。

所以,现在真正值得关注的问题,可能已经不是机器人还能不能学会更多技能,而是:

机器人学习一个新技能的成本,能不能真的从“教几百遍”变成“你做一遍,它看一遍”。

如果这个 scaling law 还能继续成立,那么所谓机器人的 GPT moment,可能真的不只是又一个营销梗了。

参考链接:

[1] https://www.skild.ai/blogs/s1