跳转到内容
主站 新闻 控制台

神秘具身团队接连发布重磅 Demo:自进化模型技术路线曝光

· 量子位
国内AI

还记得上周具身智能圈流传的那个神秘的、长达10分钟的一镜到底视频吗?

视频一出,网友们纷纷表示:不敢相信,仿佛天外来物……

甚至给出了最高评价:这是 AI 生成的吧?!

同行们纷纷打听到底是哪家公司做的,听说还有头部公司专门开会研究……我们的后台也被各路网友问爆了。

看完这段10分钟的一镜到底视频,大家纷纷表示,具身智能的 ChatGPT 时刻可能真的来了。有人说,这是具身智能的重要里程碑;也有人说,这是一次架构创新。因为它让人看到了:

  • 机器人具备了一定的认知能力,而不只是概率预测;
  • 机器人能够理解人类的行为逻辑,而非简单过拟合;
  • 机器人拥有持续自进化的能力,并展现出许多令人惊叹的瞬间。

当然,由于机器人的表现太过“科幻”,也有一些人表示质疑:这是不是遥操作?(虽然团队表示,在这么小的空间里,确实不知道该如何进行遥操作。)

而这个神秘团队回应质疑的方式也很特别:他们又接连发布了几个 Demo,依旧粗糙,依旧一镜到底,仿佛想说:

“智能,不管你信或不信,它真的要来了。”

因为上一篇文章,我们得以联系到这个神秘的模型团队,并表达了疑问:为什么不直接出来认领?

对方给出的回应是:模型也像人一样,让它自己说。

我们了解到,这个神秘模型的内部代号为“MVP”,意思是模型能力像真人一样(Make Veritable People)。团队表示,也可以将其直译为“做个人吧”(doge)。

“做个人吧”大模型。

而这次释出的几个 Demo,从表现来看,机器人“真的做了个人”:它像人类一样思考、自主决策,动作流畅,逻辑自洽。而且据团队透露,他们马上就要让机器人自己上街,在开放环境中直接展示给大家看。

视频1:手眼协调不分离,高超的动力学理解

http://www.qbitai.com/wp-content/uploads/2026/09/飞书20260902-135110.mp4

如果你端着一瓶水,有人戳你的胳膊,你能否瞬间反应,让水不洒?

机器人左手拿着一个装满水的杯子。在人类(无礼的)木棍推搡下,它躲向另一侧,随后又平稳地归位,杯中的水一滴未洒。

如果你端着一瓶水,有人戳你的胳膊,同时又推倒了你身旁的易拉罐,你能否瞬间反应,既让水不洒,又保证易拉罐不倒?

人类又从右侧推向桌上的三个易拉罐,机器人的右手居然同时扶住了易拉罐。

机器人的表现就像一位太极宗师:既会“化劲”,将对手的撞击化解于无形,也懂得把握分寸,将力道拿捏得恰到好处。

而且仔细观察可以发现,易拉罐被推动时,机器人左臂端着水的动作还没有恢复,它又用右手扶住了易拉罐。

这一幕,别说机器人,其实已经超越许多人了。大家可以试试看,能否用两只手同时完成这两个任务。(doge)

主流的 VLA 和 WAM 模型有一个问题:一旦面对遮挡、接触、形变等需要物理推理的任务场景,就容易失效。因为它们只是在模仿动作的外在形式,并不理解背后的物理规律。

而“做个人吧”模型看起来为机器人装上了一个“物理大脑”。正是动力学预测与长期状态的统一,才能让轨迹天然满足动力学可行性。

从动作反应速度和流畅程度来看,机器人的动作不再是靠死记硬背数据“猜”出来的,而是像人一样,依靠对物理规则的理解“学”出来的。

两者的区别,大概就是“照葫芦画瓢”和“知其所以然”。

视频2:对空间和物体属性的理解,以及对人类习惯的总结

第二个视频中,人形机器人正式接管家务。而且,“做个人吧”模型团队表示,这是机器人以 zero-shot 方式完成任务时的视频。(如果是真的,那这种泛化性也太强了!)

他们表示,模型的 zero-shot 成功率已经达到80%。

我把这段视频命名为“强迫症机器人之客厅不能乱”(doge)。

只见机器人先把手里的小玩偶放回玄关置物台,主打一个“从哪儿来,回哪儿去”。接着,它又把装满杂物的收纳篮拖到身边,微微下蹲,从中先后取出黑色帽子和紫色健身环,将它们稳稳挂到衣帽架上。

最后,它从篮子里拿出一只硕大的花朵坐垫。显然,它是可以弯腰的,但这一次,它选择随手一扔,坐垫落到了沙发上。

整个过程下来,机器人的动作虽然不算麻利,但颇有一种尽在掌控之中的感觉。

机器人对空间和物体属性的理解已经非常像人:它知道物体在光滑地面上可以拖拽,环状的帽子和健身环可以悬挂,平整的坐垫会自行展开。

它甚至还会“偷懒”:能直接扔,就绝不再费劲弯腰。(真是懒人驱动科学发展,懒机器人驱动智能进化啊。)

主流模型暂时还达不到像人一样的泛化能力。VLA 靠“大力出奇迹”硬算,一遇到陌生场景就容易崩盘;WAM 则像拼积木一样拼接动作,学得过于死板,稍微变通一下就不灵了。

装载“做个人吧”模型的机器人看起来则非常稳定,将对空间和物体属性的理解与对人类习惯的总结融为一体,顺利完成了一个长程任务。

视频3:拉平床单、抖床单、放床单,机器人组队干活了

小时候,长辈经常会喊我们把刚洗好的床单抖一抖。

这个视频中出现了两台不同型号的机器人。据悉,它们的训练全部通过观看人类视频完成,因此再次上演了“一脑多形”的跨本体协作,并且真的组队干起了活。

只见一条似乎刚从烘干机中取出的床单,一端的两个角被一台身材较高的机器人拽着,另一端的两个角则被另一台身材较矮的机器人牵着。

较矮的机器人跨出一步,再弯下腰,床单便被扯得平整。紧接着,身材较高的机器人用双手轻轻抖动了几下床单。

虽然视频中的机器人姿势仍然有些呆板,但它们的行为逻辑也太像人了!这和我们把刚洗好的衣服甩两下、以免出现褶皱有什么区别?

要知道,主流模型有一个致命缺陷:它们不像人类,无法真正实现自进化。VLA 只能小修小补,无法改变“脑回路”;WAM 干活太过死板,换个环境就适应不了。

而 MVP 模型不同,它看起来将对物理世界的理解和对人类行为逻辑的理解统一了起来。

视频4:能量驱动,最优能量的行为解

当机器人学会思考,懂得一次性把所有东西拿走归置,比来回一趟趟整理更省力时,它会怎么做?

视频中,这台机器人收纳物品的操作仿佛人类一般:东西再多,也尽量不跑第二趟。

它先从篮子里抽出一条黑色围巾,像店小二一样往脖子上一搭。接着,它又拎起紫色圆环,将其绕在小臂上,还知道抬手让圆环滑落到肘关节处,成功把自己改造成一只行走的衣架。

然后是拖鞋、耳机。一番操作下来,机器人身上已经挂满了物品,却依旧淡定地转身离开,留下一个轻盈的背影。

在1分钟的视频里,机器人收纳了4件物品,不仅充分展现了处理长程任务的能力,还展现出对每件物品的理解,并能够为每件物品建立与自身能力相匹配的映射。

要知道,如今的主流模型执行同样的任务,大概率会一件一件地单独搬运,因为模型本质上仍然是基于统计拟合的猜测,缺乏像人类一样对世界的理解,也没有自主意图。

如果视频中的机器人看到这一幕,它心里的 OS 可能是:不是吧,哥们,来都来了,怎么就带这么点东西走啊?多带点不是更省劲吗?

“做个人吧”模型的机器人在做决策时,好像不需要刻意去“想”下一步该做什么,只需要像水往低处流一样,顺着能量下降的方向自然滑动。

在这个“下坡”的过程中,思考、探索和行动一气呵成。

可能这才是真正理解世界、并具备自主意图的智能。

总结

看完这4个 Demo,我终于理解了模型为什么叫“做个人吧”。机器人的一举一动,确实都太像一个人的决策过程:在长程任务、干扰环境和彼此协作中,表现出对物理世界、人类行为逻辑以及自身能力的持续学习和进化。

机器人能够像人一样理解空间和物体属性,做家务时的思维逻辑和操作习惯与人类相近,还能如同人类一般自我驱动、自主学习并持续自进化。

不仅如此,机器人还体现出了以下特质:

  • 动作一致性:机器人就像“成熟的人类”——逻辑自洽、动作流畅、懂物理,且具备良好的手眼协调能力。
  • 思考持续性:机器人不会“半途而废”,而且“越用越稳”,长时序任务环环相扣。
  • 甚至还有个性:装载“做个人吧”大模型的机器人,仿佛每个个体都有自己独特的“做事风格”,好像已经拥有了性格。

其他特点,不一而足。但我现在真的开始相信,具身智能真正能够为人类所用的时刻,已经越来越近了。

智能,可能真的已经涌现,只是发生在我们尚未看到的地方。