跳转到内容
主站 新闻 控制台

宇树智元共享同一大脑:神秘模型 Demo 惊艳亮相,10 分钟一镜到底

· 量子位
国内AI

现在的具身智能公司,往往把 Demo 拍得像广告一样精良、夸张。但一条未经剪辑的真实视频,你看过吗?

前几天,有业内朋友给我发来一条 10 分钟的 Demo:全程一镜到底,无剪辑、无场外遥控、无人工指令,甚至显得有些粗糙。但视频呈现的内容,却让我直接瘫坐在椅子上,心情久久不能平静(doge)。

视频中,机器人会把手臂伸出窗外擦玻璃;够不到高处时,知道搬来箱子踩在上面;长程任务中途被打断后,还能精准恢复……

更令人震撼的是,视频中同时出现了宇树和智元的机器人本体。这两款硬件架构、运动自由度、传感系统完全不同的“竞品”,竟然共用一个“大脑”,彼此配合、密切协作。这是全球范围内罕见的跨本体通用大脑样本。

毫不夸张地说,这可能是一条足以改写全球具身智能行业认知、颠覆赛道技术判断的 Demo,甚至可能改变 Scaling Law……

这到底是哪里来的“神仙团队”?

视频逐帧拆解,全是名场面

这条视频的信息量实在太大了。我认真逐帧拆解后,越看越上头。

  • 密闭空间作业,稳得离谱

拍摄场地是一间约 15 平方米的出租屋,家具密集、过道狭窄,甚至连转身都很困难。在这样的环境中,基本不可能进行遥操作——因为现场没有足够的空间容纳操作人员——也很难预设完整脚本。

从环境设计来看,这段视频几乎是在直接告诉大家:这只能是一条机器人完全自主学习、自主进化、自主决策的视频。

两个机器人在同一空间内并行做家务,实时感知环境边界并规划路径。

全程无碰撞、无迷路、无停滞,完美适配陌生且复杂的真实环境。即使是被牵引绳拴住的“战损版”机器人,也展现出了极强的灵活性。

整段视频没有切镜、没有重拍,也没有人工指令介入。

  • 伸手出窗擦玻璃,动力学能力与自主推理的巅峰具象化

从第一个任务开始,机器人就展现出了细腻且超出人类想象的一面。

一台宇树机器人使用刮水器擦玻璃。用过刮水器的人都知道,力气太小擦不干净,力气太大又会产生异响。相比用抹布擦玻璃,这更考验力度控制和空间感知能力。机器人一上来,就主动给自己增加了任务难度。

只见它擦了几下,发现有一处没有擦干净,竟然自行判断:污渍可能在窗外。

于是,它做出了一套我从未见过的动作:侧身、后仰、探头、展臂,将拿着刮水器的手伸出了窗外。(稳如老狗)

对于一些现有具身模型来说,做好力控已经是极限。但这台机器人在精确力矩控制的基础上,还天衣无缝地融合了对空间环境的感知——伸手时并没有撞到窗框——以及动力学计算能力。

它不仅将单项能力做到了行业顶尖,还展现出了三者统一融合的表现。

更让我久久无法平静的是,在发现无法从室内擦干净后,它立即完成推理和决策,将手伸出窗外擦玻璃。这是我第一次看到模型像人一样完成自我推理与自主决策。

这充分体现出模型能够将视觉、触觉、动力学等信息融合为统一感知,并具备自我进化能力。这一次,我终于相信机器人真的能干活了,而且未来可能比人干得更好。

  • 长时序任务闭环,拒绝误差累积

擦完玻璃后,宇树机器人平稳地将刮水器放回原位,落点精准,动作连贯。

别小看这个收尾动作。这意味着它完成了“取工具—作业—收纳”的全流程闭环。

身旁的智元机器人走近洗衣机,拿出洗干净的坐垫,放到沙发后面;随后又返回,继续拿出洗干净的玩偶,并精准地放进二层衣柜。每件物品都回到了应该在的位置。

智元机器人不小心撞到了玻璃,这反而更说明整个过程是自主决策的。毕竟,摄像头有时无法解决玻璃反光问题;如果是人工遥操作,通常可以提前规避(doge)。

这两幕是整段 10 分钟视频中最基础的能力缩影。在长时序任务中,每个任务都完成得流畅、精准且一步到位,并没有因为任务变多、变长而不断累积误差,出现越做越差的情况。

这解决了传统 VLA 模型最害怕的长序列任务问题。

单从动作表现来看,这套模型很可能采用了全新的架构。在 10 分钟的超长任务链中,它能够持续纠错、稳定输出,让每个动作都做到精准可控,鲁棒性堪称行业顶尖。

  • 任务可随时打断,模型能够断点续做

接下来,画面中出现了一声闹钟铃声。(放大声音仔细听,声音并不明显。)

一开始我没有理解闹钟的作用。反复观看后才发现,这似乎是某种预设提醒,会中断两台机器人当前的任务,让它们开始执行收纳桌面和冰箱的特别任务。

奇妙的是,完成桌面和冰箱的收纳后,机器人又继续执行被打断前的任务。这表明模型具备随时打断、断点续做和任务恢复的能力。

相比市面上一次 Demo 只能完成一项任务、还需要小心呵护,这条看似粗糙的视频展现出的是:机器人在真实作业环境中不仅能够持续工作,甚至还能“一心二用”。

接下来是一整套居家收纳流程:宇树机器人拿取收纳袋并放到桌面上;智元机器人看到冰箱上的食物后,判断其应当冷藏储存,随即执行收纳,并顺便拿出了需要解冻的食物。(我猜,这个神秘团队可能是在暗示:机器人快要能做四菜一汤了。)

全程没有分步指令,机器人自主拆解任务、规划动作,一步步完成从取物到归置的完整流程。

如今,绝大多数机器人只能执行单任务串行流程,中途一旦遇到干扰,任务基本就会崩盘。而这套模型似乎拥有类似人类的任务优先级判断和动态调度能力,可以随时切换任务流。这种灵活性和稳定性所展现出的智能,远超目前已知的多数模型。

  • 智元给宇树戴围巾,跨本体协作名场面

随后,整条视频的高潮出现了。

两个机器人仿佛商量好了一样,决定一次性整理好桌面上的杂物,避免来回搬运。

于是,宇树机器人不断将物体放到自己身上,直到双手都被占满,不知道该如何继续操作。这时,智元机器人温柔地走近,拿起桌上的一条围巾,缓缓挂在宇树机器人的脖子上。

智元机器人发现围巾很长,于是用双手托起围巾。宇树仿佛也理解了它的意图,主动弯下腰,智元则将围巾绕过宇树的头部,挂在了对方脖子上。

不是吧,哥们?!这丝滑的动作,以及彼此之间的眼神交互,怎么还有一股 CP 感!

这并不是提前设定好的分工,而是模型在两个不同本体之间自主探索出的协作方案。两个不同品牌的机器人能够自主判断各自的能力边界,并实现完美互补。这已经无限趋近于人类协作,甚至在没有语言交流的情况下,显得更加默契。

这可能是世界上第一次跨本体交互,也可能是世界上第一次出现能够通用不同本体的模型。

我猜,这个神秘团队是想通过两个互为竞品的机器人本体告诉大家:这才是真正的通用大脑。

  • 搭毛巾、拎拖鞋,难道机器人不仅会干活,还已经开始“偷懒”了?

挂着一身物品的宇树机器人缓缓走向远处后,智元机器人继续收纳剩余物品。

这时,它拿起一条毛巾,试图把毛巾挂在自己身上。尝试了一次、两次、三次后,终于将毛巾挂到了肩头。

震惊三连!

机器人似乎知道怎样做最省力:把毛巾搭在肩膀上,比拿在手里更省劲。

模型能够自主学习,在一两次尝试失败后不断优化,直到成功。

模型对自身本体的理解,可能正是其能够跨本体应用的核心原因。

这并不是孤例。

仔细看,机器人整理拖鞋时,拎的是新拖鞋的挂绳,而不是鞋体本身,因为拎绳子更省力。

又一次震惊!在其他机器人还在为干活精心设计动作时,这个模型不仅把活干完了,甚至直接学会了“偷懒”。这真是太聪明了。

  • 又一次高潮:机器人学会使用工具,试图用箱子垫高自己

事情还没有结束。接下来最让我震惊的一幕出现了。

在将挂满全身的物品一一归位时,如何把围巾放到第三层柜子,难住了身高只有 1.3 米的宇树 G1 机器人。

神奇的一幕出现了!它没有卡住,也没有放弃,而是像人一样进行推理,自己找来一个箱子。没错,它找了一个箱子,试图站在箱子上垫高自己,再完成收纳。

只见它找到旁边的箱子,并将箱子推到地上。它试图弯腰搬起箱子,却发现自己无法弯下腰。

尝试了几次后,就在我以为它总该放弃时,它竟然一脚把箱子踢到了柜子旁边。

整个过程体现了:

**自我推理和决策能力。**机器人知道如何让自己够到高处的物体,也知道在无法弯腰的情况下如何移动箱子。

**对身体能力的持续探索。**在一次次弯腰尝试的过程中,机器人似乎越来越了解自己的身体边界,并做出了与身体能力相匹配的选择。

**自我进化过程。**机器人在没有任何教学的情况下,竟然学会了用脚踢箱子,善于利用自己的身体与环境进行交互,并在过程中不断调整策略。

这一幕,真的让我后背发凉。

要知道,自主使用工具可是人类的标志性能力之一。

而视频中的机器人似乎真的学会了使用工具:它知道箱子可以承重,知道站上去能够增加高度,甚至知道在弯不下腰时可以用脚将箱子踢到目标位置。

这套动作背后,是对物理世界规则的深度理解、对自身能力的持续探索,以及自主决策和策略进化的结合。

  • 跨本体能力互补、协同作业,从个体走向群体

宇树一脚将箱子踢了过去,但箱子踢歪了。就在它思考如何将箱子摆正时,身高 1.7 米的智元远征 A3 走了过来。

它似乎看出了宇树的执着与困境,放下手中的小拉车,主动切换任务,选择帮助同伴。

只见宇树像接受毕业授勋一样弯腰低头,智元则缓缓取下围巾,将它放到架子上。

细节中的每一步,都体现出这套模型区别于其他模型的能力。

两个机器人对自身以及彼此硬件能力的理解和配合,已经跨越了个体智能,走向群体智能。

智元将围巾绕过宇树的脑后,轻巧地取下围巾,展示出对力度控制和空间感知能力的极致理解。(此处可以脑补其他机器人会如何拽下这条围巾。)

机器人将围巾折成三折,这是它对如何更好地将围巾放进衣柜所做出的自主判断。这才是真正的具身“智能”。

最后,智元帮助完宇树后默默离开,将最后一件衣服稳稳地放进洗衣机。(我猜,它判断出搭在洗衣机上的应该是脏衣服。)至此,这段 10 分钟的一镜到底视频终于结束了。

虽然我不知道这套模型的具体架构,但我相信,大家和我一样已经看得目瞪口呆。

第一次跨本体协作、第一次看到机器人的自主进化、第一次看到机器人类人化地自主决策并选择最优路径,以及极致的空间感知与力控、任务随时打断、学会使用工具……

这套模型的每一个动作、每一帧画面都足以成为一个很好的 Demo。但它们就这样静静地出现在这段 10 分钟的一镜到底视频中,而且呈现方式简单直接。

仿佛一切都轻松随意、信手拈来,展现出一种王者般的从容。

底层技术跳出主流模型固有框架

为什么视频中的机器人能够贡献这么多名场面?

我从知情人士处了解到,最重要的原因是,这套模型跳出了当前主流具身模型的固有框架。

现阶段,主流具身模型大致可以分为 VLA、WAM 和传统世界模型三类,它们都存在暂时难以突破的瓶颈。

△图片由 AI 生成

具体来说,VLA 是“数据直觉派”,依托海量视觉、语言和动作数据进行端到端拟合。但其本质是“看图猜动作”,缺乏物理推理能力;在长序列任务中会持续累积误差,陌生场景下的泛化能力近乎为零,并且高度绑定特定本体。

WAM 和传统世界模型则属于“预判空想派”,试图先建模世界规律,再规划动作,但存在致命的“知行割裂”问题。模型能够理解场景、预判状态,但面对需要物理动力学推理的实际操作,依旧只能依赖训练数据进行推演,无法适应真实环境中的动态变化。

这些主流具身模型存在一个共同的底层缺陷:数据驱动的任务拟合。

也就是说,所有动作都基于海量数据进行“概率猜测”,而不是建立在对物理规则的深度理解之上。这导致模型的能力上限被训练数据牢牢锁定。

据说,视频中的模型只使用了几十个小时的视频数据进行训练。如此少的数据量就能达到这样惊人的效果,Scaling Law 还存不存在?确实要打一个问号了。

从细节来看,视频中的模型至少展现出了现阶段 VLA 和世界模型难以企及的四项能力:

  • 动力学建模:运动轨迹满足动力学可行性,能够计算补偿力矩和前馈项,具备出色的外推与泛化能力;

  • 自我认知能力:不像 VLA 依赖条件反射,也不像 WAM 依赖时序统计,而是能够像人一样思考“下一步最接近目标的动作是什么”;

  • 自适应能力:能够补足因果推理,解决长尾问题,并在执行任务的过程中持续调整和进化;

  • 自我进化能力:在完成任务的过程中,技能不断增长,策略持续进化,仿佛能够自主产生学习目标,并主动推理以实现目标。

支撑这一切的,是三个底层技术内核。

**物理约束动力学学习。**区别于 VLA、WAM 纯数据驱动的训练模式,其核心是将物理规则前置,以动力学预测驱动行为。拎拖鞋挂绳、肩搭毛巾、踩箱子登高,都不是数据直接教会的,而是模型与环境交互后自主探索出的最优解。

**跨本体统一建模。**通过统一的动作表示空间与本体自适应机制,让同一套模型适配不同品牌、不同架构的硬件平台。这相当于为具身智能完成了“软硬件解耦”,终结硬件绑定算法的时代。

**长时序鲁棒闭环。**依托全局任务调度框架,自主处理全程突发干扰、动作误差和任务切换,避免传统模型在长流程中因误差累积而崩盘,具备在真实家庭和复杂场景中落地的核心能力。

如果你了解具身模型的现状,看完以上内容后,估计也会惊掉下巴。

当其他团队的 Demo 还在堆砌短时长、精修和单任务时,这个神秘视频已经完成了 10 分钟无修剪、跨品牌、多协同、全流程、自进化的真实场景落地。

当其他模型还在“靠数据猜动作”时,这套模型仿佛已经实现了完全的自我决策、自我学习和自我进化。它让大家看到,机器人不仅真的可以干活,而且能力还在快速自我进化,给人留下了无限想象空间。

更重要的是,这个模型仿佛让我们看到:大家热烈讨论的那个需要三年、五年,甚至十年才会到来的未来——机器人真正能够替代人类完成工作的那一天——今天就出现在了我们面前。

一个目前尚不知名的团队,仿佛颠覆了所有技术路径,颠覆了 Scaling Law,做出了真正的具身“智能”,逼近具身智能的 ChatGPT 时刻。

目前还不知道这套神秘模型出自谁家,但我相信,此刻大家的疑问都和我一样:到底是谁?