一点新鲜变化都没有吗?
衡宇 发自 凹非寺
WRC期间,整个展馆里的机器人展台上,最抓人眼球的当属各种新奇动作。
跳个舞、握个手,或者解锁一个没见过的复杂任务,够直观也够新奇,就足够让观众举起手机了。
可一旦把机器人真正落地到工厂、商场或普通家庭,现实问题就会回归到最实在的层面:真实场景更在乎的是,机器人下一次能不能做得更快、更稳,同时尽量减少人工介入和辅助。
正因如此,千寻智能在2026世界机器人大会上的做法显得有些特别。
他们没有急于推出更新鲜的演示场景,而是让Moz1把一个多月前在WAIC上展示过的“整理客厅”搬到WRC重映。
嗯……炒冷饭?

于是,我们在展馆里找了位千寻智能员工询问:真的是纯展示同一个Demo吗?一点新鲜变化都没有吗?
对方笑着说,你可别只看表面!虽然不到30天,但这套Demo已经有了很大进步:
- 可乐放入冰箱的自主推理成功率由约80%提升至99%以上;
- 碗放入洗碗机的成功率由约90%提升至99%以上;
- 导航目标确认耗时降低近50%。
此外,在颜色、种类、位置等条件发生变化的情况下,捡垃圾任务的执行成功率也高达85%。

这些变化都发生在“整理客厅”这套长程复合任务的不同环节中,而不是一次抓取或某个固定工位动作。
所以,同款Demo的两次亮相,其实是同一套具身系统的两张“进化快照”。
乍一看,做的还是老行当,但其实这里蕴藏着一座冰山——水面之上是任务完成度的提升;水面之下,则是数据、训练、Agent、导航、硬件和基础设施共同构成的全栈能力进步。
30天的快速进化究竟是如何发生的?
我们需要潜入水面之下。
30天,Demo出现可量化跃迁
要理解这30天的变化,离不开一个叫“时间密度”的词。
这是千寻智能首次在具身智能领域提出的学术概念。所谓“时间密度”,关注的是一套系统能在多短时间内吸收问题、完成训练和验证,并将改进重新部署到真机上。
它衡量的不是某次演示的峰值表现,而是系统进化的速度。

实际上,30天前千寻智能的成功率就已经不低了:在WAIC期间,可乐进冰箱的成功率接近80%,碗进洗碗机的成功率接近90%。
这是相当亮眼的成绩。如果只是为了完成一个展会Demo,这个水平已经足以支撑不错的现场效果。
但长程任务中的90%,和固定工位上的90%,难度完全不在一个水平线上。
单步任务失败一次,通常只是某个动作没有完成;而在长程任务中,一个小偏差就可能改变下一步所面对的状态,错误还会继续向后传递。
机器人完成“整理客厅”这一系列生活化动作时,所涉及的环节其实相当复杂。
它需要听懂模糊指令,先环视环境,判断哪些物品需要归位,并记住尚未完成的步骤。随后,它还要跨空间移动、抓取物品、开门、放置、关门,并在过程中不断确认自己是否做对。
而且在长程任务中,物体姿态变化、机器人站位偏移、背景干扰,甚至开门角度不足,都可能让后续动作失去节奏。
所以,Demo跑出高成功率只是故事的开场,并不能说明机器人在这个任务上已经万无一失。
我们把视线拉回WRC现场。
冰箱、洗碗机、捡垃圾、收纳玩偶四组任务,分别暴露出长程任务中的不同问题:连续操作能否稳定衔接,站位和物体状态发生变化后能否继续完成,以及环境变化后能否继续准确识别目标。

再多看几轮演示就会发现,展会现场其实在不断增加难度。
观众穿行、遮挡和物品位置变化,都会临时打乱路线。机器人还得继续避障、重新接近目标,再把导航与后续操作衔接起来。
肉眼可见,展会现场本来就很会制造麻烦。
但对具身机器人来说,这些麻烦恰好具有价值。
(偷着乐吧,所有的展商朋友们!)
此外,这种现场表现的稳定性,很难单靠某一个模型调参来实现。
只有当每一次失败都能被系统识别、回传、复现、训练和再次部署,形成数据闭环,才能支撑起30天内的快速迭代。
水面之下的全栈冰山:如何让一条长任务跑起来
拆解“整理客厅”的完整执行过程,其实就是在拆解千寻智能的全栈技术体系。
对于机器人来说,“整理客厅”这句指令必须被拆解成一连串问题:
房间里有什么?哪些东西需要整理?应该先做什么、后做什么?机器人应该走到哪里才能完成操作?如果中途失败,下一步应该怎么办?
用户发出“整理客厅”的目标后,感知系统先扫视全局,建立环境信息;Agent保存上下文、记住长期目标,并将大任务拆分为“先收可乐、再洗碗”等子任务;导航系统将机器人送到适合操作的位置;基座模型Spirit v1.6则根据语言、视觉和本体状态生成动作。
完成任务后,系统还要生成一份复盘报告,将数据回流,以便下次表现得更好。
可以看到,一次完整任务的背后,是感知、数据、模型、Agent、导航、本体和基础设施的共同协作。

△千寻智能技术架构
这条链路环环相扣,缺一不可,让机器人能够从每次任务中不断吸收经验。
首先来看作为系统进化“燃料”的数据管线。
想让机器人在30天后变得更好,首先需要解决一个问题:这一次为什么失败?下一次训练到底应该改什么?
例如,一次抓垃圾失败,并不意味着任务结束。真正重要的是,系统能否知道“为什么失败”:是没有识别到垃圾,还是抓取位置不对,抑或是动作规划出了问题。
答案藏在数据里。
千寻智能的数据平台汇集了Web视频、第一视角数据、uDAS数据、遥操作数据与真机任务数据,覆盖数据清洗、标注、质检、训练任务管理、模型评测和结果追踪等环节。
目前,千寻智能自研的数据采集设备已迭代至第7代,数据采集成本降至传统遥操作方式的1/10,数据可用性从30%提升至95%,并配合全国超过30万个采集点位,源源不断地输送“燃料”。

△千寻智能可穿戴数采设备同时在全国多地进行数据采集
但对于具身智能来说,真正有价值的数据,并不一定是最“干净”的数据。
这就不得不提到千寻智能独创的“脏数据”训练理念和数据金字塔体系。

△千寻智能数据金字塔
现实世界里,灯光会变化,物品不会永远摆在固定位置,人会突然经过,环境也会不断改变。
如果机器人训练时看到的永远是规整、标准的场景,那么面对真实世界时,反而容易受到无关信息干扰。
因此,千寻智能强调“脏数据”训练,将真实世界中的杂乱变化直接纳入模型泛化能力的一部分。
这还需要结合后训练过程一起来看。
后训练机制与底座模型,是决定机器人动作上限的基石。
后训练阶段要解决的核心问题,是让模型真正理解经验,知道“什么值得关注”。
机器人在完成整个任务的过程中,需要眼观四路、耳听八方。
以“把碗放进洗碗机”为例,这一任务背后至少包含10个连续阶段。
任务开始时,全局视觉帮助机器人迅速判断自己所在的位置以及洗碗机的位置;真正开始操作后,关注范围会不断缩小,此时更重要的是碗的位置、把手的位置和沥水架的位置。

通过后训练,团队让模型学会对无关变化(如墙面、灯光)保持稳定,对真正影响动作的变化(如碗的位置、站位)保持敏感。
数据和后训练最终需要落到模型能力上,而支撑这一切的底座是Spirit v1.6基座模型。
据千寻智能资料,该模型采用VLA与世界模型深度一体化的融合架构。
传统机器人往往采用“感知—规划—控制”的分步流程,就像先看地图、再想路线、最后踩油门,反应较慢,也容易出现衔接断档。
而Spirit v1.6将视觉感知、语言理解、动作生成与世界状态预测纳入统一训练,实现边感知、边决策、边调整,就像老司机开车,遇到突发状况时手脚能够下意识联动。
在由UC伯克利、斯坦福、英伟达联合发起的RoboArena国际评测中,该模型曾登顶全球第一,超越英伟达DreamZero等模型,是首个登顶该榜单的中国具身模型。

在Agent决策层,大脑需要防止机器人在长程任务中拥有“真·金鱼”一般的记忆。
具体来说,最怕的是机器人干着干着就呆在原地,忘了自己为什么站在这里。
例如,一次抓垃圾失败后,动作模块却给出了“停止信号”,规划器误以为本步骤已经完成,直接进入“放垃圾”任务——单步误判就这样沿着任务链向后传播。

为了阻断这种连锁错误,Agent就像一个拿着备忘录的工头,必须持续管理任务状态。
它不仅要保存“整理客厅”的总目标和已完成进度,还要根据现场状态决定下一步是继续、重试、跳过,还是重新规划。
比如抓垃圾失败后,是再试一次,还是换一个目标?有人挡住路线,是等待,还是绕开?
只有Agent时刻保持状态对齐,机器人才能避免中途“脑袋一片空白”。
WAIC现场的一次意外考验,让这位“包工头”显出了真章。
360集团的周鸿祎一行到展位互动时,客厅演示区被围得水泄不通,静态客厅瞬间变成高动态、多遮挡的环境。
Agent全程关注任务进度:导航受阻时判断应该等待还是绕行;有人靠近操作区时暂停,确认安全后再恢复;目标被遮挡时重新进行感知。
最终,机器人在人潮中完成了穿梭避障和连续操作,任务没有中断。
导航与操作的协同,则体现了“到达”标准的升级。
机器人停在洗碗机前,并不等于真正抵达。它必须站在能够由VLA完成开门、拉出沥水架和放碗操作的位置,才算完成这一环节的任务。
这里有一个典型的研发故事。
早期调试时,机器人其实已经能够顺利走到洗碗机前。
但有一次,它停的位置离冰箱太近。单看导航指标,它已经“到了”;但策略模型一接手,问题马上暴露出来——这个站位不利于打开洗碗机,只能额外进行大幅度位姿补偿。

于是,团队重新定义了什么叫“到达”。
机器人不能以到达某个坐标点为标准。它真正需要抵达的,是后续动作能够展开的位置,也就是“可操作位姿”。
站得对之外,还得反应得快。
另一条优化线则落在导航启动速度上。通过模型、算法和工程链路的协同调整,从接到任务到生成首个导航目标的耗时中位数降低了近50%。
以上这些还只是软件层面的问题,别忘了硬件与基础设施。
WAIC期间,团队遇到过伺服电机异常、电源故障和接口松动等问题。
前面运行了十几分钟,最后一个接口掉链子,整条任务立刻功亏一篑。在长程任务中遇到这种情况,毫不夸张地说,团队心里真的是“天塌了”。
因此,WAIC结束后,硬件团队改变了策略,将“哪里坏了修哪里”变成“设计质量前置”,尽量在图纸阶段拦截问题,并继续改进伺服和电源模块,将设计评审与装配核查固化到流程中。
与此同时,模型最终生成的动作,还得依靠Moz1这套26自由度、搭载自研一体化力控关节的本体真正执行;而新模型多久能够运行到真机上,又取决于设备管理、推理部署和日志回传等底层平台能力。
这些看不见的基础设施,进一步缩短了训练与真机之间的距离,让现场出现的bad case能够更快进入下一轮迭代。
成功率达到100%之后,继续“找茬”的意义是什么?
凭借既有模型能力,千寻智能在WRC全新场景中直接实现了零样本迁移。冰箱操作、娃娃收纳、碗和可乐抓取、洗碗机等多项核心任务,在实地测试中的成功率达到100%,展现出较强的跨场景泛化能力。
但成功率达到100%之后,团队反而开始主动“找茬”,比如挪动起始位置、改变物体姿态、替换背景等。
因为他们发现,单一场景下的100%并不代表稳定边界已经足够大。
真机调试中暴露出的细节,更能说明长程任务的复杂性。
一次垃圾抓取失败后,动作却给出了停止信号,规划器误以为本步骤已完成,直接进入放垃圾任务——单步误判会沿着长任务继续传播。
所以,长程任务不能只看动作有没有结束,还得不断确认“这一步到底做没做成”。否则,一个小误判就会一路滚到后面。
展会现场的网络状况同样会带来不少麻烦。
现场缺少稳定的有线网络,云端推理还会出现不可预测的长尾延迟。

为此,团队进行了针对性优化:删减冗余判断逻辑,将一部分视觉判定任务改为并行执行,同时尽可能让推理计算与机器人的其他动作在时间上重叠,以缓解网络延迟带来的影响。
展馆一旦涌入大量观众,原本相对静态的场景就会变成高动态、多遮挡的空间。行人经过会让目标短暂消失,规划好的路线也可能临时失效;导航既要持续避障、重新接近目标,还要与Agent、VLA保持任务状态对齐。
从这个角度看,展会现场反而成为一个现成的压力测试场,恰恰能够从侧面证明全栈能力的扎实程度。
同时,展会现场的极端压力测试,也是工业场景稳定落地的预演。虽然两者环境不同,但都在检验机器人离开实验室后,能否长时间、稳定地运行。
千寻智能的这套系统能力,已经开始从展会Demo向真实工业等场景外溢——
Moz1已经进入宁德时代动力电池PACK产线,承担高压测试插头插接等非标工序,作业成功率稳定在99%以上,单日工作量可达到熟练工人的3倍;同时,还与京东、博世、舍弗勒等企业展开场景合作。
另一款Moz2则在尝试将同构基座模型下的能力迁移至商超、酒旅、办公楼宇等公共服务场景,并在WRC现场首次展示了自然语音交互功能,支持招手、比心、握手等拟人化互动。

这时候回过头看,就能理解为什么千寻智能选择在两个大会上把同一个Demo再做一遍了。
具身智能前一阶段最容易被看到的是“能不能做”,而当越来越多机器人开始把这些动作做出来,下一阶段需要回答的问题已经不一样了。
同样一件事,它能不能连续做;环境变了还能不能做;中途失败后,系统知不知道自己错在哪里;这次出现的问题,能不能进入下一轮训练,让下一版少犯一次。
归根结底,具身智能的终局从来不是造出一台无所不能的机器人,而是跑通一套能够自我生长的技术系统。
而上文提到的“时间密度”,最终衡量的也不只是某段时间里任务成功率提升了几个百分点。
它其实是在评估一套技术体系处理真实失败的速度:谁能更快将问题吸收,再把改进送回机器人身上,谁的能力边界就会扩展得更快。
这正在成为观察具身企业长期势能的重要标尺。