在不少人的印象中,宇树科技的机器人能跑、能跳、能武术、能搏斗,但公众怀揣更高的期待:机器人能不能干活?
让机器人动手操作,离不开聪明的“大脑”。当宇树构建起机器人本体硬件和“小脑”运动控制算法的壁垒之后,这家明星公司开始发力补齐“大脑”这块拼图,频繁发布各类机器人模型。
9月10日,宇树开源一款具身基座模型,可驱动机器人完成60多项全身移动操作和桌面操作任务,比如收纳盘子、扔垃圾、将衣服塞进洗衣机等等。据公司介绍,该模型在多项具身推理评测中领先国内外开源模型,亦可比肩头部闭源模型。
从2025年9月首次发布自研具身智能模型以来,宇树迄今已推出多款UnifoLM系列具身模型。伴随公司上市,宇树还将投入近半的IPO募集资金,用于智能机器人模型研发。
宇树创始人王兴兴在近期一次采访中提到,无论是模型结构,还是数据采集方式、数据训练方式,今年都比前几年清晰了很多;业内对具身模型的关注度和资源投入,也比前几年大了很多。“(宇树)内部的AI模型团队和训练,基本上围绕去家里或工厂干活展开”。
社交平台上经常有用户不解,工厂内既然有了操作精准的机械臂,为何还要人形机器人?二者实际上区别明显,前者依靠预先编程写好指令,只能完成单一的任务;后者则试图像人类一样,可以自主完成不同任务,亦即具备泛化能力。
王兴兴在2026世界机器人大会上提到,机器人举一反三的泛化能力不够,成为当前具身智能的最大瓶颈。对于固定场景,如果做足够的数据采集,很多机器人模型的成功率可以达到100%。但是如果机器人接触的物品或者环境稍微变化,模型的成功率就会严重下降。
因此,泛化性能表现,是衡量一款具身智能模型好坏的重要指标。根据宇树的介绍,最新发布的这款UnifoLM-WLA-1.0模型,拥有60亿参数,通过约2500小时高质量真机数据训练,可以驱动完成10项全身操作与54项桌面操作任务,并同时适配二指夹爪与多种五指灵巧手,展现出跨任务、跨末端执行器的泛化能力。
官网上,宇树释出了上述64项任务操作的真机演示画面。大多数任务都与家居生活场景相关,覆盖整理鞋架、收拾厨房、整理餐具、洗衣服、整理床铺、从微波炉中取食物……机器人有了家庭管家的雏形。
从完成难度上看,这些任务既包括将书本夹起并放置到书架上的短任务,也包括扔垃圾这类多步骤长程任务——机器人走到茶几旁,用五指灵巧手抓住矿泉水瓶,弯腰俯身将其扔到垃圾袋。接着,机器人先是用右手拾起垃圾袋,再转移至左手提住。拎着垃圾袋,机器人走向一个脚踏式垃圾桶。它的右脚向前踩住踏板,待盖板弹起后,机器人的右手抵住盖板,左手将垃圾袋投入桶中。
具身模型能否支撑复杂度较高或流程较长的任务,关乎机器人在真实场景的落地。毕马威在7月发布的一份报告指出,当前机器人已能完成抓取、放置、开门等相对明确的短动作,但真实场景更多是连续、多步骤、强上下文依赖的长链路任务,例如整理桌面、清洁房间、仓库分拣和工厂装配。长任务要求模型持续记住物体位置、遮挡状态、任务进度和前序动作带来的后续影响。
真机演示画面激发机器人落地的市场想象力,UnifoLM-WLA-1.0模型是如何实现的?
该模型由两大模块组成:UnifoLM-ER-Flow多模态主干作为基础,主要负责理解世界,知道该做什么;与之搭配的MMDiT动作专家(Action Expert)模块,则将这些“理解”转化为机器人底层可执行的动作指令,让动作平滑地做出来。
据介绍,UnifoLM-ER-Flow这款多模态模型,将具身推理、未来动态区域预测与离散动作学习三项任务结合起来,不仅能看懂眼前的空间事物,还能预判接下来的交互动作会引发什么变化,并将机器人的物理动作“翻译”为可供模型理解和学习的“动作编码”。
三者协同的目的在于,为后续WLA模型训练提供统一的多模态表征基础,亦即让机器人看到的事物、接收到的指令、预测的未来变化以及“编码”后的动作,都能在一个共享的语义空间里对齐。
其中,在具身推理任务上,宇树给出的评测结果显示,负责具身推理的UnifoLM-ER-1模型,在16项多模态感知与理解评测中相较业内开源模型取得7项基准的领先,整体表现亦可比肩国外闭源大模型,在Where2Place、BLINK、EmbSpatial等多项评测基准中的得分超过OpenAI最新发布的GPT-6-Astra旗舰模型。
王兴兴此前称,公司在具身大模型上的整体研发能力与技术水平已位居全球行业领先梯队,后续宇树科技将进一步加强对具身大模型及相关配套数据采集与场景实训的研发投入。
王兴兴表示,机器人智能是公司非常重视的方向,他本人近些年投入精力最多的,也正是机器人AI模型的训练。对此,全球范围内普遍抱有忧虑,即便是当下的AI大厂和大型企业,也担心自己跟不上AI快速演进的节奏。“我们也会保持这种警惕”。
“我本人和我们团队要快速自我迭代、进步和学习。”王兴兴说,要提出自己的创新想法,去做实验,“多做几个实验,总有一些能成功,这样就能保持领先的水平”。
此前较长一段时间内,宇树仅仅被市场视为一家硬件公司,对具身模型的投入持谨慎态度。
王兴兴在2024年8月接受采访时曾坦言,机器人AI模型的技术路线仍不像大语言模型那么清晰,不能在技术路线模糊的时候乱投入。如果此时消耗巨大的财力和人力,“其实你有点使不上劲,拼命往里面跑,你也跑不了”。
但他同时强调,宇树虽然以卖本体硬件为主,但依然会继续关注和研发机器人AI模型。硬件为AI服务,一旦对机器人AI模型缺乏了解,很难做出好的人形机器人本体。
不过,从2025年9月开始,宇树逐渐扭转外界对其既有印象,通过连续发布多款模型,宣告战略重心从“本体+小脑”向“大脑+小脑+本体”转向,并同步布局WMA(World-Model-Action,世界动作模型)架构与VLA(视觉-语言-动作模型)架构两大技术路线。
今年以来,模型发布的节奏进一步提速——
2026年1月,宇树开源VLA模型UnifoLM-VLA-0,旨在突破传统VLM(视觉-语言模型)在物理交互中的局限,通过在机器人操作数据上的继续预训练,实现了从通用“图文理解”向具备物理常识的“具身大脑”的进化;
2026年2月,宇树自研的工业级具身大模型UnifoLM-X1-0,已在自有工厂中完成试点部署测试,可自主完成关节电机装配等任务;
5月,宇树发布的WVLA2.0具身大模型,融合了世界模型与视觉语言动作模型,核心优势是可长时序自主规划、支持多步物理预判、抗环境干扰和手眼操控精准;
7月,宇树推出具身大模型UnifoLM-OminiA-0.3,其核心优势为仅靠单模型就能统筹家居康养场景下的多类任务,支持全模态交互理解,全程自主运行;
9月7日,宇树宣布首次实现世界模型实时驱动全自主格斗,其背后依靠UnifoLM-X2-1.0模型。公司称,该模型突破世界-动作大模型瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互、实时实现对未来预测和规划。
东吴证券在今年8月一份研报中指出,宇树的核心壁垒在于强大的运控能力、量产、全栈自研自产的降本能力与生态的协同。若模型泛化、长程任务执行和真实场景闭环能力持续提升,公司有望由具身智能硬件龙头,进一步升级为覆盖核心零部件、整机、模型和开发生态的平台型企业。
文/研究员 杨柳
编辑:李玲