具身热潮中隐身三年,小米人形机器人为何重返聚光灯下?

南都N视频APP · AI前哨站
原创2026-08-19 22:56

8月19日,小米的新款人形机器人现身2026世界机器人大会,这是其时隔三年再次线下展出机器人。

南都记者了解到,新款人形机器人沿用了“铁大”的命名,身高从2022年第一代的1.76米左右微调至1.70米,更贴近汽车工厂一线工人的身高。整机重量66公斤,全身拥有66个自由度(独立运动的关节数量),其中约半数自由度位于机器人的手部。

图片

小米的新款人形机器人。图:小米

小米人形机器人上一次线下公开露面,还要追溯到2023年的世界机器人大会。此后,尽管具身智能热潮持续激涌,小米作为赛道上的早期入局者反而处于隐身状态。

“从雷总(雷军)到集团,一直有一个比较重要的提问:这个东西到底有什么用?”小米机器人事业部总经理向迪昀告诉南都记者,由于难以回答这一问题,2023年之后,公司主动暂停了人形机器人相关的对外宣发。

他透露,即使小米人形机器人在2024年的跑步速度能达到每小时十三四公里,2025年机器人半程马拉松也有望拿冠军,“但从雷总的角度来讲,这不产生实际有意义的用户价值”。不过,小米并未因此停止人形机器人的技术研发和投入,反而在逐年追加。

转折出现在今年3月,小米以一段机器人在汽车工厂“实习”的视频宣告回归。“小米技术”公众号同步发文介绍,小米机器人在真实汽车工厂的自攻螺母上件工站中连续自主运行3小时,双侧同时安装成功率为90.2%,并满足了最快76秒的产线生产节拍要求。在该任务中,机器人需要连续从自动送钉设备中精准抓取自攻螺母,并放置在自攻拧紧的定位工装上。

雷军当时也在个人公众号发布了这则消息,并预计未来5年会有大批量人形机器人进入小米工厂干活。“雷总确实已经看到人形机器人能够真正产业应用的机会。”向迪昀说。

机器人“实习”何时“转正”?

从今年3月往后的一个季度内,小米称将自攻螺母上件工站双侧作业的成功率提升至98%,与人工作业合格率比,差1%正式“转正”。

合格率差距与机器人的模型有关。向迪昀表示,与大语言模型的“幻觉”问题类似,具身智能模型同样面临可解释性不足的挑战,如同一个“黑盒”。一旦出现问题或异常,后续究竟是补充数据、调整模型架构,还是调整预训练与后训练的数据配比,这些优化措施都需要时间进一步研究。

他预估,到今年底,自攻螺母上件工站的成功率有望补足剩余1%的差距。

图片

小米人形机器人在汽车工厂自攻螺母上件工站“实习”作业。图:视频截图

与此同时,小米的人形机器人在汽车总装车间物流区的两个新工站——中控台侧盖板排序和料箱折叠回收,开启了新的“实习”。小米称,这两项任务的成功率均达到了90%。

向迪昀介绍,不同工站对机器人“转正”的考核指标有差异。比如,料箱回收工站的容错度高,机器人一次未完成可重新尝试,更多关注工作效率;而自攻螺母上件工站对操作精度和效率均有严格要求。

他坦言,行业当前面临的一项问题在于,当任务链复杂度较高或流程较长时,机器人的整体执行效率会明显下降,这与大模型的长上下文推理效率下降类似。据其介绍,3至5秒的短任务,机器人的作业效率可达人工水平的70%至80%,简单场景甚至接近100%;当任务链的时长增加至30秒至1分钟,效率便快速滑落至人工的60%-70%;一旦突破1分钟,效率可能仅剩人工的三成。

据此,向迪昀认为,对于3至5秒的短链路操作——如简单的物料翻转与平移,目前机器人已具备稳定部署的能力。但如果要切入人工主导的复杂度高、任务链长、需要精细操作的场景,预计仍需2至3年的技术攻克。

小米机器人事业部项目负责人王东告诉记者,小米筛选人形机器人的工业场景时大概依据五项标准:目前仍由人工主导、作业程序复杂、涉及协同作业、机器人的效率具备追赶人工的潜力,以及柔性作业场景。

除汽车工厂外,小米也在尝试家庭场景的落地可能。王东透露,第一站选在小米在各地的青年公寓,涵盖公共区域与员工房间。相较于直接进入普通家庭,在小米青年公寓不仅触达成本更低,且对错误有更高容忍度。

在向迪昀看来,工厂更追求成功率、效率和系统稳定性,而家庭更强调泛化性,并兼顾安全性和隐私保护。短期一两年内,机器人进入家庭面临较大困难。如果具身模型跑不通,这一时间窗口可能拉长至3年、5年甚至10年。

具身模型需要怎样的数据?

数据短缺是困扰机器人模型能力的公认瓶颈。向迪昀介绍,对于互联网视频数据、由人工手持夹爪采集的UMI(通用操作接口)数据、真机遥操数据等类型,小米均有使用。其中,UMI数据主要用于预训练,遥操数据则用于后训练的强化学习。

7月中旬,小米发布一款面向真实移动操作任务的具身基座模型,基于10万小时UMI数据进行预训练。小米方面表示,这款模型验证了Scaling Law(缩放定律)在具身智能领域的有效性:扩大真实世界操作数据和模型容量,能够带来可观测的性能收益。

这一方向与海外前沿探索形成呼应。2025年11月,美国具身智能模型公司Generalist推出GEN-0模型,基于27万小时UMI数据进行训练,并声称首次在机器人领域验证了Scaling Law的存在。今年8月,由3名华人创办的美国具身智能公司Dyna Robotics发布Dyna-2具身模型,宣称在使用超过100万小时Ego-centric数据(第一人称人类视频数据)进行预训练的过程中,同样展现出Scaling Law。

由于UMI数据、Ego-centric数据的采集无需配置一台实体的机器人本体,而直接由采集员在手部或头部佩戴专用的可穿戴设备后进行作业,进而产生操作轨迹数据,这两种数据也被称为“无本体数据”。今年以来,许多机器人公司调整了所谓的“数据金字塔”结构,在原有的真机遥操数据、仿真合成数据等的基础上,新纳入无本体数据。

然而,各类数据在训练具身模型时应如何实现最优配比,向迪昀称当前业内尚无共识,不同公司有各自的尝试。

在行业竞相冲刺百万小时训练数据的背景下,出现的另一项争议在于对质量和规模的权衡取舍。有大厂的数采业务员工曾对南都记者表示,现阶段,“量”比“质”更重要,“数据规模上不去的话,质量再高也不行”。不过也有具身从业者坚持,数据的丰富度和质量仍是首要追求。

对此,向迪昀表示,小米目前也处于摸索阶段,在扩大数据规模的同时,同步验证数据的质量和可靠性。他透露,小米在内部会进行一定的数据采集,同时向外部供应商采购,因为完全自采效率太低。但当前行业面临的一项挑战是,如何向数据供应商提出精准的需求,供需双方之间仍在持续磨合。

 

采写:南都N视频记者 杨柳 王子黎 发自北京

编辑:黄莉玲

更多报道请看专题:具身智能热潮席卷

南都N视频,未经授权不得转载、授权联系方式
banquan@nandu.cc. 020-87006626