宇树开源了新大脑,机器人开始先预判再动手
2026年09月20日 15:54 发布者:录余
宇树于9月14日发布G1+,集中升级了机器人的感知与运动能力。颈部增加2个自由度,视觉系统升级为双目相机、广角单目相机和3D激光雷达;肩部与腰部电机的峰值扭矩提升一倍以上,发热量降低约70%。远场拾音系统升级为前4后2的六麦克风阵列,支持声源定位与降噪。头顶新增5个触摸点,背部增加DC 54.6V/5.7A外部供电接口,可支持持续供电运行。六项升级均集中在硬件,含税售价为9.5万元。身体越来越像人。装在里面那颗脑子,这次一个字没提。模型的事,四天前已经公布。9月10日,宇树发布新一代通用人形机器人基础模型UnifoLM-WLA-1.0,其中WLA是World-Language-Action,即世界-语言-动作。模型规模为6B;配套的UnifoLM-ER-1使用超过500万条具身推理样本,WLA模型使用约2500小时真机数据,一个模型覆盖64项任务,包括10项全身操作和54项桌面操作。9月11日,首批权重上线。一具身体挂价签,一颗脑子挂许可证。9 月 7 日晚上,一段 38 秒的视频。画面里没有遥控器,没有人举着 VR 头显。一台 G1 站在场地中间,人类拳手出拳,它双拳收到胸前格挡;一记鞭腿扫过来,它退后半步,稳住,回身还了一拳。视频上打了四个字:全程实拍,无加速。以其中两项为例:物体摆放预测Where2Place得分82.0,空间关系理解VSR得分88.1。两项基准都涉及机器人执行动作前的空间判断,例如目标位置能否放置物体、机械臂的运动是否会与周围物体发生干涉。这些分数需要结合评测方式理解。表中数据来自各模型的技术报告、公开论文和API测试,BLINK也只统计两个子任务,因此并非在统一模型版本、推理设置和评测流程下完成的横向比较。03.世界模型走了条省钱的路第二层是这套模型里最有意思的地方。VLA 之后,行业里冒出一条新路线,叫 WAM,World-Action Model,世界-动作模型。思路是让机器人先学会预测世界怎么变,再从变化里推出动作。这个方向更接近人的直觉:人要挪走一个杯子,脑子里会先过一遍杯子挪开后桌面变成什么样。WAM通常需要生成完整的未来画面,逐帧预测后续变化。在一张512×512像素的图像中,大量背景区域与当前任务无关,完整视频生成仍会为这些区域分配计算量。UnifoLM-WLA-1.0不生成完整的未来画面,而是只预测未来会发生变化的区域。做法是,用光流从前后两帧里提取出真正发生变化的区域,再用 VQ-VAE 把这片连续变化压成固定长度的离散 token,然后训练模型:给它当前画面加任务描述,直接输出未来会变的区域。宇树管这个叫 Dynamic Region,动态区域。
图注:红色区块表示模型预测的未来动态区域,图中其余部分未被标记为动态区域。图片来源:宇树科技官方项目页叠毛巾,真正会变的只有毛巾本身,加上它被挪走后露出来的那块桌面。房间里其他像素纹丝不动。官方把这条路总结成 interaction-centric world modeling,以交互为中心的世界建模。说人话就是,与其画一张模糊的全景未来,不如把哪儿会变算准。前者好看,后者有用。这种设计不追求还原完整未来画面,而是把预测目标集中到与交互相关的区域,从而减少对无关背景的建模。04.把动作切成词,让全身说同一种语言光会看不够,动作还得能被模型统一表达。不同身体部位和末端执行器常采用不同的动作表示与控制模块。腿部行走、机械臂运动和手部抓取的控制目标并不相同,更换末端执行器还会改变动作空间的维度和语义,因此统一建模并不容易。宇树的做法是把动作也切碎。它把机器人的动作拆成三段:末端执行器的位姿、手部关节、下半身关节。三段各训一个残差向量量化模型,把连续轨迹编码成离散的动作 token。三组 token 按共享时间步对齐,一起送进视觉语言模型。手部精细动作、末端轨迹和下肢运动分别被编码为离散token,并按共享时间步对齐后输入视觉语言模型。模型由此可以像预测语言token一样预测动作token。同一模型联合生成末端位姿、手部关节和下肢关节的动作,实现全身协同控制。
图注:官方演示里的桌面任务,画面标注 2 倍速自主执行,右上和右下分别是头部与腕部相机的实时画面。图片来源:宇树科技 UnifoLM-WLA-1.0 官方演示视频这些模块共同构成主干网络UnifoLM-ER-Flow。主干网络之上连接MMDiT动作专家,用于把多模态表征解码为连续动作指令。主干网络负责多模态感知与理解,动作专家负责生成连续动作。这样的模块分工让语义建模与动作生成分别由更合适的网络结构承担,也为端侧部署留下了优化空间。05.2500 小时真机数据,才是最贵的部分公开的模型结构可以被研究者借鉴,但高质量真机数据的采集、清洗和标注更难复制。UnifoLM-WLA-1.0 的训练数据约 2500 小时,官方点名了两类来源,宇树自有开源数据集,以及 BitRobot-HIW-500 这类公开资源。HIW-500由BitRobot、Hugging Face与宇树联合发布,包含500多小时真实家庭场景中的全身遥操作数据。数据使用Unitree G1采集,覆盖29个机器人自由度;头部配备立体相机,腕部配备红外立体相机,并采用CC BY 4.0协议开放。
接下来更值得关注的是开放环境中的任务成功率、跨本体泛化能力,以及长时间运行的稳定性。(机器人大讲堂)
