UnifoLM-WLA-1.0 – 宇树科技推出的人形机器人通用基础模型

UnifoLM-WLA-1.0 是宇树科技推出的 6B 参数人形机器人通用基础模型,属于世界 – 语言 – 动作 WLA 架构,依托约 2500 小时真机采集数据训练。模型打通视觉感知、语言理解、场景动态预测与机器人动作生成链路,单模型支持 64 项真机任务,覆盖桌面精细操作与全身移动操作。兼容平行夹爪与两类灵巧手,跨末端执行器泛化能力突出,整套模型权重、代码与配套数据集对外开源,适配人形机器人 G1 平台,降低具身智能项目的二次开发门槛。

UnifoLM-WLA-1.0 - 宇树科技推出的人形机器人通用基础模型

UnifoLM-WLA-1.0特点

60 亿参数规模,整套模型整合具身推理、场景动态预测、离散动作学习三类能力。训练素材来自真机采集,超过 500 万具身推理样本,贴合真实物理环境的交互规律。

单权重文件统一承载桌面操作与全身协同任务,切换任务无需重新训练独立策略。可适配不同类型末端执行器,更换夹爪或灵巧手后依旧维持稳定操作表现。

在多项具身推理基准测试取得亮眼指标,部分项目超过开源同类模型,综合能力对标闭源模型。

完整资源包对外释放,开发者可获取模型权重、源代码与训练数据集,自主开展真机调试与算法迭代。

端到端链路设计,从摄像头图像、自然语言指令直接输出机器人关节动作,减少中间模块带来的信息损耗。

UnifoLM-WLA-1.0技术原理

UnifoLM-WLA-1.0 采用双分支架构,主干为 UnifoLM-ER-1 具身推理基座,搭配 MMDiT 流动作专家模块。视觉编码器处理机器人采集的画面,提取空间、物体位置特征,语言模块解析自然语言指令,两类信息送入统一表征空间。

世界建模分支预判交互后的场景变化,预测物体位置、状态的动态区域变化。动作专家模块接收融合特征,输出连续的机器人关节控制信号。

训练阶段使用真机交互数据学习物理约束,建立动作与场景变化之间的映射关系。模型学习环境动态先验,在接收到新任务指令时,预判动作带来的场景改变,再生成对应的运动策略。

整套 WLA 架构把世界模型、语言推理、动作合成融合,感知与动作生成在同一套框架内完成,简化人形机器人的软件栈搭建。

UnifoLM-WLA-1.0项目地址

  • 项目官网:https://unigen-x.github.io/unifolm-wla.github.io/
  • GitHub仓库:https://github.com/unitreerobotics/unifolm-wla

UnifoLM-WLA-1.0功能

桌面精细操作

接收指令完成叠毛巾、收纳物品、摆放餐盘、插接电源等近距离精细作业。

全身协同任务控制

驱动机器人完成倒垃圾、衣物投放洗衣机、整理床铺、搬运物品等全身联动任务。

多模态场景感知

读取相机图像,识别环境内物体、空间布局,接收自然语言指令理解任务目标。

场景动态预判

执行动作前预估交互带来的场景变化,规避碰撞、物体倾倒等不符合物理规律的动作。

跨末端执行器适配

模型可适配平行夹爪、多手指灵巧手,更换手部硬件无需重新训练整套策略。

模型二次开发与评测

导入自定义机器人数据集,开展微调,在真机平台批量执行任务,完成策略性能测试。

UnifoLM-WLA-1.0应用场景

人形机器人研发团队

作为人形机器人的底层控制基座,在 G1 等机器人本体上做真机任务调试,搭建机器人操作策略。

具身智能实验室

用于世界模型、机器人动作生成相关研究,开展跨硬件泛化、真机交互实验。

机器人原型项目

快速搭建家用服务机器人原型,完成家务整理、物品搬运、桌面收纳类任务验证。

高校机器人教学

用于机器人、具身智能相关课程实验,让学生在真机上测试视觉语言动作一体化模型。

工业移动操作原型

搭建移动抓取原型系统,完成产线物品分拣、物料搬运的前期算法验证。

UnifoLM-WLA-1.0同类产品对比

表格

对比项UnifoLM-WLA-1.0RoboCat 2
研发主体宇树科技(Unitree)DeepMind(Google)
产品定位开源人形机器人 VLA 具身基座模型多臂机器人通用具身策略模型
核心特色6B 参数,2500 小时真机数据训练;单模型统一桌面精细操作 + 全身移动协同,支持夹爪 / 灵巧手多末端泛化基于大量机器人交互数据训练,支持跨机器人形态迁移,擅长多类机械臂抓取操作
适用场景G1 人形机器人,家庭家务、桌面操作、全身移动任务机械臂平台,工业抓取、实验室物体操作场景
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...