UnifoLM-WLA-1.0 是宇树科技推出的 6B 参数人形机器人通用基础模型,属于世界 – 语言 – 动作 WLA 架构,依托约 2500 小时真机采集数据训练。模型打通视觉感知、语言理解、场景动态预测与机器人动作生成链路,单模型支持 64 项真机任务,覆盖桌面精细操作与全身移动操作。兼容平行夹爪与两类灵巧手,跨末端执行器泛化能力突出,整套模型权重、代码与配套数据集对外开源,适配人形机器人 G1 平台,降低具身智能项目的二次开发门槛。

UnifoLM-WLA-1.0特点
60 亿参数规模,整套模型整合具身推理、场景动态预测、离散动作学习三类能力。训练素材来自真机采集,超过 500 万具身推理样本,贴合真实物理环境的交互规律。
单权重文件统一承载桌面操作与全身协同任务,切换任务无需重新训练独立策略。可适配不同类型末端执行器,更换夹爪或灵巧手后依旧维持稳定操作表现。
在多项具身推理基准测试取得亮眼指标,部分项目超过开源同类模型,综合能力对标闭源模型。
完整资源包对外释放,开发者可获取模型权重、源代码与训练数据集,自主开展真机调试与算法迭代。
端到端链路设计,从摄像头图像、自然语言指令直接输出机器人关节动作,减少中间模块带来的信息损耗。
UnifoLM-WLA-1.0技术原理
UnifoLM-WLA-1.0 采用双分支架构,主干为 UnifoLM-ER-1 具身推理基座,搭配 MMDiT 流动作专家模块。视觉编码器处理机器人采集的画面,提取空间、物体位置特征,语言模块解析自然语言指令,两类信息送入统一表征空间。
世界建模分支预判交互后的场景变化,预测物体位置、状态的动态区域变化。动作专家模块接收融合特征,输出连续的机器人关节控制信号。
训练阶段使用真机交互数据学习物理约束,建立动作与场景变化之间的映射关系。模型学习环境动态先验,在接收到新任务指令时,预判动作带来的场景改变,再生成对应的运动策略。
整套 WLA 架构把世界模型、语言推理、动作合成融合,感知与动作生成在同一套框架内完成,简化人形机器人的软件栈搭建。
UnifoLM-WLA-1.0项目地址
- 项目官网:https://unigen-x.github.io/unifolm-wla.github.io/
- GitHub仓库:https://github.com/unitreerobotics/unifolm-wla
UnifoLM-WLA-1.0功能
桌面精细操作
接收指令完成叠毛巾、收纳物品、摆放餐盘、插接电源等近距离精细作业。
全身协同任务控制
驱动机器人完成倒垃圾、衣物投放洗衣机、整理床铺、搬运物品等全身联动任务。
多模态场景感知
读取相机图像,识别环境内物体、空间布局,接收自然语言指令理解任务目标。
场景动态预判
执行动作前预估交互带来的场景变化,规避碰撞、物体倾倒等不符合物理规律的动作。
跨末端执行器适配
模型可适配平行夹爪、多手指灵巧手,更换手部硬件无需重新训练整套策略。
模型二次开发与评测
导入自定义机器人数据集,开展微调,在真机平台批量执行任务,完成策略性能测试。
UnifoLM-WLA-1.0应用场景
人形机器人研发团队
作为人形机器人的底层控制基座,在 G1 等机器人本体上做真机任务调试,搭建机器人操作策略。
具身智能实验室
用于世界模型、机器人动作生成相关研究,开展跨硬件泛化、真机交互实验。
机器人原型项目
快速搭建家用服务机器人原型,完成家务整理、物品搬运、桌面收纳类任务验证。
高校机器人教学
用于机器人、具身智能相关课程实验,让学生在真机上测试视觉语言动作一体化模型。
工业移动操作原型
搭建移动抓取原型系统,完成产线物品分拣、物料搬运的前期算法验证。
UnifoLM-WLA-1.0同类产品对比
表格
| 对比项 | UnifoLM-WLA-1.0 | RoboCat 2 |
|---|---|---|
| 研发主体 | 宇树科技(Unitree) | DeepMind(Google) |
| 产品定位 | 开源人形机器人 VLA 具身基座模型 | 多臂机器人通用具身策略模型 |
| 核心特色 | 6B 参数,2500 小时真机数据训练;单模型统一桌面精细操作 + 全身移动协同,支持夹爪 / 灵巧手多末端泛化 | 基于大量机器人交互数据训练,支持跨机器人形态迁移,擅长多类机械臂抓取操作 |
| 适用场景 | G1 人形机器人,家庭家务、桌面操作、全身移动任务 | 机械臂平台,工业抓取、实验室物体操作场景 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



