HOST框架 – 自变量机器人开源发布的技能获取技术

HOST框架是由中国具身智能企业自变量机器人于2026年8月3日开源发布的技能获取技术,全称为Human-to-robot One-Shot Skill Acquisition(人类到机器人单样本技能获取)让机器人仅通过观看一段平均29秒的人类操作视频即可学会新技能,且完全保留已掌握的旧技能,从根本上解决了传统机器人学习中的“灾难性遗忘”问题,将技能获取成本降低至专业数据采集模式的1/50。

HOST框架 - 自变量机器人开源发布的技能获取技术

HOST框架核心特点

1. 单样本高效学习

  • 仅需29秒人类演示视频即可完成新技能学习,成功率高达62%,远超传统方案(Pi-0.5+微调方案需50个样本+4小时训练,成功率仅38%)。
  • 学习速度提升500倍,所需数据量减少50倍,普通人用手机拍摄视频即可教学,无需专业数据采集团队

2. 无灾难性遗忘

  • 采用技能持久化存储机制,新技能以独立模块形式存入技能库,完全冻结基础模型权重,避免传统微调导致的旧技能覆盖问题。
  • 旧技能保留率达100%(传统方案仅17%),支持技能库持续扩展。

3. 强泛化与鲁棒性

  • 50种不同物体、工具和场景的任务测试中均能成功学习新技能。
  • 面对光照变化、物体替换、场景移动等干扰,任务成功率仍保持在50%以上,证明其理解任务本质而非死记动作序列

HOST框架技术原理

1. 结果反推式学习逻辑

  • 摒弃传统“动作模仿”路径,不直接翻译人类关节动作,而是让机器人先想象任务完成后的目标画面,再反向推导自身需执行的动作序列。
  • 通过跨主体结果对齐解决人机身体结构差异问题:人类拿起水杯的结果画面,被转化为机器人视角下的“抓取水杯”状态,再据此生成机械臂动作。

2. 双专家MoT级联架构

  • 视觉大脑:处理视频流、定位任务进度、预测未来图景,将人类动作转化为目标状态向量。
  • 动作大脑:将目标状态向量转化为机器人可执行的动作指令,控制硬件完成任务。
  • 两模块通过动态时间规整(DTW)算法实现任务进度精准对齐,将时间误差降低一个数量级

3. 推理时技能获取机制

  • 技能学习从“训练时微调”转变为纯推理阶段完成:模型权重训练完成后即冻结,新技能通过视频解析生成独立技能脚本,无需修改任何参数
  • 采用两阶段训练流程
    • 同体预训练:机器人先学习自身执行任务的视频,建立“动作-结果”因果认知。
    • 人机视频迁移:将人类演示映射到机器人动作空间,实现跨主体技能迁移。

HOST框架核心功能

1. 任务进度动态对齐

  • 解决人类与机器人操作速度差异问题:视频中人类10秒切完菜时,机器人可能仍在切菜,传统时间戳对齐会导致任务失败。
  • 通过DTW算法将视频帧与机器人操作步骤按任务节点而非时间戳对齐,确保每一步执行时看到的都是当前进度匹配的画面。

2. 跨场景自适应执行

  • 中途遭遇物体被移动等干扰时,能动态调整后续动作继续完成任务,而非机械复现视频序列。
  • 支持光照、物体形态、背景变化下的技能泛化,例如用不同工具完成同一任务(如用刀或剪刀开包装)。

3. 零门槛技能教学

  • 普通人无需编程知识,仅需用手机拍摄一段人类操作视频,机器人即可解析并复现技能。
  • 技能库支持即时调用与组合,例如“开门”技能可复用于不同门型场景。

HOST框架典型应用场景

1. 家庭服务机器人

  • 快速学习家务技能:用户拍摄“整理桌面”视频,机器人即可自主完成类似任务,无需厂商预置特定动作库
  • 适应个性化环境:针对不同家庭布局,通过少量演示视频调整导航与操作逻辑。

2. 工业与零售场景

  • 产线快速部署:工人演示新零件装配流程后,机器人24小时内即可上线操作,替代传统数周的数据采集与训练周期。
  • 零售补货自动化:通过观察店员摆放商品视频,自主学习不同货架的补货路径与手法。

3. 具身智能生态扩展

  • 降低技能开发门槛:开发者可基于开源框架构建视频驱动的技能共享平台,形成“用户上传视频→机器人调用技能”的开放生态。
  • 为服务机器人提供持续进化能力,例如养老机器人通过家属教学视频掌握个性化照护动作。

HOST框架的本质是将机器人技能获取范式从“专业训练”转向“自然教学”,其技术价值不仅在于效率提升,更在于通过“结果反推”逻辑和推理时学习机制,使机器人具备接近人类的观察学习能力。当前该框架已开源代码与论文,为具身智能从实验室走向家庭、工厂等真实场景提供了关键落地路径。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...