EgoSuite-Open100K 是由光轮智能发布的全球首个十万小时级全模态人类行为开源数据集。该数据集以10万小时的第一人称人类行为视频为核心规模,覆盖7大类环境、128类场景类型、15,000余个独立采集场景和15,000余项具体任务,并配套手部与全身位姿、语义标注和深度信息等全模态标注数据。首批数据已在Hugging Face和AtomGit同步开源,面向学术研究与商业训练全面开放,相关项目还将捐赠给开放原子开源基金会孵化。Hugging Face官方账号罕见地为其公开站台,将其定位为物理AI领域最大的全标注开放式第一人称人类数据集。

EgoSuite-Open100K核心特点
- 全球最大规模的全标注第一人称人类数据集:10万小时的体量使其在同类开源数据集中遥遥领先。英伟达EgoScale框架的人类视频总量约2万小时,Generalist AI的GEN-0使用27万小时物理交互数据但第一人称视角覆盖不全,EgoSuite-Open100K在”单独人类第一视角+全模态+三层高质量标注”这一组合维度上堆到10万小时并公开,量级刚好踩在具身智能研究中机器人”开窍区间”(1万至10万小时)的关键位置。
- 极广的场景覆盖度:数据并非在单一环境中批量采集,而是按覆盖目标严格控制采集规范,横跨家居、餐旅、零售、运动、物流、办公、工业7大类环境,从厨房备菜到工业装配、从库存盘点到工具维修,场景广度较现有公开数据集拉开一个数量级的差距。
- 头部与腕部双视角采集:头戴摄像头提供全局环境视野,腕部摄像头贴在手腕上捕捉手指接触物体的关键瞬间——这些最精细的操作细节在头戴视角中常被手臂遮挡,腕部视角精准补位,填补了公开数据集中几乎空白的精细操作数据。
- 三层全模态精细标注:每段视频附带手部位姿(21个关节点逐帧标注)、身体位姿(全身动作协调性捕捉)、事件级语义标注(操作目标与物体交互关系),使模型既能学会”手怎么动”,也能理解”为什么这么动”。
- 统一标准与跨平台复用:针对行业长期存在的采集口径不一、标注规范混乱、数据格式各异、时序组织不同等痛点,EgoSuite-Open100K从源头统一了数据模态、标注、时序、格式和质量标准,让不同设备、不同任务、不同模型之间的数据具备组合复用基础。
EgoSuite-Open100K技术原理
EgoSuite-Open100K的技术体系围绕”数据采集—标注处理—训练验证”三个核心环节展开:
规范化采集体系
数据采集并非简单打开摄像头录制,而是将多样性提前设计进采集环节。团队按统一规范作业,明确去什么场景、做什么任务,每一环都照着覆盖目标严格控制,确保15,000余个独立场景在布局、物体、光线等维度上互不重复。采集由数万人的全球采集团队持续生产,覆盖从日常生活到工业生产的全谱系任务。
高难度标注流水线
头戴视频在采集过程中持续抖动(走路晃、转头晃、蹲下站起也晃),加之双手关节自由度高且频繁被身体和物体遮挡,构成位姿估计的极大挑战。光轮智能针对”抖动+遮挡”这一组合难题开发了专门的标注流水线,结合标注算法和质量检测覆盖全生产链路,实现了在恶劣条件下的高精度手部位姿与身体位姿标注。腕部视角的引入则从物理层面规避了遮挡问题,直接获取手指接触物体瞬间的清晰画面。
双视角数据融合
EgoStandard(头戴视角主体)与EgoPro(腕部视角补充)两条数据线路协同工作:头戴视角跟随人的眼睛学习全局环境感知与全身协调,腕部视角补充手指捏、抓、拧、插等精细操作的微观细节,两者结合使模型获得从宏观到微观的完整操作理解。
与仿真评测形成闭环
数据集并非孤立存在,而是与光轮智能自研的SimFoundry物理仿真平台和RoboFinals规模化评测系统构成”教材—练习场—考场”的完整体系:人类数据提供行为先验,仿真环境提供大规模试错与评价,评测系统检验模型能力提升幅度,失败样本再反馈回数据补采与模型迭代,形成持续学习闭环。
EgoSuite-Open100K项目地址
- 项目官网:https://egosuite100k.lightwheel.ai/
EgoSuite-Open100K主要功能
- 为具身智能模型提供预训练数据基础:支持视觉语言动作模型(VLA)、机器人操作策略模型等主流架构的训练,使机器人从人类第一视角视频中学习操作逻辑、动作时序与应变思路。
- 精细操作技能学习:通过手部位姿与腕部视角数据,模型可学习21个关节点的精确运动轨迹,掌握捏、抓、拧、插等灵巧操作技能,支撑灵巧手等高自由度执行器的训练。
- 全身协调运动学习:身体位姿数据教会模型如何伸手、弯腰、转身、移动,实现从手指精细操作到全身协调运动的完整技能覆盖。
- 任务语义理解:事件级语义标注使模型不仅学会动作本身,还能理解当前步骤在做什么、操作的是哪个物体、处于任务的哪个阶段,从而具备任务规划与分解能力。
- 跨场景泛化训练:128类场景、7大类环境的多样性使模型能够学习在不同空间布局、不同物体、不同光照条件下的通用操作策略,而非过拟合于单一环境。
- 统一基准评测:作为全球首个大规模全标注开源人类数据基准,为学术界和产业界提供了可对齐的坐标系,不同团队的研究成果可在同一数据基础上进行公平比较。
EgoSuite-Open100K应用场景
- 通用机器人大模型预训练:为具身智能基础模型提供海量人类行为先验知识,使机器人在接触新任务时具备”见过世面”的泛化能力,从”只会在特定厨房用特定刀切特定菜”进化到”换厨房、换灶台、甚至换成一台人形机器人也能举一反三”。
- 工业制造与装配:覆盖工业质检、工具维修、零件装配等场景数据,可直接用于训练工业机器人在柔性制造线上执行复杂操作任务。
- 物流仓储自动化:包含拆取快递包装、库存盘点、货物搬运等物流场景数据,支撑仓储机器人的分拣、码垛、搬运等技能学习。
- 家庭服务机器人:涵盖叠衣服、擦拭桌椅、切菜、刷洗碗筷、摆放日用品等家务场景,为家用服务机器人提供丰富的日常操作训练素材。
- 零售与餐旅服务:包含超市选购商品、餐饮制作等场景,可用于训练服务机器人在商业环境中执行商品推荐、食品加工等任务。
- 遥操作与模仿学习:高质量的手部与身体位姿数据可直接作为模仿学习的教师信号,驱动机器人通过行为克隆快速掌握新技能。
- 仿真环境构建:深度信息与三维位姿数据可用于构建物理真实的仿真训练环境,支持Sim2Real迁移训练,降低真机试错成本。
EgoSuite-Open100K的发布标志着具身智能领域从”数据匮乏”走向”数据基础设施化”的关键转折。它不仅仅是一个数据集,更是一套包含采集标准、标注规范、评测基准和持续迭代机制的完整体系。随着光轮智能”5年100亿小时具身智能数据共建计划”的推进,以及吉利、五八同城、新希望等生态合作伙伴的加入,这一开源数据基础设施有望持续扩容,为机器人从实验室走向千行百业的规模化落地提供源源不断的”学习教材”。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



