具身智能数据采集与治理

专注 Ego 视觉、多模态操作与仿真三类具身数据的采集、治理与结构化交付。按场景定制方案,交付可直接用于模仿学习训练的标准化数据集。

了解数据方案

Data Products

数据产品

三类数据覆盖模型训练的不同阶段,真实采集与仿真生成互为补充。

核心产品
Ego 视觉数据

第一人称操作视觉

操作员穿戴头戴相机执行目标任务,以第一人称视角采集 RGB / RGB-D 操作示教数据。全局快门消除运动模糊,6轴 IMU @400Hz 提供高频空间姿态信息。采集过程不依赖特定机器人本体,一套体系可服务多种下游平台。

预训练 · 世界模型 · 策略蒸馏
Ego 视觉 + 末端操作状态

多模态操作数据

在 Ego 视觉基础上叠加末端执行器的操作状态数据:通过腕部相机捕获手部近景,UMI 灵巧手记录夹爪开合位置、运动轨迹与视觉接触信息,实现视觉与末端状态的多模态同步记录。

动作微调 · 精细操作 · 接触感知策略
仿真数据

合成与增强数据

基于物理仿真引擎生成的合成操作数据。用于补充真实采集难以覆盖的长尾场景——极端光照、罕见物体姿态、危险操作的失败与恢复过程。与真实数据配合使用,平衡质量与规模。

规模扩充 · 长尾覆盖 · Sim2Real

Our Understanding

我们对数据问题的认知

具身智能的数据问题和互联网 AI 的数据问题有本质区别。以下判断来自我们的实际生产经验,也是 BaseMatrix 数据产品设计的底层逻辑。

Ego 采集是兼顾质量与规模的最优路径

真机遥操产出的数据与目标本体严格对齐,但每套遥操系统只适配一种本体,采集成本高、扩展性差。Ego 采集将数据生产与目标本体解耦——操作员用自然动作执行任务,采集系统独立于下游的任何机器人平台。同一组采集数据可以通过视觉策略学习(如 ACT / Diffusion Policy)迁移到不同本体,是目前兼顾数据质量与规模效率的平衡点。

多模态同步精度直接约束策略学习质量

多模态数据的价值在于模态间的时间对应关系——某一帧视觉画面对应的末端位置和接触状态必须严格对齐。如果视觉和末端状态之间存在 10ms 的时间漂移,在 30fps 下相当于 0.3 帧的空间错位,精细操作场景下这个误差会显著降低策略学习效果。这是我们选择硬件级同步(<1ms)而非软件后对齐的原因。

仿真数据的核心价值在于边界覆盖

用仿真数据做预训练的收益递减很快——超过一定量级后,模型更多地拟合仿真环境的特征而非通用物理规律。但仿真在覆盖真实采集难以触达的边界条件上有不可替代的作用:极端光照、罕见物体姿态、危险操作的失败场景。我们的仿真数据聚焦这些长尾区域,用于补充而非替代真实采集。

数据治理工时通常超过采集本身

从原始录制到可训练数据集之间的治理环节——时间对齐校验、异常帧剔除、标注一致性审核、格式转换——在实际项目中通常占总工时的 50% 以上。自建采集能力的团队往往严重低估这部分成本。我们的自动化治理引擎覆盖了这些环节中的重复性工作,目标是将人工治理工时压缩 70%,让人聚焦在需要判断力的标注质量审核上。

全局快门是操作示教数据的硬性要求

卷帘快门在手部快速运动时产生的果冻效应会扭曲物体边缘和空间关系。对于需要精确还原手-物交互几何关系的操作示教数据,这种畸变无法通过后处理完全消除。全局快门是必要条件,不是性能加分项。我们的整套采集设备——从头戴相机到腕部相机到末端执行器——全部采用全局快门传感器。

采集-治理的人效比决定数据成本结构

具身数据的成本大头是人:操作员执行任务、标注员审核标注、工程师排查异常数据。SOP 的完善度直接决定单位数据的产出效率和一致性。我们将新场景从需求定义到首批数据交付压缩到 3 个工作日,依赖的是标准化 SOP 模板库和经过验证的传感器配置方案。

Workflow

采集与交付流程

标准化作业流程,新场景最快 3 个工作日出数据。

01
🎯

场景定义

定义采集场景、动作序列与环境变量,输出采集 SOP 与传感器配置方案。

02
📷

数据采集

操作员穿戴传感器执行任务,视觉、惯性、末端状态多路信号同步录制。

03
🏷️

治理与标注

自动化清洗对齐 + 人工标注:动作分段、关键帧、语义描述。

04

质检与交付

多轮审核 + 一致性校验,交付 AI-Ready 数据集,兼容主流训练框架。

Hardware Platform

采集硬件平台

基于奥比中光 Orbbec EGO 系列构建的多模态同步采集系统,按场景需求灵活组合。

头戴相机

Orbbec EGO Series
👁️

EGO 双目

STEREO RGB + IMU

双目立体 RGB + 6轴 IMU,重量 <220g。适用于桌面操作、装配等近距离精细任务的第一人称视角采集。

2MP 双目 160°×130° 30/60fps <220g
🔲

EGO 四目

PANORAMIC RGB + IMU

四目拼接全景 RGB + 6轴 IMU,水平视场角 ≥270°。适用于仓储巡检等需要大范围环境感知的场景。

4路 RGB ≥270° HFOV 全局快门 <400g
📐

EGO 深度

RGB-D · Gemini 336

集成 Gemini 336 深度模组 + 3路 RGB + 6轴 IMU,空间精度 0.5%@1m。用于需要点云输出的 3D 重建任务。

RGB-D 0.5%@1m 3路 RGB <400g

手部设备

WristCam + UMI Series

WristCam

WRIST · RGB

超轻量腕戴 RGB 相机,仅 <60g。捕获手部操作近景,与头戴相机形成远近互补视野。

2MP <60g 全局快门 6轴 IMU
🤏

UMI Finger

END-EFFECTOR · FINGER

鱼眼 RGB + 单目 SLAM + 二指夹爪,<200g。记录末端视角、夹爪开合状态与运动轨迹。

鱼眼 RGB SLAM 3kg 夹持 <200g
🦾

UMI Gripper

END-EFFECTOR · GRIPPER

大行程夹爪末端执行器,<500g。适用于大尺寸物体抓取与工业分拣场景的操作数据采集。

鱼眼 RGB SLAM 2.5kg 夹持 <500g
🔗

多设备同步 Hub

将头部 EGO 相机与两只手部设备统一连接至 NVIDIA Jetson 或笔记本。负责多路数据的硬件级时间同步与统一传输,是整个采集系统的同步中枢。

全系设备统一采用全局快门传感器,内置 6轴 IMU @400Hz,跨设备同步精度 <1ms,H.264 硬件编码支持长时间连续录制。

Software

软件技术栈

从采集框架到数据治理的完整软件链路。

DexUMI 采集框架

基于斯坦福、哥大、CMU 与英伟达联合提出的 DexUMI 开源框架(CoRL 2025 最佳论文提名)。DexUMI 的核心贡献是通过可穿戴外骨骼与 SAM2 视觉桥接,使得人手操作示教数据可以用于下游不同本体的策略训练——采集时不需要真机在场,数据的跨本体迁移在训练侧完成。

采集效率 3.2× 传统遥操方案

自动化数据治理引擎

覆盖多模态数据从原始录制到可训练数据集的完整治理链路:时间对齐校验、异常帧检测与剔除、传感器漂移补偿、标注一致性自动审核、格式转换与版本管理。目标是将治理环节中的重复性工作自动化覆盖 ≥70%,人工集中在需要判断力的标注质量审核上。

自动化覆盖 ≥70% 治理工时

Why BaseMatrix

核心优势

01

真实采集 + 仿真生成的互补数据体系

Ego 真实采集保证物理真实性,仿真生成覆盖长尾与边界场景。两类数据在同一治理流程中对齐、标注、交付。

02

AI-Ready 结构化交付

交付含动作分段、3D 标注、物理参数对齐的标准化数据包,兼容 ACT / Diffusion Policy 等主流训练框架。

03

硬件级多模态同步

视觉、惯性、末端状态信号 <1ms 硬件级同步,全局快门无运动模糊。同步精度直接约束策略学习的上限。

04

新场景 3 天响应

SOP 驱动的标准化流程,新场景从定义到出数据最快 3 个工作日。传感器组合按需配置,产能弹性可扩。