V2 · Revised

具身智能数据产品化路径

一个资源有限的早期进入者,在快速变化的具身智能数据市场中,如何找到可行的商业路径。基于 2024-2026 最新学术研究、行业竞品和市场现实。

2026-08-14 v4.2 · BaseMatrix 内部研究(新增L6 LeRobot v3.0封装验证 + L1-L6全管线闭环)
目录
价值链、玩家与市场现实
2026 上半年 ¥460 亿涌入具身智能,但 70% 只流向 20 家公司。整机厂商普遍亏损,数据基础设施层最接近真实营收。资本正从整机向数据/组件/模型迁移。
产业价值链
硬件
采集设备
奥比中光 / BeingBeyond / 星动纪元 / 灵御智能
采集
操作数据录制
光轮智能 / 觅蜂 / 设备厂商自建
治理
标注 / 质检 / 验证
BaseMatrix 目标切入点
仿真
世界模型放大
NVIDIA / 穹彻 / Genesis
消费
训练 / 部署
机器人厂商
市场玩家与各自策略

光轮智能 Lightwheel

$20亿估值 · 全球首个具身数据独角兽

2023 年成立,累计融资超 ¥20 亿(蚂蚁集团领投),2 个月估值翻倍至 $20 亿。Q1 2026 新增订单 ¥5.5 亿。核心产品:Physical AI 仿真+合成数据平台(不只是采集,而是仿真+合成+评测),NVIDIA Newton 物理引擎核心指导委员会成员。数据复购率 >10×。绝对的行业第一,威胁最大

BeingBeyond 智在无界

灵巧手 + 数据闭环 · 2026.03

U1(680g/11关节/<0.1mm追踪)+ Being-Dex 完整方案(采集→训练→部署,30 分钟学会新任务)。不只是硬件:Being-Dex 声称适配任意形态灵巧手,正在切入数据和模型服务。既是潜在伙伴也是潜在竞争者

星动纪元

灵巧手硬件 · XHAND 1 PRO

XHAND 1 PRO(2026.06):21 自由度全直驱,双编码器消除背隙,支持 VR/动捕/外骨骼操控。上市即交付(<1 月)。基于 DexUMI 框架,4 项任务 86% 成功率。以硬件为主但支持数据采集场景,潜在合作对象

灵御智能 LingYu

遥操作 · 清华+CMU · 2025.02

清华莫一林教授创办,千万级天使轮。核心是高精度低延迟遥操作系统。官方战略:"卖硬件→卖数据→卖能力"三步走 —— 计划自己做数据服务。短期是合作对象,但中长期会进入数据领域。

觅蜂科技 MiFeng

智元孵化 · 数据平台 · 2026.02

智元机器人(AgiBot)孵化的子公司,数亿元天使+轮融资。自有硬件 MEgo 系列 + MEgo Engine 数据治理平台。目标:2026 年千万小时产能,2030 年十亿小时。发起"蜂巢数据共创行动"建生态。有母公司背书的重量级竞争者

穹彻 / 银河通用 / 智元 / 宇树

机器人厂商 · 自建数据

头部公司自建数据管线。注意:智元已通过觅蜂科技将数据能力独立运营并对外输出。其他厂商的数据策略尚不明确,但内部管线是趋势。短期非直接客户。

数据处理六层体系(L1-L6 速查)

本报告中频繁引用的 L1-L6 是 BaseMatrix 定义的数据处理管线层级。以下是速查,详细展开见第 06 节

L1
时序同步
多流对齐
L2
6DoF 位姿
SLAM 提取
L3
动作分段
交互检测
L4
语义标注
VLM 生成
L5
具身迁移
视觉重绘
L6
格式封装 ✓
LeRobot v3.0
L1-L4 = 两条行业路线下的共同刚需  |  L5 = 跨层质量校验  |  L6 = 交付格式适配
✅ L1-L5 管线已验证
基于 Orbbec EGO 双目实采数据(3 段 86 秒 2505 帧),完整跑通 L1 时序同步 → L2 ORB-SLAM3 位姿 → L3 Hands23 手物交互 + WiLoR 手骨骼 + HaWoR 世界轨迹 → L4 GPT-4o Vision 语义 → L5 跨层一致性校验(67 项全通过)。L6 LeRobot v3.0 封装已完成(2184 帧、18 特征维度、API 验证通过)。
查看技术 Demo ↗
市场现实

2026 市场的五个事实:

1. 资本密集但高度集中 — H1 2026 融资 ¥460 亿,但 70% 流向 20 家公司。光轮智能 6 轮融 ¥31 亿,银河通用单轮 ¥25 亿。小公司很难拿到钱。

2. 整机厂商普遍亏损 — 2026 出货 ~42,000 台人形机器人,但多为试点。平均毛利 <15%,优必选 2020-2025 累计亏损超 ¥540 亿。Figure AI $390 亿估值但基本无营收。

3. 数据层最接近真实营收 — 光轮 Q1 订单 ¥5.5 亿(复购率 >10×),海天瑞声 Q1 营收 ¥9700 万(+38.6%),宇树 2025 营收 ¥17 亿(净利 ¥2.78 亿)。

4. 资本正在从整机向数据迁移 — 核心组件/模型/数据层融资占比已超 60%,整机融资收缩至 30%。VC 在赌"卖铲子"而不是"挖金子"。

5. 中美都在抢数据基础设施 — 中国:光轮/觅蜂/凯望/枢途/星海图。美国:XDOF($7000 万 a16z)/Scale AI/Ropedia($2200 万)。DoorDash 付 800 万骑手录日常操作卖给机器人公司。

2026 年行业头部的数据策略实况
行业解决"如何获取机器人训练数据"分裂为两条主流路线。这两条路线正在从两侧挤压"显式具身迁移(L5)"的生存空间。理解这一点对 BaseMatrix 的战略选择至关重要。
路线 A:基础模型内部解决跨具身(正在成为主流)

核心思路:用海量人类视频预训练基础模型,模型内部学会物理直觉和空间推理,再用少量机器人数据微调。不需要在数据层面做显式的人手→机器人手视觉重绘。

公司方法数据规模关键进展
DYNA Robotics DYNA-2 世界-动作模型 100 万小时人类第一人称视频 跨机械臂/人形/灵巧手零样本迁移,新任务 13 分钟适配(2026.08)
1X Technologies 世界模型 + NEO 网络视频 → 900h 人类第一人称 → 70h NEO 微调 NEO 自主学习新技能,$20K 预售(2026.01)
Tesla Optimus 纯相机采集 + Digital Dreams 合成 放弃动捕,5 相机头盔+背包录制人类自然操作 1000+ Gen 3 已部署工厂产线(2026.01)
Physical Intelligence π0.7 通用机器人基础模型 10,000h / 7 种机器人 / 68 任务 + OXE 开源数据 零样本跨具身泛化,$4 亿+融资(2026.04)
光轮智能 EgoSuite 人类行为数据平台 Real2Sim2Real 闭环,跨具身操作经验积累 $20 亿估值,Q1 $1 亿订单,NVIDIA 核心伙伴
戴盟机器人 daimon-TWM(Task World Model) 蚂蚁领投 + 汇川/运营商/招商局战略股东 股东即客户模式,自带工厂/港口/物流部署场景

路线 A 对数据服务商的含义:这些公司需要的不是"帮我把人手画面改成机器人画面",而是大量高质量的人类第一人称操作视频 + 精确的动作标注。他们的模型内部解决跨具身迁移。你的价值在于提供干净、标准化、精确标注的 L1-L4 数据。

路线 B:大规模遥操作(直接用机器人采集)

核心思路:数据直接用目标机器人采集,通过 VR/动捕/力反馈遥操作控制。采出来的数据已经是目标具身形态,不需要迁移。

公司方法规模关键进展
智元机器人 AgiBot 遥操作数采中心 + 精灵 G2 上海/深圳数十个中心,数千名操作员 第 10,000 台下线,宣布 2026"部署元年"
宇树科技 Unitree G1-D 全栈数采平台 + LeRobot 标准化采集+开源数据集 Unitree_il_lerobot 框架开源,HuggingFace 公开数据
Figure AI Helix VLA + BMW 工厂遥操作车队 BMW 产线实际部署 Figure 03 开发中,更高载荷+运动能力

路线 B 对数据服务商的含义:这些公司的遥操作中心产生海量原始数据,但仍需要质检、动作分段、语义标注、格式转换。智元的数千名操作员采集的数据不可能全部高质量 — 数据治理需求巨大。

对"显式具身迁移(L5)"的影响

L5(人手→机器人手的显式视觉重绘)正在被两侧挤压:

路线 A 从上面绕过:基础模型在神经网络内部解决跨具身迁移,不需要逐帧改写数据

路线 B 从下面绕过:直接用机器人遥操作采集,不存在跨具身问题

目前仍在做显式 L5 的:RoboPaint(学术,3D Gaussian Splatting 视觉重绘)、光轮 EgoSuite(平台级,不是单条数据服务)

结论:L5 作为"BaseMatrix 对外出售的数据处理服务",可能在商业化之前就被行业技术路线绕过。但 L1-L4 的需求在两条路线下都是刚需。

学术前沿:跨具身迁移的新方向

即便显式 L5 正在被绕过,跨具身迁移的学术研究仍在快速推进 — 但方向已经从"改写数据"变成"统一表征":

方法核心思路进展
LAP(语言-动作预训练) 语言作为跨具身的统一表征,零样本迁移 arXiv 2602.10556
CMU 世界模型方法 环境动力学是具身无关的,世界模型做统一接口 CMU Robotics Institute 2026
OXE-AugE 大规模跨具身数据增强(Open X-Embodiment) 22 种机器人 / 1M+ 轨迹
RoboPaint 3DGS 场景重建 + Dex-Tactile 联合重定向 arXiv 2602.05325,学术原型

对 BaseMatrix 的启示:L5 的长期价值不在于"逐帧视觉重绘",而在于理解基础模型需要什么样的人类数据。DYNA-2 需要 100 万小时第一人称视频,1X 需要 900 小时,Physical Intelligence 需要 10,000 小时。这些数据的采集、同步(L1)、位姿提取(L2)、动作分割(L3)、语义标注(L4)正是 BaseMatrix 能做的事。做基础模型公司的上游数据供应商,比做一个可能被绕过的 L5 处理服务,路径更稳。

趋势观察:纯 RGB → 动作信号(采集硬件壁垒正在被软件吃掉)

除了路线 A/B 之外,一条新的技术路径正在浮现:不需要任何专业采集设备,仅用普通第一人称 RGB 视频就能提取机器人可用的动作信号。这意味着"采集硬件"这个门槛正在被纯软件管线削平。

方法输入输出精度速度
MacrodataLabs(WiLoR+HaWoR+VGGT-Omega) 普通第一人称 RGB 视频 手腕 + 20 指关节真实尺度 3D 轨迹 52mm MPJPE(HOT3D) 15.5 FPS 端到端
UMI + ORB-SLAM3(当前 L2 管线) 鱼眼 RGB + IMU + 专业标定 末端执行器 SE(3) 位姿 <6.1mm 位置误差 离线处理

精度差 8 倍,但趋势值得跟踪:

52mm 够用的场景:基础模型预训练(DYNA-2 需要的是海量数据 + 粗动作信号,不需要亚厘米精度)、粗操作(抓放/分拣)、世界模型训练

52mm 不够用的场景:精细装配、工具使用、灵巧手操作 — 这些仍然需要 SLAM+IMU 或遥操作

趋势判断:2024 年 50mm 需要深度相机+IMU,2026 年纯 RGB 就能做到。如果这个速度持续,2-3 年内纯 RGB 可能逼近 <15mm — 届时专业采集硬件的优势将大幅缩小

对 BaseMatrix 的含义:采集硬件的壁垒在降低,但数据治理(L3 动作分段 + L4 语义标注 + 质检)的需求反而上升 — 越容易采集,数据量越大,越需要有人做治理。当前不需要集成纯 RGB 管线(精度不够),但应持续跟踪,等精度到 <15mm 时考虑作为 L2 的低成本替代方案。

钱从哪来、流向哪里、谁在赚钱
具身智能的 ¥460 亿融资不等于 ¥460 亿市场。大部分资金在 VC→机器人公司→上游供应商 的链条里循环。理解资金流向是判断 BaseMatrix 切入点的前提。
资金流向图
VC / 政府基金 ──¥460亿 (H1 2026)──→ 机器人公司(大部分亏损) │ ├──→ 买芯片/传感器/零部件(占成本 65-75%,上游赚钱) ├──→ 买数据服务(光轮/觅蜂/海天瑞声/XDOF) ├──→ 自研 + 人力 └──→ 试点部署(极少产生正向 ROI) 真正的终端客户(工厂/仓库为机器人付费并产生 ROI)──→ 极少 唯一例外:宇树科技(机器狗/消费级人形,有真实 C 端 + B 端客户)
谁在赚真钱
公司营收利润钱从哪来
宇树科技 ¥17 亿(2025),+335% 净利 ¥2.78 亿,毛利 60% 卖机器狗 + 消费级人形,真客户付真钱
光轮智能 Q1 订单 ¥5.5 亿 未公开 仿真/合成数据卖给机器人公司,复购率 >10×
海天瑞声 Q1 ¥9700 万,+38.6% 上市公司,有利润 全栈 AI 数据标注(不只是具身)
DeepRobotics 未公开 2025 年盈利 四足机器人
谁在烧钱
公司估值营收真相
Figure AI $390 亿 基本无营收(第三方估千万美元级) pre-revenue 的四千亿估值
优必选 UBtech 上市 有营收 2020-2025 累计亏损超 ¥540 亿
大部分人形机器人公司 各种独角兽 2026 出货 ~42,000 台 多为试点,毛利 <15%,普遍亏损
觅蜂科技 ¥10 亿 未公开 千万小时产能目标,付费客户数未知
竞争对手全景(中美)

专门做具身数据服务的公司已经不少。但大多数在做采集或平台,专门做"L1-L4 管线处理服务"的是少数。

公司地区融资/估值定位
光轮智能北京¥80 亿估值,6 轮共 ¥31 亿仿真+合成+评测平台
觅蜂科技上海¥10 亿估值遥操作+无本体采集+标注平台
星海图北京联合亦庄共建百万小时真实数据计划
枢途科技深圳¥5 亿估值多模态数据集+标注规范
凯望数据中国>¥1 亿(2026.08)具身数据基础设施
海天瑞声北京上市公司全栈 AI 数据供应链
XDOF美国$7000 万(a16z/Thrive)遥操作采集+标注,~20 客户含头部 AI 实验室
Scale AI美国巨头Physical AI Data Engine,100K+ 小时
Ropedia新加坡$2200 万 Pre-A真实世界多模态交互数据
Nferent AI美国未公开工厂/仓库物理 AI 数据
DoorDash Tasks美国自有 800 万骑手付骑手录日常操作 → 卖给机器人公司

L1-L4 管线处理服务的竞争格局:大多数公司做的是采集(XDOF/觅蜂/DoorDash)或平台(光轮/Scale AI)。专门把原始 EGO/灵巧手数据跑 SLAM → 动作分段 → 语义标注 → 输出 LeRobot v3 格式的"管线处理即服务",目前做的公司可能是个位数 — 不是因为有壁垒,而是市场需求还没大到支撑很多公司专门做这件事

核心风险判断

你的客户花的是投资人的钱。

BaseMatrix 的目标客户(中小机器人公司)几乎全部靠 VC 融资运营。他们的付费能力取决于融资节奏,不取决于他们自己的营收。如果具身智能泡沫收缩(业内已承认估值有泡沫,需 1-2 年消化),你的客户可能会消失。

三种进场思路:

截流 VC 的钱 — 找融到资的机器人公司帮他们处理数据。快但不稳,泡沫收缩时客户消失。

找真正的终端需求 — 找已部署机器人的工厂/仓库做数据迭代。慢但稳,他们花自己的钱。

找"股东即客户"型公司 — 战略投资人自带部署场景的机器人公司(见下方戴盟案例)。融资和订单是同一件事,比纯 VC 模式更稳。

验证标准:找到一个愿意用自己的预算(不是 VC 的钱)为数据服务付费的客户 = 真正的市场信号。

案例:戴盟机器人 — "股东即客户"模式

戴盟机器人(DaiMon)最新一轮由蚂蚁集团领投。但真正值得关注的不是融资金额,而是股东表本身就是一张部署场景清单

战略股东代表领域带来的部署场景
蚂蚁集团金融科技 + AI 生态资金 + 生态资源(同时重仓光轮智能)
中国电信 + 中国移动运营商 + 边缘计算5G 远程遥操作基础设施
汇川技术工业自动化龙头工厂产线 — 中国最大的机器人落地场景
联想全球制造 + 算力全球制造场景 + GPU 计算资源
招商局港口 + 物流 + 航运港口/仓储 — 另一个主要机器人落地场景

戴盟同时发布了 daimon-TWM(Task World Model),走路线 A(基础模型内部解决跨具身),又一个需要海量操作数据训练的大模型。

这个模式的启示:

与 Figure AI 的对比:Figure AI $390 亿估值但基本无部署客户;戴盟的股东就是客户 — 融资和订单是同一件事

蚂蚁的组合拳:同时投光轮(数据层)和戴盟(整机+模型层),不管谁赢都赚。说明头部 VC 认为数据和整机都有价值

对 BaseMatrix 的含义:短期戴盟不是客户(自有数据管线+股东场景),但 daimon-TWM 规模化训练阶段可能需要外采数据。更重要的是,"股东即客户"型公司比纯 VC 支撑的公司更不容易消失 — 他们是更稳的潜在长期客户

激进投入估算

如果 6 个月内要达到可接单交付的状态:

类别明细金额
人力(6 个月)1-2 管线工程师(¥20-35K/月)+ 2-3 标注员(¥8-12K/月)¥50-80 万
硬件(一次性)2× RTX 4090 工作站 + 30TB NAS + EGO 采集设备¥10-15 万
云/杂项(6 个月)AutoDL 弹性 GPU + 杂费¥5-10 万
合计¥65-105 万

建议的最小验证:先花 ¥15 万(1 个工程师 3 个月 + 硬件),跑通 demo + 拿到合作意向,再决定是否扩到 ¥65-105 万。硬件和人力都是确定性投入,真正的风险是你能不能找到一个愿意让你处理数据的客户

BaseMatrix 的起点与约束

我们是什么

  • 刚刚进入市场的早期团队,技术和资本都有限
  • 不绑定任何特定采集设备,目前使用奥比中光 EGO 系列但保持开放
  • 没有预设定位 — 定位由市场竞争和商业机会决定,不是自上而下规划的
  • 核心能力需要在实践中构建,不能假设已经拥有

我们面对的现实

  • 硬件端:DexUMI 已被三家公司产品化,采集硬件正在快速商品化 — 我们不可能在硬件上建立壁垒
  • 采集端:光轮智能等头部公司在建采集生态,有能力低成本获取海量数据 — 我们不可能在数据量上竞争
  • 客户端:头部机器人公司(穹彻、银河通用、智元)有自建数据管线的能力和意愿 — 他们短期不是我们的客户
  • 仿真端:世界模型正在改变"数据靠采集堆量"的逻辑 — 纯靠人力采集的模式可能被仿真替代

但有一件事没人做好:不管谁用什么设备采集,数据都需要同步、标注、质检、格式化。不管行业走基础模型路线(DYNA-2/π0.7 需要海量精确标注的人类视频)还是遥操作路线(智元数千操作员的数据需要质检),L1-L4 数据治理都是刚需。灵巧手厂商不想做这事(不是他们的主业),光轮智能覆盖不了所有设备和场景。数据治理是价值链上最稳定的环节 — 不管技术路线怎么变,这一步都不能跳过。

设备无关:处理所有来源的数据
BaseMatrix 不绑定特定采集设备。以下是市场上主要的采集设备类别及其数据特征。我们的标注和质检管线应能处理所有来源。
设备类别代表产品价格区间数据流适用场景
EGO 穿戴相机 奥比中光 EGO 系列 ¥1-3 万 RGB ×2-4 + IMU 第一人称视觉
DexUMI 灵巧手 BeingBeyond U1 / 灵御智能 ¥5-15 万 鱼眼 RGB + SLAM + 夹爪状态 精细操作位姿
灵巧手系统 星动纪元 XHAND 1 ¥10-20 万 多关节角度 + 力矩 灵巧操作
视触觉传感器 GelSight Mini / DIGIT ¥0.5-2 万/个 接触面纹理图像 力敏感任务(附加模块)
腕部 RGB WristCam 含于 EGO 套件 近景 RGB + IMU 手部操作近景
按任务选配(不是全上)
任务类型推荐最小配置可选附加处理复杂度
桌面抓取/分拣EGO 双目 + UMI Finger ×2WristCam
工具使用/装配EGO 双目 + UMI Finger ×2GelSight
厨房/家务EGO 双目 + WristCam ×2
精细灵巧操作BeingBeyond U1 或 XHAND 1EGO 双目
仅第一人称视觉EGO 双目(单设备)最低

设备无关策略:我们接收客户或合作伙伴用任何设备采集的原始数据,统一进入标注管线。不强制客户使用特定设备。灵巧手厂商的客户用他们的设备采集,我们处理数据 — 这就是合作的基础。

力觉/触觉:当前的短板与策略

EGO + UMI 采集的数据 = 视觉 + 运动学(无力觉)

  • 缺失:"拧到多少力矩停止"、"捏到多大力会碎" 这类力敏感信息,纯视觉+位姿无法覆盖
  • 短期策略:坦诚告诉客户。视觉主导的操作(抓放、分拣、工具拿取)不需要力觉 — 这个市场已经足够大
  • 中期路径:在 UMI 末端增加 GelSight Mini 或 DIGIT(USB 相机协议,现有 Hub 可原生采集),或接入合作伙伴带力觉的灵巧手数据
  • 当前市场现实:90% 客户的需求还在"视觉策略能跑通"阶段,力触觉需求集中在少数前沿客户
六层标注:从原始流到 AI-Ready
不管数据来自哪种设备,要达到可销售标准,都需要经过以下 6 层处理。这就是 BaseMatrix 的核心能力建设方向。
L1 ✓
时序同步
自研对齐
L2 ✓
6DoF 位姿
ORB-SLAM3
L3 ✓
手物交互
Hands23 + WiLoR + HaWoR
L4 ✓
语义标注
GPT-4o Vision
L5 ✓
质量验证
跨层校验
L6
格式封装
LeRobot v3
L1 时序同步与标定(自动化 95%)

多设备数据对齐 + 相机/IMU 联合标定

  • 多流时间戳对齐:硬件同步已由 Hub 完成(<1ms),后处理用 ROS2 做降采样到控制频率(15-30Hz)
  • 相机标定:Kalibr(ETH 开源)做 RGB/深度/IMU 内外参联合标定,鱼眼畸变校正
  • 手眼标定:Kalib(2024,基于 foundation model)无标记物手眼标定
  • 设备无关:标定流程适用于所有相机+IMU 组合,不限于奥比中光
已验证:Orbbec EGO 双目 1600×1300@30fps 鱼眼立体 + IMU 1000Hz,最近邻配对 max <182μs,帧间隔 33.33ms ± 0.03ms,零丢帧
L2 6DoF 位姿提取(核心价值)

从视频+IMU 提取每帧末端执行器的精确位姿

  • 方法:ORB-SLAM3 视觉-惯性模式处理鱼眼视频+IMU,输出 [x,y,z,qx,qy,qz,qw] SE(3) 位姿
  • 精度:UMI 论文报告 <6.1mm 位置误差
  • 替代:DPV-SLAM(2.5× 实时),DROID-SLAM/W(穿戴设备优化)
  • 特殊情况:如果数据来自带编码器的灵巧手(如 XHAND 1),关节角度直接读取,无需 SLAM
  • 处理时间:~1 GPU 小时/原始小时(1× RTX 4090)
已验证:ORB-SLAM3 stereo-inertial 模式(KannalaBrandt8 鱼眼),3 段录制全部成功,关键帧 56/37/36,轨迹合理(桌面操作场景头部微动)
L3 动作分段与关键帧(人工 15-20%)

三级串联:HOI-DETR → KEMO → ATLAS

  • HOI-DETR(自动前端):检测手-物交互事件(手碰了什么、什么类型的交互),输出交互边界帧 — 这是分段的天然锚点
  • KEMO(关键帧提取):基于 HOI-DETR 的交互事件 + 关节位移突变 + DINOv2 视觉去重,自动提取 PRE-CONTACT-PNR-POST 四帧
  • ATLAS(人工校正):TU Wien 2026,专为机器人操作设计,比 ELAN 快 44%。在自动分段结果上做人工边界校正和语义补充
  • 动作原语:PrimitiveVLA 11 类标准(grasp / place / push / pull / insert / press / twist / tilt / rotate / lift / move)
已验证(三层):L3 Hands23 手物交互(接触率 98.6%,87 个动作片段)+ L3b WiLoR 21 关键点 3D 手骨骼重建(5686 手部检测)+ L3c HaWoR 世界坐标手部 6DoF 轨迹(DROID-SLAM + Metric3D + MANO,2182 帧)
L4 语义/语言描述(人工 5%)

VLM 自动生成 + 人工审核

  • DeMiAn(NVIDIA 2026)4 通道:physical_motion / scene_composition / arm_pose / reasoning
  • 多样化:TREAD(2026)用 Gemini 2.5 Pro 生成多样化指令变体,语言泛化 +20%
  • 反事实:CAST(Berkeley 2025)在决策点生成 what-if 标签
  • 验证:DIAL 方法证明仅 3.5% 人工标注即可达到全人工同等效果
已验证:GPT-4o Vision 关键帧语义标注(每 2s 采样,38 帧),覆盖场景描述、物体状态/位置/功能、手部动作、任务阶段、空间关系,物体类别 27 种,空间关系 196 条
L5 具身迁移(长期跟踪 · 需重新定义)

WiLoR 3D 重建 → 运动学重定向 → SAM2+ProPainter 视觉迁移

  • WiLoR:3D 手部重建,输出精确手指关节角度和 mesh,让运动学重定向从 2D 升级到 3D
  • 运动学重定向:人手关节角度 → 目标机器人手的关节映射(URDF 模型)
  • SAM2 分割:像素级分割人手区域,生成时序一致的 mask
  • ProPainter 修复:光流引导视频修复,填补手部区域背景
  • 机器人渲染:在重定向后的位姿上渲染目标机器人 3D 模型
  • 效果验证:Phantom 2025 — 不做手部编辑成功率 = 0%,做了 = 84%

⚠️ 2026 行业现实:显式 L5 正在被两条主流路线绕过(详见第 02 节)

路线 A(基础模型):DYNA-2 / π0.7 / 1X 在模型内部解决跨具身,不需要逐帧重绘数据

路线 B(遥操作):智元/宇树直接用机器人采集,数据已经是目标形态

L5 的长期价值重新定义:不是"帮客户逐帧重绘视频",而是理解基础模型需要什么样的人类数据(第一人称视角、精确标注、力触觉)。技术储备保持跟踪,但不作为近期主要投资方向。当前重心应放在 L1-L4 + 仿真验证。

L6 格式封装
目标框架格式工具
ACT / ALOHAHDF5Forge 万能转换器
RLDS↔LeRobot↔Zarr↔HDF5↔ROS↔GR00T
Diffusion PolicyZarr (Blosc-lz4)
Open X-EmbodimentRLDS / TFRecord
LeRobot v3(事实标准)Parquet + MP4
GR00T (NVIDIA)自定义
五道关卡
基于 DROID(76K 轨迹,22% 废弃率)、VISTA、Scale AI(100K+ 小时)等行业实践。
1

采集实时质检

实时检测视野遮挡 >30%、运动模糊、同步丢帧。目标将无效采集从行业平均 22% 降到 <10%。如果合作伙伴采集,提供 QC SDK 让他们在采集端就过滤。

2

自动化轨迹筛选

PSD 频域:平滑度检测,底部 15% 废弃。VISTA 三轴:轨迹连续性 + 自碰撞 + 执行保真度。标定漂移:最差 1% 废弃。空闲段裁剪:>1s 无有效运动。

3

人工三遍审核

帧级(分割+关键帧)→ 事件级(分段边界+语言描述)→ 任务级(端到端播放)。ICC 标注员间一致性。金标准集 50 条定期复标检测漂移。高级审核员抽检 15-20%。

4

下游策略验证(差异化杀手锏)

PolaRiS:Gaussian Splatting 重建采集场景为仿真环境,训练 ACT/DP 测试成功率。验收标准:200 条 demo >85% 仿真成功率。客户可复现 — 提供仿真环境 + 训练脚本。

5

数据卡交付文档

标准化 DataCard:设备信息 / 采集 SOP / 质量统计(episode 数、废弃率、PSD 分布、IAA)/ 适配策略建议 / 已知限制 / 商业条款。

真实采集 + 仿真放大:改变经济模型
行业正在从"纯靠采集堆量"转向"少量精品真实 + 世界模型仿真放大"。这不是未来趋势,已经有多项验证。对资源有限的 BaseMatrix 来说,这可能是最重要的杠杆。
为什么仿真放大改变一切
+38%
仿真联合训练提升
(arXiv 2503.24361 实证)
10-80×
Genesis vs MuJoCo
(保守估计,营销称430K×)
8→60%
TARS 6D 数据成功率
0-shot
MuJoCo Sim2Real 迁移

传统纯采集 vs 混合路线

以单任务 1000 条 demo 为目标:

  • 纯采集路线:1000 条 × ¥50/条 = ¥50,000 — 全部人力成本,线性增长,不可复用
  • 混合路线:200 条真实种子(¥10,000)+ 世界模型生成 800 条变体(¥4,000 GPU)= ¥14,000 — 节省 72%
  • 而且混合路线的质量可能更高 — 仿真可以系统性覆盖光照变化、物体姿态变化、桌面布局变化等真实采集难以穷举的变体
关键技术与工具
技术状态做什么实用性评估
PolaRiS 论文公开 · 代码待确认 2-5 分钟单目视频 → 2DGS 重建 → TRELLIS 物体 → 仿真(arXiv 2512.16881) Stanford/Berkeley 验证,相关性优于 RLBench。项目页 polaris-evals.github.io 可用,但代码开源状态未确认
Genesis 开源 · Apache 2.0 比 MuJoCo/Isaac Gym 快 10-80×(营销称 430K× 但测试方法有争议),支持刚体/FEM/MPM/SPH/PBD 20+ 研究机构联合,速度优势明确但精度有取舍(最快模式无法做抓取),生态在建设中
NVIDIA Cosmos 代码 Apache 2.0
模型权重 NVIDIA License
Cosmos 3(2026.05),生成式世界模型。代码开源,但模型权重使用 NVIDIA Open Model License(非 Apache) GR00T Blueprint: Mimic 合成轨迹 → Cosmos 渲染 → Isaac Lab RL。生产级但需 NVIDIA GPU
MuJoCo Playground 开源 · 成熟 物理引擎 + 批量渲染器 + 训练环境一体,已验证 zero-shot sim2real Unitree G1/Go1、Franka、Berkeley Humanoid 已跑通 sim2real 闭环
MolmoBot 开源 · AI2 MuJoCo + 激进域随机化(物体/视角/光照/纹理/动力学),百万级轨迹 zero-shot 迁移到真实 Franka,证明纯仿真数据可行
Genie 2 不开源 · 演示级 单张图 → 可交互 3D 世界(DeepMind 2024) 仅 Google AI Ultra 订阅可用,不能接入标准训练管线
UniSim 不开源 · 内部 物理一致性视频预测世界模型(Google 2023) 无公开 API,不可用于外部数据生产
3D-VLA 开源 · 研究原型 3D 理解 + VLA 统一模型 学术代码,非生产级工具
混合数据管线
01
精品种子
200 条真实采集
02
场景重建
PolaRiS / 3DGS
03
世界模型放大
UniSim / Genie 2
04
仿真验证
MuJoCo / Isaac
05
混合数据集
真实 + 仿真

实证数据(arXiv 2503.24361,同行评审):仿真+真实联合训练平均提升真实任务成功率 38%,部分任务提升 30% 以上。包括仅在仿真中见过的场景也能泛化。RL-GSBridge(ICRA 2025)完整验证了 real→sim→real 闭环。这不是猜测,是已经被验证的方法。

对 BaseMatrix 的战略意义:你不需要跟光轮智能比采集量(你赢不了)。你需要做的是:让你处理的 200 条种子数据质量高到可以安全放大 5-10 倍。这就把竞争维度从"谁采集得多"转移到"谁处理得好" — 正好是你的能力建设方向。TARS Robotics 已证明 6D 数据可以让复杂操作成功率从 8% 提升到 60%。

世界模型的局限(诚实面对)

仿真不能完全替代真实 — 但可用工具已经够多

  • sim-to-real gap 依然存在:但 MuJoCo Playground 已在多个机器人上验证 zero-shot sim2real,gap 在缩小
  • Genie 2 / UniSim 不可用:前者仅 Google 内部/订阅,后者无公开 API。不要指望这些
  • 实用组合已明确:MuJoCo Playground(成熟 + 开源)+ Genesis(极速 + 开源)+ NVIDIA Cosmos(生产级 + Apache 2.0)
  • PolaRiS 可用:CC0 许可,2-5 分钟视频即可重建仿真环境,但代码开源状态需确认
  • 中国公司更偏真实数据:RoboMind(10 万条真实 demo 开源)、TARS(6D 采集),国内仿真引擎较少
  • 域随机化是关键:MolmoBot 证明激进域随机化(物体/视角/光照/纹理/动力学)可以让纯仿真数据 zero-shot 迁移到真实
推荐的实用仿真工具栈

短期可落地组合:

1. PolaRiS(场景重建): EGO 采集视频 → 2DGS 重建 → 仿真环境(2-5 分钟视频即可)

2. MuJoCo Playground(物理仿真): 在重建场景中生成操作轨迹,域随机化增广

3. Genesis(高速仿真): 需要大规模生成时切换到 Genesis(430,000× 实时速度)

4. NVIDIA Cosmos(视觉真实性): 仿真轨迹 + Cosmos 渲染 → 视觉上接近真实的合成数据

不推荐等待:Genie 2、UniSim、3D-VLA — 短期内不会开放给外部使用。

与灵巧手厂商共同面向客户
灵巧手厂商(BeingBeyond、星动纪元、灵御智能)自己也做数据采集和标注,但这不是他们的主业。BaseMatrix 可以成为他们的数据处理伙伴,共同面向机器人厂商销售"灵巧手 + 高质量数据"的组合方案。
合作逻辑
灵巧手厂商(BeingBeyond / 星动纪元 / 灵御智能) ├── 他们的核心:设计和销售灵巧手硬件 ├── 他们的痛点:客户买了手不知道怎么采集有用数据 └── 他们需要:一个靠谱的数据处理伙伴来提升硬件附加值 BaseMatrix ├── 我们的能力:数据标注、质检、格式化、具身迁移 ├── 我们的痛点:没有自己的硬件、采集团队有限 └── 我们需要:稳定的数据来源和客户渠道 合作模式: 灵巧手厂商 卖硬件 + 教客户采集 → 客户采集的原始数据 → BaseMatrix 做标注/质检/迁移 → 交付 AI-Ready 数据包给最终客户 → 或者灵巧手厂商用自己的采集团队采集 → 交给 BaseMatrix 处理 收入分配:按数据处理服务费结算,或联合定价
三种合作路径
A

纯服务模式:处理合作伙伴的数据

灵巧手厂商或其客户采集数据,BaseMatrix 提供标注 + 质检 + 格式转换服务。

  • 最轻资产:不需要自己采集设备和采集团队
  • 风险:沦为外包,利润薄,没有数据资产积累
  • 适合:起步阶段,验证标注管线能力
B

联合方案模式:硬件 + 数据打包销售

与灵巧手厂商联合,向机器人厂商销售"采集设备 + 数据处理 + 训练数据"的一站式方案。

  • 更高附加值:方案定价比纯服务高 3-5×
  • 客户价值清晰:买一套设备就能获得可用的训练数据
  • 需要证明:你的数据确实能让客户的策略训练成功
C

数据产品模式:卖标准化数据集

自己采集或采购原始数据,处理成标准化数据集(特定任务 × 特定机器人形态),以数据产品形式销售。

  • 最高利润:数据产品可以重复销售
  • 最高风险:需要预判客户需求,前期投入大
  • 适合:有了稳定的标注管线和客户关系之后

建议路径:A → B → C 逐步升级。先用 A 模式验证技术能力(帮灵巧手厂商处理他们的数据),再用 B 模式建立品牌(与厂商联合面向客户),最后用 C 模式建立数据资产(卖标准化数据集 + 仿真放大包)。每一步都需要上一步的能力作为基础。

资源约束下的最小可行架构
不是构建完美系统,而是用最少的投入跑通从"原始数据进 → AI-Ready 数据出"的全流程。
┌──────────────────────────────────────────────────────────┐ │ BaseMatrix Data Pipeline (MVP) │ ├─────────────┬──────────────┬─────────────┬───────────────┤ │ 接入层 │ 处理层 │ 标注层 │ 交付层 │ │ │ │ │ │ │ 多设备适配 │ ORB-SLAM3 │ HOI-DETR │ Forge 转换 │ │ (EGO/U1/ │ WiLoR │ ATLAS │ LeRobot v3 │ │ XHAND/ │ SAM2 │ Label Std │ HDF5/Zarr │ │ 自定义) │ ProPainter │ Rerun 可视 │ DataCard │ │ │ KEMO │ QC 看板 │ 样例视频 │ ├─────────────┴──────────────┴─────────────┴───────────────┤ │ 基础设施(MVP) │ │ MinIO / 本地 NAS │ PostgreSQL │ Celery 任务队列 │ │ 1-2× RTX 4090 起步 │ 云 GPU 弹性 │ Web 交付门户 │ └──────────────────────────────────────────────────────────┘
分阶段硬件投入
阶段硬件预算产能
起步(月 1-3) 1× RTX 4090 工作站 + 10TB NAS ¥3-5 万 ~30h 原始数据/月
验证(月 3-6) 升级到 2× 4090 + 30TB + 云 GPU 弹性 +¥2-3 万 ~60-80h/月
规模化(月 6+) 4× 4090 工作站 + 100TB NAS +¥5-8 万 ~100-150h/月
处理时间预算(按设备配置)
配置L1-L4 (同步+SLAM+分段+语义)L5 (具身迁移)L6 (格式)合计 GPU·h
最小(EGO + UMI×2)2-3h3-5h0.5h~6-8h
标准(+ WristCam)3-4h5-7h0.5h~9-12h
完整(全设备)4-5h6-8h0.5h~11-14h
无迁移(仅 L1-L4+L6)2-4h0.5h~3-5h
资源约束下的务实路径
不是追求完美管线,而是用最少投入验证每一步的商业可行性,再决定是否继续投入。
1

跑通管线 — 证明数据能用

月 1-3

目标:用自己的 EGO 设备采集 20-50 小时数据,跑通 L1-L4+L6 全流程,在开源 ACT 上训练出能跑的策略。

  • 搭建 SLAM + 同步 + LeRobot v3 导出的最小管线
  • 不做 L5 具身迁移(先跳过最重的环节)
  • 用跑通的 demo 视频证明"我们的数据能训出能用的策略"
  • 同时接触灵巧手厂商,了解他们的数据需求和痛点
投入:¥3-5 万硬件 + 3 个月时间
2

合作验证 — 帮别人处理数据

月 3-6

目标:找 1-2 个灵巧手厂商合作,处理他们或他们客户的数据(模式 A),验证标注管线对不同设备数据的兼容性。

  • 部署 HOI-DETR + ATLAS 标注链,建立人工 QC 流程
  • 证明你能处理 BeingBeyond U1 / XHAND 1 等不同设备的数据
  • 开始积累标注质量指标(IAA、PSD 分布等)作为销售武器
  • 同步研究 PolaRiS 场景重建,为 Phase 3 做技术储备
新增投入:+¥2-3 万硬件 + 标注团队建设
3

仿真验证 — 证明数据能训出好策略

月 6-12

目标:搭建仿真验证闭环,用成功率数字证明你的数据质量,从纯服务升级到联合方案(模式 B)。

  • 搭建 PolaRiS 场景重建 + MuJoCo 策略验证闭环
  • 推出"种子数据 + 仿真放大 + 验证报告"的打包方案
  • 与灵巧手厂商联合定价,面向机器人厂商销售
  • L5 具身迁移作为技术储备保持跟踪,不作为主要投资(行业正在模型层面解决跨具身)
新增投入:+¥5-8 万硬件 + 研发
4

上游供应 — 为基础模型公司提供数据

月 12+

前提:Phase 1-3 验证了技术能力和数据质量,有了稳定客户关系和质量口碑。

  • DYNA-2 需要 100 万小时、π0.7 需要 10,000 小时 — 基础模型公司对高质量人类操作数据有巨大需求
  • 定义标准化的"基础模型级"数据产品:第一人称视频 + 精确 L1-L4 标注 + 仿真验证报告
  • 利用仿真放大降低边际成本(模式 C)
  • 目标:成为基础模型训练数据的上游供应商
需视 Phase 1-3 验证结果和行业发展决定
十条关键判断
1

市场已经不是"极早期"了,头部正在加速。光轮智能 $20 亿估值、Q1 订单 ¥5.5 亿;觅蜂科技(智元孵化)数亿融资、目标千万小时产能。格局正在快速形成。BaseMatrix 的窗口不是"慢慢探索",而是尽快找到自己不可替代的位置

2

不绑定设备是正确策略。DexUMI 硬件被三家产品化,采集端正在快速商品化。绑定任何一家设备都是错误的 —— 你应该能处理所有来源的数据。"设备无关"不是弱点,而是作为数据处理伙伴的前提条件。

3

灵巧手厂商的合作窗口正在收窄。BeingBeyond 已推出 Being-Dex 完整闭环(采集→训练→部署,30分钟学新任务),灵御智能明确了"卖硬件→卖数据→卖能力"路线。他们正在向数据服务延伸。星动纪元目前最开放(XHAND 1 PRO 专注硬件),是最佳合作切入点。但所有合作窗口都有时效性

4

世界模型仿真放大是小公司的杠杆。你不可能在采集量上跟光轮智能竞争。但如果你能让 200 条精品种子通过世界模型安全放大到 1000 条,你的交付能力就跟他们有得一比。仿真放大的质量上限取决于种子数据质量 —— 这正好是你在建设的标注和质检能力。

5

光轮+觅蜂双巨头格局正在形成。光轮智能($20亿估值,仿真+合成数据,NVIDIA 核心伙伴)和觅蜂科技(智元背书,MEgo 硬件+平台,千万小时产能目标)正在从两个方向包夹市场。你的缝隙在于:他们的模式是标准化规模化,而灵巧手数据是碎片化定制化的 —— 每种手、每个任务、每个客户都不一样。做巨头不愿意做的定制活

6

显式 L5 正在被行业绕过,但 L1-L4 的价值在上升。DYNA-2(100万小时人类视频)、π0.7、1X 在基础模型内部解决跨具身迁移;智元/宇树用大规模遥操作直接采集。两条路线都绕过了"逐帧重绘人手→机器人手"。但两条路线都需要高质量的 L1-L4 数据:基础模型需要精确标注的人类视频,遥操作中心需要海量数据的质检和后处理。L1-L4 不是过渡,而是主战场

7

HOI-DETR + WiLoR 显著降低标注成本。HOI-DETR 自动检测手-物交互事件,让 L3 人工占比从 30-40% 降到 15-20%。WiLoR 提供 3D 手部重建,让 L5 运动学重定向从 2D 猜测升级到 3D 精确映射。两个开源工具,零采购成本。

8

验证闭环是唯一的信任建立方式。在一个没人做过大规模交易的市场里,客户凭什么相信你的数据有用?答案是:你在仿真中训练策略、展示成功率、提供可复现的验证脚本。"看,用我们的 200 条数据训练的策略,在仿真中 87% 成功率" —— 这比任何销售话术都有说服力。

9

终局可能是基础模型公司的上游数据供应商。DYNA-2 消耗 100 万小时人类视频,Physical Intelligence 消耗 10,000 小时跨具身数据,1X 消耗 900 小时第一人称视频。这些公司有模型能力但缺高质量标注数据。如果 BaseMatrix 能做到"设备无关采集 + 精确 L1-L4 标注 + 仿真验证质量证明",你的客户不只是灵巧手厂商和机器人公司,还包括训练基础模型的 AI 公司。这是一个比 L5 更大、更稳的市场。

10

你的客户花的是投资人的钱,这既是机会也是风险。H1 2026 ¥460 亿涌入具身智能,但 70% 只流向 20 家公司。整机厂商普遍亏损(优必选累计亏 ¥540 亿,Figure AI $390 亿估值基本无营收),真正赚钱的是数据层(光轮 Q1 ¥5.5 亿订单、海天瑞声 Q1 ¥9700 万)和上游零部件。资金链是 VC → 机器人公司 → 数据服务 → 循环。泡沫收缩时客户会消失。先花 ¥15 万验证(1 工程师 + 硬件 + BD),拿到合作意向后再决定 ¥65-105 万的完整投入。