一个资源有限的早期进入者,在快速变化的具身智能数据市场中,如何找到可行的商业路径。基于 2024-2026 最新学术研究、行业竞品和市场现实。
2023 年成立,累计融资超 ¥20 亿(蚂蚁集团领投),2 个月估值翻倍至 $20 亿。Q1 2026 新增订单 ¥5.5 亿。核心产品:Physical AI 仿真+合成数据平台(不只是采集,而是仿真+合成+评测),NVIDIA Newton 物理引擎核心指导委员会成员。数据复购率 >10×。绝对的行业第一,威胁最大。
U1(680g/11关节/<0.1mm追踪)+ Being-Dex 完整方案(采集→训练→部署,30 分钟学会新任务)。不只是硬件:Being-Dex 声称适配任意形态灵巧手,正在切入数据和模型服务。既是潜在伙伴也是潜在竞争者。
XHAND 1 PRO(2026.06):21 自由度全直驱,双编码器消除背隙,支持 VR/动捕/外骨骼操控。上市即交付(<1 月)。基于 DexUMI 框架,4 项任务 86% 成功率。以硬件为主但支持数据采集场景,潜在合作对象。
清华莫一林教授创办,千万级天使轮。核心是高精度低延迟遥操作系统。官方战略:"卖硬件→卖数据→卖能力"三步走 —— 计划自己做数据服务。短期是合作对象,但中长期会进入数据领域。
智元机器人(AgiBot)孵化的子公司,数亿元天使+轮融资。自有硬件 MEgo 系列 + MEgo Engine 数据治理平台。目标:2026 年千万小时产能,2030 年十亿小时。发起"蜂巢数据共创行动"建生态。有母公司背书的重量级竞争者。
头部公司自建数据管线。注意:智元已通过觅蜂科技将数据能力独立运营并对外输出。其他厂商的数据策略尚不明确,但内部管线是趋势。短期非直接客户。
本报告中频繁引用的 L1-L6 是 BaseMatrix 定义的数据处理管线层级。以下是速查,详细展开见第 06 节。
2026 市场的五个事实:
1. 资本密集但高度集中 — H1 2026 融资 ¥460 亿,但 70% 流向 20 家公司。光轮智能 6 轮融 ¥31 亿,银河通用单轮 ¥25 亿。小公司很难拿到钱。
2. 整机厂商普遍亏损 — 2026 出货 ~42,000 台人形机器人,但多为试点。平均毛利 <15%,优必选 2020-2025 累计亏损超 ¥540 亿。Figure AI $390 亿估值但基本无营收。
3. 数据层最接近真实营收 — 光轮 Q1 订单 ¥5.5 亿(复购率 >10×),海天瑞声 Q1 营收 ¥9700 万(+38.6%),宇树 2025 营收 ¥17 亿(净利 ¥2.78 亿)。
4. 资本正在从整机向数据迁移 — 核心组件/模型/数据层融资占比已超 60%,整机融资收缩至 30%。VC 在赌"卖铲子"而不是"挖金子"。
5. 中美都在抢数据基础设施 — 中国:光轮/觅蜂/凯望/枢途/星海图。美国:XDOF($7000 万 a16z)/Scale AI/Ropedia($2200 万)。DoorDash 付 800 万骑手录日常操作卖给机器人公司。
核心思路:用海量人类视频预训练基础模型,模型内部学会物理直觉和空间推理,再用少量机器人数据微调。不需要在数据层面做显式的人手→机器人手视觉重绘。
| 公司 | 方法 | 数据规模 | 关键进展 |
|---|---|---|---|
| DYNA Robotics | DYNA-2 世界-动作模型 | 100 万小时人类第一人称视频 | 跨机械臂/人形/灵巧手零样本迁移,新任务 13 分钟适配(2026.08) |
| 1X Technologies | 世界模型 + NEO | 网络视频 → 900h 人类第一人称 → 70h NEO 微调 | NEO 自主学习新技能,$20K 预售(2026.01) |
| Tesla Optimus | 纯相机采集 + Digital Dreams 合成 | 放弃动捕,5 相机头盔+背包录制人类自然操作 | 1000+ Gen 3 已部署工厂产线(2026.01) |
| Physical Intelligence | π0.7 通用机器人基础模型 | 10,000h / 7 种机器人 / 68 任务 + OXE 开源数据 | 零样本跨具身泛化,$4 亿+融资(2026.04) |
| 光轮智能 | EgoSuite 人类行为数据平台 | Real2Sim2Real 闭环,跨具身操作经验积累 | $20 亿估值,Q1 $1 亿订单,NVIDIA 核心伙伴 |
| 戴盟机器人 | daimon-TWM(Task World Model) | 蚂蚁领投 + 汇川/运营商/招商局战略股东 | 股东即客户模式,自带工厂/港口/物流部署场景 |
路线 A 对数据服务商的含义:这些公司需要的不是"帮我把人手画面改成机器人画面",而是大量高质量的人类第一人称操作视频 + 精确的动作标注。他们的模型内部解决跨具身迁移。你的价值在于提供干净、标准化、精确标注的 L1-L4 数据。
核心思路:数据直接用目标机器人采集,通过 VR/动捕/力反馈遥操作控制。采出来的数据已经是目标具身形态,不需要迁移。
| 公司 | 方法 | 规模 | 关键进展 |
|---|---|---|---|
| 智元机器人 AgiBot | 遥操作数采中心 + 精灵 G2 | 上海/深圳数十个中心,数千名操作员 | 第 10,000 台下线,宣布 2026"部署元年" |
| 宇树科技 Unitree | G1-D 全栈数采平台 + LeRobot | 标准化采集+开源数据集 | Unitree_il_lerobot 框架开源,HuggingFace 公开数据 |
| Figure AI | Helix VLA + BMW 工厂遥操作车队 | BMW 产线实际部署 | Figure 03 开发中,更高载荷+运动能力 |
路线 B 对数据服务商的含义:这些公司的遥操作中心产生海量原始数据,但仍需要质检、动作分段、语义标注、格式转换。智元的数千名操作员采集的数据不可能全部高质量 — 数据治理需求巨大。
L5(人手→机器人手的显式视觉重绘)正在被两侧挤压:
• 路线 A 从上面绕过:基础模型在神经网络内部解决跨具身迁移,不需要逐帧改写数据
• 路线 B 从下面绕过:直接用机器人遥操作采集,不存在跨具身问题
• 目前仍在做显式 L5 的:RoboPaint(学术,3D Gaussian Splatting 视觉重绘)、光轮 EgoSuite(平台级,不是单条数据服务)
结论:L5 作为"BaseMatrix 对外出售的数据处理服务",可能在商业化之前就被行业技术路线绕过。但 L1-L4 的需求在两条路线下都是刚需。
即便显式 L5 正在被绕过,跨具身迁移的学术研究仍在快速推进 — 但方向已经从"改写数据"变成"统一表征":
| 方法 | 核心思路 | 进展 |
|---|---|---|
| LAP(语言-动作预训练) | 语言作为跨具身的统一表征,零样本迁移 | arXiv 2602.10556 |
| CMU 世界模型方法 | 环境动力学是具身无关的,世界模型做统一接口 | CMU Robotics Institute 2026 |
| OXE-AugE | 大规模跨具身数据增强(Open X-Embodiment) | 22 种机器人 / 1M+ 轨迹 |
| RoboPaint | 3DGS 场景重建 + Dex-Tactile 联合重定向 | arXiv 2602.05325,学术原型 |
对 BaseMatrix 的启示:L5 的长期价值不在于"逐帧视觉重绘",而在于理解基础模型需要什么样的人类数据。DYNA-2 需要 100 万小时第一人称视频,1X 需要 900 小时,Physical Intelligence 需要 10,000 小时。这些数据的采集、同步(L1)、位姿提取(L2)、动作分割(L3)、语义标注(L4)正是 BaseMatrix 能做的事。做基础模型公司的上游数据供应商,比做一个可能被绕过的 L5 处理服务,路径更稳。
除了路线 A/B 之外,一条新的技术路径正在浮现:不需要任何专业采集设备,仅用普通第一人称 RGB 视频就能提取机器人可用的动作信号。这意味着"采集硬件"这个门槛正在被纯软件管线削平。
| 方法 | 输入 | 输出 | 精度 | 速度 |
|---|---|---|---|---|
| MacrodataLabs(WiLoR+HaWoR+VGGT-Omega) | 普通第一人称 RGB 视频 | 手腕 + 20 指关节真实尺度 3D 轨迹 | 52mm MPJPE(HOT3D) | 15.5 FPS 端到端 |
| UMI + ORB-SLAM3(当前 L2 管线) | 鱼眼 RGB + IMU + 专业标定 | 末端执行器 SE(3) 位姿 | <6.1mm 位置误差 | 离线处理 |
精度差 8 倍,但趋势值得跟踪:
• 52mm 够用的场景:基础模型预训练(DYNA-2 需要的是海量数据 + 粗动作信号,不需要亚厘米精度)、粗操作(抓放/分拣)、世界模型训练
• 52mm 不够用的场景:精细装配、工具使用、灵巧手操作 — 这些仍然需要 SLAM+IMU 或遥操作
• 趋势判断:2024 年 50mm 需要深度相机+IMU,2026 年纯 RGB 就能做到。如果这个速度持续,2-3 年内纯 RGB 可能逼近 <15mm — 届时专业采集硬件的优势将大幅缩小
对 BaseMatrix 的含义:采集硬件的壁垒在降低,但数据治理(L3 动作分段 + L4 语义标注 + 质检)的需求反而上升 — 越容易采集,数据量越大,越需要有人做治理。当前不需要集成纯 RGB 管线(精度不够),但应持续跟踪,等精度到 <15mm 时考虑作为 L2 的低成本替代方案。
| 公司 | 营收 | 利润 | 钱从哪来 |
|---|---|---|---|
| 宇树科技 | ¥17 亿(2025),+335% | 净利 ¥2.78 亿,毛利 60% | 卖机器狗 + 消费级人形,真客户付真钱 |
| 光轮智能 | Q1 订单 ¥5.5 亿 | 未公开 | 仿真/合成数据卖给机器人公司,复购率 >10× |
| 海天瑞声 | Q1 ¥9700 万,+38.6% | 上市公司,有利润 | 全栈 AI 数据标注(不只是具身) |
| DeepRobotics | 未公开 | 2025 年盈利 | 四足机器人 |
| 公司 | 估值 | 营收 | 真相 |
|---|---|---|---|
| Figure AI | $390 亿 | 基本无营收(第三方估千万美元级) | pre-revenue 的四千亿估值 |
| 优必选 UBtech | 上市 | 有营收 | 2020-2025 累计亏损超 ¥540 亿 |
| 大部分人形机器人公司 | 各种独角兽 | 2026 出货 ~42,000 台 | 多为试点,毛利 <15%,普遍亏损 |
| 觅蜂科技 | ¥10 亿 | 未公开 | 千万小时产能目标,付费客户数未知 |
专门做具身数据服务的公司已经不少。但大多数在做采集或平台,专门做"L1-L4 管线处理服务"的是少数。
| 公司 | 地区 | 融资/估值 | 定位 |
|---|---|---|---|
| 光轮智能 | 北京 | ¥80 亿估值,6 轮共 ¥31 亿 | 仿真+合成+评测平台 |
| 觅蜂科技 | 上海 | ¥10 亿估值 | 遥操作+无本体采集+标注平台 |
| 星海图 | 北京 | 联合亦庄共建 | 百万小时真实数据计划 |
| 枢途科技 | 深圳 | ¥5 亿估值 | 多模态数据集+标注规范 |
| 凯望数据 | 中国 | >¥1 亿(2026.08) | 具身数据基础设施 |
| 海天瑞声 | 北京 | 上市公司 | 全栈 AI 数据供应链 |
| XDOF | 美国 | $7000 万(a16z/Thrive) | 遥操作采集+标注,~20 客户含头部 AI 实验室 |
| Scale AI | 美国 | 巨头 | Physical AI Data Engine,100K+ 小时 |
| Ropedia | 新加坡 | $2200 万 Pre-A | 真实世界多模态交互数据 |
| Nferent AI | 美国 | 未公开 | 工厂/仓库物理 AI 数据 |
| DoorDash Tasks | 美国 | 自有 800 万骑手 | 付骑手录日常操作 → 卖给机器人公司 |
L1-L4 管线处理服务的竞争格局:大多数公司做的是采集(XDOF/觅蜂/DoorDash)或平台(光轮/Scale AI)。专门把原始 EGO/灵巧手数据跑 SLAM → 动作分段 → 语义标注 → 输出 LeRobot v3 格式的"管线处理即服务",目前做的公司可能是个位数 — 不是因为有壁垒,而是市场需求还没大到支撑很多公司专门做这件事。
你的客户花的是投资人的钱。
BaseMatrix 的目标客户(中小机器人公司)几乎全部靠 VC 融资运营。他们的付费能力取决于融资节奏,不取决于他们自己的营收。如果具身智能泡沫收缩(业内已承认估值有泡沫,需 1-2 年消化),你的客户可能会消失。
三种进场思路:
• 截流 VC 的钱 — 找融到资的机器人公司帮他们处理数据。快但不稳,泡沫收缩时客户消失。
• 找真正的终端需求 — 找已部署机器人的工厂/仓库做数据迭代。慢但稳,他们花自己的钱。
• 找"股东即客户"型公司 — 战略投资人自带部署场景的机器人公司(见下方戴盟案例)。融资和订单是同一件事,比纯 VC 模式更稳。
验证标准:找到一个愿意用自己的预算(不是 VC 的钱)为数据服务付费的客户 = 真正的市场信号。
戴盟机器人(DaiMon)最新一轮由蚂蚁集团领投。但真正值得关注的不是融资金额,而是股东表本身就是一张部署场景清单:
| 战略股东 | 代表领域 | 带来的部署场景 |
|---|---|---|
| 蚂蚁集团 | 金融科技 + AI 生态 | 资金 + 生态资源(同时重仓光轮智能) |
| 中国电信 + 中国移动 | 运营商 + 边缘计算 | 5G 远程遥操作基础设施 |
| 汇川技术 | 工业自动化龙头 | 工厂产线 — 中国最大的机器人落地场景 |
| 联想 | 全球制造 + 算力 | 全球制造场景 + GPU 计算资源 |
| 招商局 | 港口 + 物流 + 航运 | 港口/仓储 — 另一个主要机器人落地场景 |
戴盟同时发布了 daimon-TWM(Task World Model),走路线 A(基础模型内部解决跨具身),又一个需要海量操作数据训练的大模型。
这个模式的启示:
• 与 Figure AI 的对比:Figure AI $390 亿估值但基本无部署客户;戴盟的股东就是客户 — 融资和订单是同一件事
• 蚂蚁的组合拳:同时投光轮(数据层)和戴盟(整机+模型层),不管谁赢都赚。说明头部 VC 认为数据和整机都有价值
• 对 BaseMatrix 的含义:短期戴盟不是客户(自有数据管线+股东场景),但 daimon-TWM 规模化训练阶段可能需要外采数据。更重要的是,"股东即客户"型公司比纯 VC 支撑的公司更不容易消失 — 他们是更稳的潜在长期客户
如果 6 个月内要达到可接单交付的状态:
| 类别 | 明细 | 金额 |
|---|---|---|
| 人力(6 个月) | 1-2 管线工程师(¥20-35K/月)+ 2-3 标注员(¥8-12K/月) | ¥50-80 万 |
| 硬件(一次性) | 2× RTX 4090 工作站 + 30TB NAS + EGO 采集设备 | ¥10-15 万 |
| 云/杂项(6 个月) | AutoDL 弹性 GPU + 杂费 | ¥5-10 万 |
| 合计 | ¥65-105 万 |
建议的最小验证:先花 ¥15 万(1 个工程师 3 个月 + 硬件),跑通 demo + 拿到合作意向,再决定是否扩到 ¥65-105 万。硬件和人力都是确定性投入,真正的风险是你能不能找到一个愿意让你处理数据的客户。
但有一件事没人做好:不管谁用什么设备采集,数据都需要同步、标注、质检、格式化。不管行业走基础模型路线(DYNA-2/π0.7 需要海量精确标注的人类视频)还是遥操作路线(智元数千操作员的数据需要质检),L1-L4 数据治理都是刚需。灵巧手厂商不想做这事(不是他们的主业),光轮智能覆盖不了所有设备和场景。数据治理是价值链上最稳定的环节 — 不管技术路线怎么变,这一步都不能跳过。
| 设备类别 | 代表产品 | 价格区间 | 数据流 | 适用场景 |
|---|---|---|---|---|
| EGO 穿戴相机 | 奥比中光 EGO 系列 | ¥1-3 万 | RGB ×2-4 + IMU | 第一人称视觉 |
| DexUMI 灵巧手 | BeingBeyond U1 / 灵御智能 | ¥5-15 万 | 鱼眼 RGB + SLAM + 夹爪状态 | 精细操作位姿 |
| 灵巧手系统 | 星动纪元 XHAND 1 | ¥10-20 万 | 多关节角度 + 力矩 | 灵巧操作 |
| 视触觉传感器 | GelSight Mini / DIGIT | ¥0.5-2 万/个 | 接触面纹理图像 | 力敏感任务(附加模块) |
| 腕部 RGB | WristCam | 含于 EGO 套件 | 近景 RGB + IMU | 手部操作近景 |
| 任务类型 | 推荐最小配置 | 可选附加 | 处理复杂度 |
|---|---|---|---|
| 桌面抓取/分拣 | EGO 双目 + UMI Finger ×2 | WristCam | 低 |
| 工具使用/装配 | EGO 双目 + UMI Finger ×2 | GelSight | 中 |
| 厨房/家务 | EGO 双目 + WristCam ×2 | — | 中 |
| 精细灵巧操作 | BeingBeyond U1 或 XHAND 1 | EGO 双目 | 高 |
| 仅第一人称视觉 | EGO 双目(单设备) | — | 最低 |
设备无关策略:我们接收客户或合作伙伴用任何设备采集的原始数据,统一进入标注管线。不强制客户使用特定设备。灵巧手厂商的客户用他们的设备采集,我们处理数据 — 这就是合作的基础。
[x,y,z,qx,qy,qz,qw] SE(3) 位姿⚠️ 2026 行业现实:显式 L5 正在被两条主流路线绕过(详见第 02 节)
• 路线 A(基础模型):DYNA-2 / π0.7 / 1X 在模型内部解决跨具身,不需要逐帧重绘数据
• 路线 B(遥操作):智元/宇树直接用机器人采集,数据已经是目标形态
L5 的长期价值重新定义:不是"帮客户逐帧重绘视频",而是理解基础模型需要什么样的人类数据(第一人称视角、精确标注、力触觉)。技术储备保持跟踪,但不作为近期主要投资方向。当前重心应放在 L1-L4 + 仿真验证。
| 目标框架 | 格式 | 工具 |
|---|---|---|
| ACT / ALOHA | HDF5 | Forge 万能转换器 RLDS↔LeRobot↔Zarr↔HDF5↔ROS↔GR00T |
| Diffusion Policy | Zarr (Blosc-lz4) | |
| Open X-Embodiment | RLDS / TFRecord | |
| LeRobot v3(事实标准) | Parquet + MP4 | |
| GR00T (NVIDIA) | 自定义 |
实时检测视野遮挡 >30%、运动模糊、同步丢帧。目标将无效采集从行业平均 22% 降到 <10%。如果合作伙伴采集,提供 QC SDK 让他们在采集端就过滤。
PSD 频域:平滑度检测,底部 15% 废弃。VISTA 三轴:轨迹连续性 + 自碰撞 + 执行保真度。标定漂移:最差 1% 废弃。空闲段裁剪:>1s 无有效运动。
帧级(分割+关键帧)→ 事件级(分段边界+语言描述)→ 任务级(端到端播放)。ICC 标注员间一致性。金标准集 50 条定期复标检测漂移。高级审核员抽检 15-20%。
PolaRiS:Gaussian Splatting 重建采集场景为仿真环境,训练 ACT/DP 测试成功率。验收标准:200 条 demo >85% 仿真成功率。客户可复现 — 提供仿真环境 + 训练脚本。
标准化 DataCard:设备信息 / 采集 SOP / 质量统计(episode 数、废弃率、PSD 分布、IAA)/ 适配策略建议 / 已知限制 / 商业条款。
以单任务 1000 条 demo 为目标:
| 技术 | 状态 | 做什么 | 实用性评估 |
|---|---|---|---|
| PolaRiS | 论文公开 · 代码待确认 | 2-5 分钟单目视频 → 2DGS 重建 → TRELLIS 物体 → 仿真(arXiv 2512.16881) | Stanford/Berkeley 验证,相关性优于 RLBench。项目页 polaris-evals.github.io 可用,但代码开源状态未确认 |
| Genesis | 开源 · Apache 2.0 | 比 MuJoCo/Isaac Gym 快 10-80×(营销称 430K× 但测试方法有争议),支持刚体/FEM/MPM/SPH/PBD | 20+ 研究机构联合,速度优势明确但精度有取舍(最快模式无法做抓取),生态在建设中 |
| NVIDIA Cosmos | 代码 Apache 2.0 模型权重 NVIDIA License |
Cosmos 3(2026.05),生成式世界模型。代码开源,但模型权重使用 NVIDIA Open Model License(非 Apache) | GR00T Blueprint: Mimic 合成轨迹 → Cosmos 渲染 → Isaac Lab RL。生产级但需 NVIDIA GPU |
| MuJoCo Playground | 开源 · 成熟 | 物理引擎 + 批量渲染器 + 训练环境一体,已验证 zero-shot sim2real | Unitree G1/Go1、Franka、Berkeley Humanoid 已跑通 sim2real 闭环 |
| MolmoBot | 开源 · AI2 | MuJoCo + 激进域随机化(物体/视角/光照/纹理/动力学),百万级轨迹 | zero-shot 迁移到真实 Franka,证明纯仿真数据可行 |
| Genie 2 | 不开源 · 演示级 | 单张图 → 可交互 3D 世界(DeepMind 2024) | 仅 Google AI Ultra 订阅可用,不能接入标准训练管线 |
| UniSim | 不开源 · 内部 | 物理一致性视频预测世界模型(Google 2023) | 无公开 API,不可用于外部数据生产 |
| 3D-VLA | 开源 · 研究原型 | 3D 理解 + VLA 统一模型 | 学术代码,非生产级工具 |
实证数据(arXiv 2503.24361,同行评审):仿真+真实联合训练平均提升真实任务成功率 38%,部分任务提升 30% 以上。包括仅在仿真中见过的场景也能泛化。RL-GSBridge(ICRA 2025)完整验证了 real→sim→real 闭环。这不是猜测,是已经被验证的方法。
对 BaseMatrix 的战略意义:你不需要跟光轮智能比采集量(你赢不了)。你需要做的是:让你处理的 200 条种子数据质量高到可以安全放大 5-10 倍。这就把竞争维度从"谁采集得多"转移到"谁处理得好" — 正好是你的能力建设方向。TARS Robotics 已证明 6D 数据可以让复杂操作成功率从 8% 提升到 60%。
短期可落地组合:
1. PolaRiS(场景重建): EGO 采集视频 → 2DGS 重建 → 仿真环境(2-5 分钟视频即可)
2. MuJoCo Playground(物理仿真): 在重建场景中生成操作轨迹,域随机化增广
3. Genesis(高速仿真): 需要大规模生成时切换到 Genesis(430,000× 实时速度)
4. NVIDIA Cosmos(视觉真实性): 仿真轨迹 + Cosmos 渲染 → 视觉上接近真实的合成数据
不推荐等待:Genie 2、UniSim、3D-VLA — 短期内不会开放给外部使用。
灵巧手厂商或其客户采集数据,BaseMatrix 提供标注 + 质检 + 格式转换服务。
与灵巧手厂商联合,向机器人厂商销售"采集设备 + 数据处理 + 训练数据"的一站式方案。
自己采集或采购原始数据,处理成标准化数据集(特定任务 × 特定机器人形态),以数据产品形式销售。
建议路径:A → B → C 逐步升级。先用 A 模式验证技术能力(帮灵巧手厂商处理他们的数据),再用 B 模式建立品牌(与厂商联合面向客户),最后用 C 模式建立数据资产(卖标准化数据集 + 仿真放大包)。每一步都需要上一步的能力作为基础。
| 阶段 | 硬件 | 预算 | 产能 |
|---|---|---|---|
| 起步(月 1-3) | 1× RTX 4090 工作站 + 10TB NAS | ¥3-5 万 | ~30h 原始数据/月 |
| 验证(月 3-6) | 升级到 2× 4090 + 30TB + 云 GPU 弹性 | +¥2-3 万 | ~60-80h/月 |
| 规模化(月 6+) | 4× 4090 工作站 + 100TB NAS | +¥5-8 万 | ~100-150h/月 |
| 配置 | L1-L4 (同步+SLAM+分段+语义) | L5 (具身迁移) | L6 (格式) | 合计 GPU·h |
|---|---|---|---|---|
| 最小(EGO + UMI×2) | 2-3h | 3-5h | 0.5h | ~6-8h |
| 标准(+ WristCam) | 3-4h | 5-7h | 0.5h | ~9-12h |
| 完整(全设备) | 4-5h | 6-8h | 0.5h | ~11-14h |
| 无迁移(仅 L1-L4+L6) | 2-4h | — | 0.5h | ~3-5h |
目标:用自己的 EGO 设备采集 20-50 小时数据,跑通 L1-L4+L6 全流程,在开源 ACT 上训练出能跑的策略。
目标:找 1-2 个灵巧手厂商合作,处理他们或他们客户的数据(模式 A),验证标注管线对不同设备数据的兼容性。
目标:搭建仿真验证闭环,用成功率数字证明你的数据质量,从纯服务升级到联合方案(模式 B)。
前提:Phase 1-3 验证了技术能力和数据质量,有了稳定客户关系和质量口碑。
市场已经不是"极早期"了,头部正在加速。光轮智能 $20 亿估值、Q1 订单 ¥5.5 亿;觅蜂科技(智元孵化)数亿融资、目标千万小时产能。格局正在快速形成。BaseMatrix 的窗口不是"慢慢探索",而是尽快找到自己不可替代的位置。
不绑定设备是正确策略。DexUMI 硬件被三家产品化,采集端正在快速商品化。绑定任何一家设备都是错误的 —— 你应该能处理所有来源的数据。"设备无关"不是弱点,而是作为数据处理伙伴的前提条件。
灵巧手厂商的合作窗口正在收窄。BeingBeyond 已推出 Being-Dex 完整闭环(采集→训练→部署,30分钟学新任务),灵御智能明确了"卖硬件→卖数据→卖能力"路线。他们正在向数据服务延伸。星动纪元目前最开放(XHAND 1 PRO 专注硬件),是最佳合作切入点。但所有合作窗口都有时效性。
世界模型仿真放大是小公司的杠杆。你不可能在采集量上跟光轮智能竞争。但如果你能让 200 条精品种子通过世界模型安全放大到 1000 条,你的交付能力就跟他们有得一比。仿真放大的质量上限取决于种子数据质量 —— 这正好是你在建设的标注和质检能力。
光轮+觅蜂双巨头格局正在形成。光轮智能($20亿估值,仿真+合成数据,NVIDIA 核心伙伴)和觅蜂科技(智元背书,MEgo 硬件+平台,千万小时产能目标)正在从两个方向包夹市场。你的缝隙在于:他们的模式是标准化规模化,而灵巧手数据是碎片化定制化的 —— 每种手、每个任务、每个客户都不一样。做巨头不愿意做的定制活。
显式 L5 正在被行业绕过,但 L1-L4 的价值在上升。DYNA-2(100万小时人类视频)、π0.7、1X 在基础模型内部解决跨具身迁移;智元/宇树用大规模遥操作直接采集。两条路线都绕过了"逐帧重绘人手→机器人手"。但两条路线都需要高质量的 L1-L4 数据:基础模型需要精确标注的人类视频,遥操作中心需要海量数据的质检和后处理。L1-L4 不是过渡,而是主战场。
HOI-DETR + WiLoR 显著降低标注成本。HOI-DETR 自动检测手-物交互事件,让 L3 人工占比从 30-40% 降到 15-20%。WiLoR 提供 3D 手部重建,让 L5 运动学重定向从 2D 猜测升级到 3D 精确映射。两个开源工具,零采购成本。
验证闭环是唯一的信任建立方式。在一个没人做过大规模交易的市场里,客户凭什么相信你的数据有用?答案是:你在仿真中训练策略、展示成功率、提供可复现的验证脚本。"看,用我们的 200 条数据训练的策略,在仿真中 87% 成功率" —— 这比任何销售话术都有说服力。
终局可能是基础模型公司的上游数据供应商。DYNA-2 消耗 100 万小时人类视频,Physical Intelligence 消耗 10,000 小时跨具身数据,1X 消耗 900 小时第一人称视频。这些公司有模型能力但缺高质量标注数据。如果 BaseMatrix 能做到"设备无关采集 + 精确 L1-L4 标注 + 仿真验证质量证明",你的客户不只是灵巧手厂商和机器人公司,还包括训练基础模型的 AI 公司。这是一个比 L5 更大、更稳的市场。
你的客户花的是投资人的钱,这既是机会也是风险。H1 2026 ¥460 亿涌入具身智能,但 70% 只流向 20 家公司。整机厂商普遍亏损(优必选累计亏 ¥540 亿,Figure AI $390 亿估值基本无营收),真正赚钱的是数据层(光轮 Q1 ¥5.5 亿订单、海天瑞声 Q1 ¥9700 万)和上游零部件。资金链是 VC → 机器人公司 → 数据服务 → 循环。泡沫收缩时客户会消失。先花 ¥15 万验证(1 工程师 + 硬件 + BD),拿到合作意向后再决定 ¥65-105 万的完整投入。