Chapter 06 · Technology Roadmap
技术方向:身体已就位,大脑在断粮
本章回答"接下来会怎样":大脑/小脑/身体三条线的 3-5 年路线图、五大前沿的现状与卡点、数据基础设施的缺口、七个开放难题,以及八项子技术在 S 曲线上的精确位置。核心结论:2026-2028 的胜负手是数据引擎与灵巧操作。
三条线的 3-5 年路线图:身体快、大脑慢
2026-2028 的胜负手是数据引擎与灵巧操作;2028-2030 看路线融合与安全标准落地。下表 2027 及以后均为机构预测,非既成事实。
| 技术线 | 2026(现状) | 2027(机构预测) | 2028-2030(机构预测) |
|---|---|---|---|
| 大脑 | VLA 收敛至分层双系统;GR00T N1.6 / Gemini Motion Transfer 跨本体验证;共识"限制 VLA 的不是架构而是数据引擎" | 结构化环境多任务部署成主流;世界模型与 VLA 融合深化 | 类脑 / 认知架构工程化(NeuroVLA);通用大脑需千万小时级数据——数据缺口决定成熟节奏 |
| 小脑 | RL + 全身控制基本成熟,行走/楼梯/搬运进入量产验证;基础模型化运动控制出现 | 灵巧操作取代运动控制成为主战场("Manipulation is the new frontier") | 全身闭环 VLA(手眼脑协同)、动态精细力控成差异化能力 |
| 身体 | 量产元年:2025 出货 1.33 万台(Omdia),2026 预计约 6 万台;工信部预计中国产量破 10 万台 | 整机成本逼近 10 万元经济交叉点;电子皮肤成灵巧手标配 | 出货预测分歧极大(见下表):高盛 2035E 650 万台 vs BCG 提示的分析师区间 |
出货预测:机构分歧有多大
| 机构 | 口径 | 预测 |
|---|---|---|
| 高盛 | 2035E 全球出货 | 650 万台 / 约 1380 亿美元(机构预测,较此前上调) |
| 美银 BofA | 2030E 全球出货 | 约 120 万台(机构预测) |
| BCG | 2030E 分析师区间 | <100 万 ~ 600 万+ 台——机构分歧 6-12 倍 |
大脑 / 小脑 / 身体三条线的 3-5 年路线:实线框为 2026 已发生的事实,虚线框为机构预测;身体线最快、大脑线最慢——数据缺口决定成熟节奏。
五大前沿:现状、卡点与时间表
每张卡回答三个问题:走到了哪(现状)、卡在哪(卡点)、还要多久(时间表)。"Manipulation is the new frontier"——灵巧操作是 2027 年公认的主战场。
① 灵巧操作 导入期
现状 π0.5 实现跨新居开放世界泛化——核心洞察"50 个家庭各 1 小时 > 1 个家庭 50 小时",数据多样性比数据量重要;World Labs 零机器人数据自主运行 1 小时。
卡点 可变形物体(衣物/食物)接触动力学建模困难;仿真策略真机大幅退化(RoboFolDeX 基准结论);长时序任务错误累积、无恢复机制。
时间表 2026-2027 结构化场景工具使用规模化;2028 前后可变形物体操作进入商用试点(机构预测)。
卡点 可变形物体(衣物/食物)接触动力学建模困难;仿真策略真机大幅退化(RoboFolDeX 基准结论);长时序任务错误累积、无恢复机制。
时间表 2026-2027 结构化场景工具使用规模化;2028 前后可变形物体操作进入商用试点(机构预测)。
② 触觉感知 导入 → 成长拐点
现状 2026 年电子皮肤销量同比 +10 倍、成灵巧手量产标配;全球柔性触觉传感器 2025 约 26.5 亿美元 → 2029 预计 53 亿+ 美元。
卡点 无大规模统一触觉数据集(无法像视觉一样预训练);耐久与标定漂移;visuo-tactile VLA 刚起步。
时间表 销量先行、生态未成型;帕西尼等玩家 4 个月融资累计 10 亿元——资本先行于技术收敛。
卡点 无大规模统一触觉数据集(无法像视觉一样预训练);耐久与标定漂移;visuo-tactile VLA 刚起步。
时间表 销量先行、生态未成型;帕西尼等玩家 4 个月融资累计 10 亿元——资本先行于技术收敛。
③ 世界模型 导入期
现状 Genie 3(720p/24fps 实时可交互、分钟级一致性)、NVIDIA Cosmos 3(全模态世界基础模型)、V-JEPA 2(预测表征)密集发布。
卡点 生成式世界模型物理一致性不足(长程漂移);直接当策略训练器尚无大规模验证。
判断 与 VLA 是互补而非替代——用视频学物理规律、提供可扩展仿真训练,直击数据瓶颈(Bessemer 判断)。
卡点 生成式世界模型物理一致性不足(长程漂移);直接当策略训练器尚无大规模验证。
判断 与 VLA 是互补而非替代——用视频学物理规律、提供可扩展仿真训练,直击数据瓶颈(Bessemer 判断)。
④ Sim-to-Real 攻坚中
现状 Isaac Lab 成事实标准;MuJoCo(MJX GPU 化)以物理精度见长;Genesis 主打生成式场景。
卡点 动力学 gap(接触 / 摩擦 / 可变形体)仍未解决;仿真精度足够高后,域随机化退居兜底手段。
时间表 与灵巧操作同进退——sim2real 不破,精细操作难以规模商用(无独立时间表)。
卡点 动力学 gap(接触 / 摩擦 / 可变形体)仍未解决;仿真精度足够高后,域随机化退居兜底手段。
时间表 与灵巧操作同进退——sim2real 不破,精细操作难以规模商用(无独立时间表)。
⑤ 安全与标准 制定中
现状 工信部标准化技术委员会 2025-12 成立;《人形机器人与具身智能标准体系(2026 版)》发布,测试规范提出人机交互 / 自主决策 / 任务泛化三维要求。
卡点 人形整机安全与 AI 生成行为代码尚无 ISO 专门标准(现有 ISO 10218/15066/13482 + UL 3300 均非人形专用);人机协作仍套用协作机器人旧标准。
时间表 人形专用安全规范(碰撞防护 / 限速 / 急停)的落地时间,将决定家庭场景的放行时点。
卡点 人形整机安全与 AI 生成行为代码尚无 ISO 专门标准(现有 ISO 10218/15066/13482 + UL 3300 均非人形专用);人机协作仍套用协作机器人旧标准。
时间表 人形专用安全规范(碰撞防护 / 限速 / 急停)的落地时间,将决定家庭场景的放行时点。
数据基础设施:比灵巧手更深的瓶颈
全球合规机器人数据约 50 万小时,而通用大脑需要千万小时级——差 1-2 个数量级。架构趋同之后,数据是最终壁垒:供给侧(谁能低成本采集)与需求侧(谁付钱买数据)都未闭环。
① 格式统一 已成标准
Hugging Face LeRobot 格式(v3.0)成为数据事实标准——跨本体数据的互操作有了通用底座,开源社区与厂商数据集开始向同一格式收敛。
② 采集网络 未闭环
全国建成 / 在建 106 家集中式数采中心、84 家投运,但未形成稳定商业闭环;真机遥操作贵、慢、场景窄,仿真自动采集、人类第一视角可穿戴、无本体动捕等新方式并行。
③ 要素市场 起步
北京石景山首发具身智能数据要素跨境流通平台;亿欧预计 2031 年中国数据集市场占全球约 50%(机构预测)。
④ 合规红线 机制未定
家庭私密空间原始数据原则上不回传;数据权属与利益分配机制未定——家庭场景"数据最饥渴、合规约束最严"的矛盾待解。
开放难题清单:七个"还差多远"
这七个问题没有一个是"再等一年就能自动解决"的——每个都对应明确的剩余距离,也是判断厂商技术叙事成色的试金石。
| 难题 | 主流解法 | 剩余距离 | 状态 |
|---|---|---|---|
| 长尾泛化 | VLA 异构共训 + 互联网数据 | 到开放环境全任务,差 1-2 个数量级的数据 | 攻坚中 |
| 能耗 / 续航 | 高比能电池、换电、轮式妥协 | 2-4h 续航 vs 工业换班需求;换电是绕过而非根治 | 基本绕过 |
| 耐久 / 可靠 | 关节寿命工程、冗余、预测性维护 | 无厂商公开 MTBF(估算 <500h vs 工业机器人 6-8 万小时);工业级 7×24 未证明 | 未解决 |
| 双足极端地形 | RL 运动策略 + 视觉地形感知 | 冰面 / 坍塌等极端工况;动态稳定性理论未闭合 | 攻坚中 |
| 认知 / 因果推理 | LLM/VLM 分层大脑 + 世界模型推演 | 因果理解与长期记忆缺失;失败恢复靠人 | 未解决 |
| 跨本体任务迁移 | Motion Transfer、统一动作空间 | 异构本体动作语义对齐未解 | 未解决 |
| 触觉闭环 | 视触觉传感器 + VLA | 触觉数据规模比视觉小几个量级(导入期) | 未解决 |
技术成熟度:八项子技术的 S 曲线定位
把八项子技术放到同一条 S 曲线上,就能看清"哪些故事已经讲完、哪些才刚开头":运动控制与导航已过最陡段,灵巧操作与世界模型仍在导入期。
八项子技术 S 曲线定位(2026-10 判断):左下为技术萌芽、右上为成熟——"动得起来"已经普及,"动得巧、想得通"仍在导入期。
| 子技术 | 曲线位置 | 依据 |
|---|---|---|
| 运动控制(行走) | 成长期后段 | RL 跑通、进入量产验证、差异化收窄——头部团队已非壁垒 |
| 导航 | 成熟期早段 | 室内 SLAM 商品化多年 |
| 操作(抓放 / 简单工具) | 成长期早段 | 结构化场景商用开始 |
| 灵巧操作(精细 / 可变形) | 导入期 | 无商用方案,卡在 sim-to-real 与触觉 |
| 认知 / 任务规划 | 导入期后段 | 双系统初现、长程自主未破 |
| 触觉感知 | 导入 → 成长拐点 | 销量 +10 倍但生态未成型 |
| 灵巧手硬件 | 成长期早段 | 三路线并存、成本耐久待收敛 |
| 世界模型 | 导入期 | 能力演示级、训练闭环未验证 |
本章数据来源与置信度
核心来源:主报告技术方向维度(三线路线图、五大前沿、开放难题、S 曲线定位)、《本体与模型深度解析》(难点效果分级)、《人形机器人与具身智能标准体系(2026 版)》等政策原文。高置信:Isaac Lab 事实标准地位、LeRobot 格式、标准体系文件、π0.5"50 个家庭"洞察(多源交叉)。中置信:2027 及 2028-2030 路线图均为机构预测(高盛 2035E 650 万台 / BofA 2030E 约 120 万台 / BCG 提示的分析师区间分歧 6-12 倍),灵巧操作 2028 商用试点为机构预测。未核实:各路线精确商用时间表。数据截至 2026-10-09,仅供学习研究,不构成投资建议。