大脑·模型技术:不是不聪明,是缺经验
模型侧的难点不是"听得懂、认得出"——语义理解与感知已被 VLM 基本解决,而是"做得对、错了能自己改"。当前真实水平:训练域内任务成功率 85-98%,但跨场景断崖式下跌、长时序误差累积且没有恢复机制。一句话:大脑的"知识面"和"反应速度"都有了,缺的是经验(数据差 1-2 个数量级)和自我纠错(闭环)。
一句话认知:知识面和反应速度都有了,缺的是经验和纠错
大脑的两件旧难题——"知识面"(VLM 语义理解)和"反应速度"(快慢双系统)——2026 年都已经变成工程标配。
真正卡住"无人化"的是两件新难题:经验——全球合规机器人数据约 50 万小时,通用大脑需要千万小时级,差 1-2 个数量级;自我纠错——机器人执行了一个不准确的动作后,真实环境状态已偏离预测,误差不是衰减而是滚动放大,且当前系统没有"发现失败 → 重试 → 恢复"的闭环。
域内 85-98% 的仿真成功率,掩盖不了这两块短板。
八大难点与效果分级:一个已过时,三个在攻坚,四个没解决
八个难点不是并列的:推理频率是唯一已被工程化解决的难点(也是 2025 年最重要的架构发明);数据与泛化在攻坚;而长时序误差累积被公认为"比数据更深"的瓶颈——它就是"演示视频能完成 30 秒任务、工厂里 2 小时任务跑不完"的原因。
| 难点 | 本质矛盾 | 当前方案 | 效果 |
|---|---|---|---|
| ① 数据饥渴 | 全球合规数据约 50 万小时 vs 通用大脑需千万小时级 | 四种数据飞轮:真机遥操作 / 人类演示 / 仿真合成 / 网络视频 | 攻坚中 供给侧在铺,商业闭环未通 |
| ② 泛化断崖 | 域内成功率高、域外崩溃 | 异构共训 + 数据多样性优先("50 家庭定律") | 攻坚中 "新居级"开放世界刚达到 |
| ③ 长时序误差累积 | 小误差滚动放大、无重试恢复机制 | 世界模型前瞻推演 + RL 后训练(π*0.6 RECAP) | 未解决 比数据更深的瓶颈 |
| ④ 推理频率 vs 参数 | 大模型聪明但慢:VLM 秒级推理 vs 控制需 50-200Hz | 快慢双系统(Helix 范式) | 已解决 唯一被工程化解决的难点 |
| ⑤ 跨本体迁移 | 人形 / 机械臂 / 轮式的动作语义不对齐 | Motion Transfer、统一动作空间 | 未解决 公认弱点 |
| ⑥ 评估体系失效 | 仿真基准饱和、无法区分优劣 | RoboArena 真机评测、真机挑战赛 | 攻坚中 向真机评测转向中 |
| ⑦ 触觉缺失 | 接触丰富任务(插拔 / 揉搓)在"盲抓" | 视触觉 VLA、触觉世界模型 | 未解决 导入期 |
| ⑧ 记忆与因果 | 无长期记忆、不懂物理因果 | VLM 推理 + 世界模型推演 | 未解决 失败恢复仍靠人 |
三场架构之争,2026 年的收敛形态
端到端 vs 分层、VLA vs 世界模型、自采数据 vs 外部数据——三场争论在 2026 年都有了阶段性答案:分层成主流、融合成共识、数据成壁垒。
之争一:端到端 VLA vs 分层架构
- 无信息瓶颈,数据驱动上限高
- 可解释性差,数据需求极高
- 代表:特斯拉 FSD 式路线、PI π 系列早期
- Figure Helix(2025.2)确立范式:System 2 = 7B VLM,7-9Hz 慢推理规划;System 1 = 80M 轻量策略,约 200Hz 连续控制
- Helix 02 扩展到全身控制
- 2026 年已成工程主流
之争二:VLA vs 世界模型——从对峙到融合
2024-2025 年两条路线对峙:VLA 拟合动作分布、世界模型学习环境动力学。2026 年的核心变量是融合——头部模型几乎都变成了"世界模型预训练 + 动作解码"的混合体。
之争三:数据策略——架构趋同后,数据是最终壁垒
第三场之争不在模型侧,而在数据侧:真机遥操作、人类第一视角、仿真合成、网络视频四种飞轮各有硬伤,谁先跑通"低成本 + 高质量 + 持续供给"的数据引擎,谁就握住下一阶段的胜负手。→ 详见第 5 节"数据引擎"。
快慢双系统:2025 年最重要的架构发明
矛盾很直接:7B 级 VLM 推理一次要百毫秒级,而全身控制需要 50-200Hz。解法是"慢大脑 + 快小脑":System 2 慢速推理做规划,System 1 轻量网络高频输出控制,中间靠 latent 变量桥接。英伟达 GR00T N1 采用同构设计,该范式已成行业标配。
数据引擎:最大的瓶颈,也是最终的壁垒
四种数据飞轮各有硬伤,没有一种能单独赢。当前数据规模与 LLM 相差数个数量级——这就是"大脑缺经验"的量化含义。
四种数据飞轮对比
| 飞轮 | 代表 | 优势 | 硬伤 |
|---|---|---|---|
| 真机遥操作 | 特斯拉数据员(8h 班次产出约 4h 可用视频);智元 AgiBot World(100 台真机、百万条轨迹) | 质量最高 | 贵、慢、场景窄 |
| 人类第一视角 | 苹果 ARMADA / EgoDex(829 小时,最大灵巧操作数据集);ALOHA / UMI | 采集便宜、可众包 | 跨本体 gap(人手 → 机械手) |
| 仿真合成 | 英伟达 Cosmos 生成神经轨迹(DreamGen);银河通用主打百亿帧 | 边际成本趋零 | 动力学 gap(接触 / 可变形体)未解 |
| 网络视频 | π0.5 / UWM 混训 | 量无限 | 只有语义先验、无动作标签 |
数据规模刻度(示意)
示意宽度(按对数感觉绘制),仅供感知数量级差异,非等比;"条轨迹"与"小时"为不同计量单位,不可直接换算。Open X-Embodiment 含 22 种本体,开创跨本体预训练;AgiBot World 把工业级数据提升 10 倍,但全是"可复现实验室 / 工厂场景"——家庭无序环境数据依然接近空白。
数据飞轮闭环:部署即采集
四种数据源解决"从 0 到 1"的冷启动,而真正的复利来自闭环:机器人每部署一天,就在为下一版模型生产数据。π*0.6 的 RECAP(自主经验上的 RL 后训练)第一次把这个回路跑出效果。
训练范式演进:从"抄动作"到"想象后果"
动作生成范式六年走了七步:行为克隆只会模仿,扩散策略解决多模态动作,Flow Matching 成为当前主流动作头,RL 后训练补上"自我改进",世界模型预训练补上"物理常识"。
各家技术哲学对比:十条路线,三种赌法
十条路线本质是三种赌法:绑本体(特斯拉、宇树——模型为自家机器服务)、不绑本体卖模型(PI、DeepMind、自变量——赌大脑价值 > 本体价值)、卖铲子建生态(英伟达——平台化多本体)。估值最高的两家 Figure($390 亿)与 PI(传 $110 亿)赌同一个终局,下注路径完全相反。
| 公司 | 架构路线 | 数据来源 | 本体绑定 | 开源策略 | 代表模型 |
|---|---|---|---|---|---|
| 特斯拉 | FSD 式端到端 | 员工遥操 / VR / 工厂自采 | Optimus 强绑定 | 不开源 | Optimus 内部系统 |
| Figure | 分层 VLA(快慢系统) | 自家家庭 / 工厂遥操 | Figure 03 | 闭源 | Helix 2025.2、Helix 02 |
| Physical Intelligence | 通用 VLA + RL 后训练 | 多本体遥操 + 真机经验(RECAP 飞轮) | 不绑定 | openpi 开源 | π0 → π0.5 → π*0.6 |
| 英伟达 | WAM 世界动作模型 + 仿真飞轮 | 仿真神经轨迹 + Cosmos | 平台化多本体 | N1 开源、N2 计划开源 | GR00T N1 / N1.5 / N2 |
| Google DeepMind | 多本体 VLA + 具身思考 | 跨本体数据 + 动作迁移 | 不绑定 | 不开源 | Gemini Robotics 1.5 / ER 1.5 / 2 |
| 宇树 | 小脑 RL 成熟 + 大脑补齐(VLA 与世界模型双线) | 约 2500h 真机 + 500 万推理样本 | 自研强绑定 | WLA-1.0 开源 | UnifoLM 系列 |
| 智元 | ViLLA(VLM + MoE 隐式规划) | 100 台真机百万级 AgiBot World | 自研系列 + 平台输出 | GO-1 / 数据集开源 | GO-1 / GO-2 |
| 银河通用 | WAM / LDA 隐空间统一 | 百亿级仿真合成数据为主 | 轮式双臂 | 零售 VLA 开源 | AstraBrain WAM 0.5 |
| 它石智航 | 反 VLA:物理世界 AI 底座 + 触觉世界模型 | Human-Centric 数据引擎 | A 系轮式 + T 系双足 | 闭源 | AWE 3.5 |
| 自变量 | VLA 与世界模型深度融合 | 真机 + 世界模型生成 | 不绑定输出模型 | Wall-OSS 开源 | WALL-A / B / WALL-WM |
真实水平与 Scaling Law:仿真很高分,真机很诚实
Scaling Law:机器人不会简单复制 LLM 的剧本
总体判断:模型侧正处在智驾 2021-22 年的"BEV 时刻"
架构之争基本收敛(分层 + 融合),行业开始进入拼数据闭环的阶段——这是自动驾驶 2021-2022 年"BEV + Transformer 时刻"的对应位置。但距离"无人化"(L3 级任务全自主)还差两样东西:一个数量级的数据和误差恢复机制。
竞争焦点优先级:数据引擎 > 长时序误差恢复 > 触觉闭环 > 跨本体迁移。
与自动驾驶的映射:连坑位都一一对应
| 具身智能(2026) | 自动驾驶对应(2021-22) |
|---|---|
| 快慢双系统(System 2 + System 1) | 感知大模型 + 规控小模型的分层回归 |
| 数据飞轮 | 影子模式缺失后的代偿 |
| π*0.6 RL 后训练(RECAP) | 端到端的"RLHF 时刻" |
| "50 家庭定律" | 场景多样性比里程数重要 |
| 评估失效(仿真基准饱和) | 早期刷榜时代 |