Chapter 03 · Models & Intelligence

大脑·模型技术:不是不聪明,是缺经验

模型侧的难点不是"听得懂、认得出"——语义理解与感知已被 VLM 基本解决,而是"做得对、错了能自己改"。当前真实水平:训练域内任务成功率 85-98%,但跨场景断崖式下跌、长时序误差累积且没有恢复机制。一句话:大脑的"知识面"和"反应速度"都有了,缺的是经验(数据差 1-2 个数量级)和自我纠错(闭环)。

数据截至 2026-10-093 张架构图 · 8 大难点效果分级
One-liner

一句话认知:知识面和反应速度都有了,缺的是经验和纠错

本章认知锚点

大脑的两件旧难题——"知识面"(VLM 语义理解)和"反应速度"(快慢双系统)——2026 年都已经变成工程标配。
真正卡住"无人化"的是两件新难题:经验——全球合规机器人数据约 50 万小时,通用大脑需要千万小时级,差 1-2 个数量级;自我纠错——机器人执行了一个不准确的动作后,真实环境状态已偏离预测,误差不是衰减而是滚动放大,且当前系统没有"发现失败 → 重试 → 恢复"的闭环。
域内 85-98% 的仿真成功率,掩盖不了这两块短板。

85-98%
训练域内仿真基准成功率区间;LIBERO 已饱和、无法区分模型优劣
50万小时
全球合规机器人数据总量;通用大脑需千万小时级,差 1-2 个数量级
~200Hz
Helix System 1 轻量策略输出频率,匹配全身控制 50-200Hz 需求
两轮专题研究
11.69Hz
国产辉羲 RhinoVLA 端侧端到端推理频率,跨过实时闭环 10Hz 门槛
2×
π*0.6 RECAP 困难任务吞吐提升、失败率减半——具身的"RLHF 时刻"
Difficulty Map

八大难点与效果分级:一个已过时,三个在攻坚,四个没解决

八个难点不是并列的:推理频率是唯一已被工程化解决的难点(也是 2025 年最重要的架构发明);数据与泛化在攻坚;而长时序误差累积被公认为"比数据更深"的瓶颈——它就是"演示视频能完成 30 秒任务、工厂里 2 小时任务跑不完"的原因。

难点本质矛盾当前方案效果
① 数据饥渴全球合规数据约 50 万小时 vs 通用大脑需千万小时级四种数据飞轮:真机遥操作 / 人类演示 / 仿真合成 / 网络视频攻坚中
供给侧在铺,商业闭环未通
② 泛化断崖域内成功率高、域外崩溃异构共训 + 数据多样性优先("50 家庭定律")攻坚中
"新居级"开放世界刚达到
③ 长时序误差累积小误差滚动放大、无重试恢复机制世界模型前瞻推演 + RL 后训练(π*0.6 RECAP)未解决
比数据更深的瓶颈
④ 推理频率 vs 参数大模型聪明但慢:VLM 秒级推理 vs 控制需 50-200Hz快慢双系统(Helix 范式)已解决
唯一被工程化解决的难点
⑤ 跨本体迁移人形 / 机械臂 / 轮式的动作语义不对齐Motion Transfer、统一动作空间未解决
公认弱点
⑥ 评估体系失效仿真基准饱和、无法区分优劣RoboArena 真机评测、真机挑战赛攻坚中
向真机评测转向中
⑦ 触觉缺失接触丰富任务(插拔 / 揉搓)在"盲抓"视触觉 VLA、触觉世界模型未解决
导入期
⑧ 记忆与因果无长期记忆、不懂物理因果VLM 推理 + 世界模型推演未解决
失败恢复仍靠人
Architecture Wars

三场架构之争,2026 年的收敛形态

端到端 vs 分层、VLA vs 世界模型、自采数据 vs 外部数据——三场争论在 2026 年都有了阶段性答案:分层成主流、融合成共识、数据成壁垒。

之争一:端到端 VLA vs 分层架构

端到端 VLA(像素 → 动作 token)
  • 无信息瓶颈,数据驱动上限高
  • 可解释性差,数据需求极高
  • 代表:特斯拉 FSD 式路线、PI π 系列早期
VS
分层架构(快慢双系统)
  • Figure Helix(2025.2)确立范式:System 2 = 7B VLM,7-9Hz 慢推理规划;System 1 = 80M 轻量策略,约 200Hz 连续控制
  • Helix 02 扩展到全身控制
  • 2026 年已成工程主流
收敛结论
分层已成工程主流——纯端到端只在"小脑 + 底盘"层面成立,语言级规划普遍交给 VLM。争的不是"要不要分层",而是"层与层之间用什么连接"(见下一节:latent 表示桥)。

之争二:VLA vs 世界模型——从对峙到融合

2024-2025 年两条路线对峙:VLA 拟合动作分布、世界模型学习环境动力学。2026 年的核心变量是融合——头部模型几乎都变成了"世界模型预训练 + 动作解码"的混合体。

英伟达 GR00T N2 · WAM
不再叫 VLA,而是定义为"世界动作模型":联合预测世界状态与动作,视频预训练打底(学术底座 DreamZero),2026 年底开源。
学术融合代表
UWM(视频扩散 + 动作扩散统一预训练)、τ0-WM、WorldDP、InternVLA-A1(三专家统一,动态场景成功率超 π0.5 达 26.7 个百分点)。
国内融合阵营
银河通用 AstraBrain WAM 0.5(隐空间统一 VLA 与世界模型)、自变量 WALL-WM、宇树 UnifoLM-WMA-0。
融合逻辑
世界模型为 VLA 提供"想象力"(前瞻推演、数据增广),VLA 提供动作输出。这正是冲着难点③"长时序误差累积"去的:先"想象"后果再执行,而不是执行错了再补救。

之争三:数据策略——架构趋同后,数据是最终壁垒

第三场之争不在模型侧,而在数据侧:真机遥操作、人类第一视角、仿真合成、网络视频四种飞轮各有硬伤,谁先跑通"低成本 + 高质量 + 持续供给"的数据引擎,谁就握住下一阶段的胜负手。→ 详见第 5 节"数据引擎"。

Dual System

快慢双系统:2025 年最重要的架构发明

矛盾很直接:7B 级 VLM 推理一次要百毫秒级,而全身控制需要 50-200Hz。解法是"慢大脑 + 快小脑":System 2 慢速推理做规划,System 1 轻量网络高频输出控制,中间靠 latent 变量桥接。英伟达 GR00T N1 采用同构设计,该范式已成行业标配。

System 2 · 慢思考 7B VLM 基座 推理频率 7-9Hz 任务规划 · 语义理解 场景级长程推理 latent 表示桥 System 1 · 快执行 80M 轻量策略网络 输出频率 ~200Hz 连续全身控制 匹配 50-200Hz 需求 机器人本体 全身执行 · 闭环反馈 动作 易混点 推理频率 ≠ 执行频率:双系统靠 latent 表示桥接 模型每秒推理几次 ≠ 关节每秒执行几次 端侧突破 辉羲 RhinoVLA 在 R1 芯片跑出 11.69Hz 端到端推理 跨过实时闭环的 10Hz 门槛
图 1 · 快慢双系统架构:System 2(7B VLM,7-9Hz)→ latent 表示桥 → System 1(80M,~200Hz)→ 机器人本体(来源:Figure Helix 范式、英伟达 GR00T N1 同构设计)
Data Engine

数据引擎:最大的瓶颈,也是最终的壁垒

四种数据飞轮各有硬伤,没有一种能单独赢。当前数据规模与 LLM 相差数个数量级——这就是"大脑缺经验"的量化含义。

四种数据飞轮对比

飞轮代表优势硬伤
真机遥操作特斯拉数据员(8h 班次产出约 4h 可用视频);智元 AgiBot World(100 台真机、百万条轨迹)质量最高贵、慢、场景窄
人类第一视角苹果 ARMADA / EgoDex(829 小时,最大灵巧操作数据集);ALOHA / UMI采集便宜、可众包跨本体 gap(人手 → 机械手)
仿真合成英伟达 Cosmos 生成神经轨迹(DreamGen);银河通用主打百亿帧边际成本趋零动力学 gap(接触 / 可变形体)未解
网络视频π0.5 / UWM 混训量无限只有语义先验、无动作标签

数据规模刻度(示意)

LLM 语料(参照)
万亿 token
通用大脑所需
千万小时级
OXE 轨迹库
140 万条
AgiBot World
100 万+条
全球合规数据现状
约 50 万小时
EgoDex
829 小时

示意宽度(按对数感觉绘制),仅供感知数量级差异,非等比;"条轨迹"与"小时"为不同计量单位,不可直接换算。Open X-Embodiment 含 22 种本体,开创跨本体预训练;AgiBot World 把工业级数据提升 10 倍,但全是"可复现实验室 / 工厂场景"——家庭无序环境数据依然接近空白。

"50 家庭定律":多样性 > 数量
π0.5 的核心洞察:"50 个家庭各采 1 小时数据 > 1 个家庭采 50 小时"——数据多样性比数据量更重要。靠此策略,π0.5 实现了跨新居的开放世界清洁任务,这是当前"泛化断崖"上被验证的最佳实践。
新变量一:触觉数据更"高效"
新发现:引入触觉可显著降低模型对数据规模的依赖(科创板日报)——触觉比视觉信息效率高,可能是绕开"数据饥渴"的一条捷径。
新变量二:LeRobot 格式成事实标准
Hugging Face 的 LeRobot 格式(v3.0)已成机器人数据交换的事实标准——数据能互通,飞轮才能拼起来,这是数据基础设施层最重要的收敛。
Data Flywheel

数据飞轮闭环:部署即采集

四种数据源解决"从 0 到 1"的冷启动,而真正的复利来自闭环:机器人每部署一天,就在为下一版模型生产数据。π*0.6 的 RECAP(自主经验上的 RL 后训练)第一次把这个回路跑出效果。

真机遥操作 质量最高 · 贵慢窄 人类第一视角 采集便宜 · 跨本体 gap 仿真合成 边际成本趋零 · 动力学 gap 网络视频 语义先验 · 无动作标签 数据引擎 清洗 · 跨本体对齐 · LeRobot 格式 VLA 训练 预训练(多源混训)+ 微调 真机部署 工厂 · 家庭 · 商超真实场景 自主经验回流 RECAP:真机经验上 RL 后训练 经验回流闭环 闭环特征:每部署一台机器人,就在为下一版模型生产数据
图 2 · 数据飞轮:四种数据源 → 数据引擎(清洗 / 对齐 / LeRobot 格式)→ VLA 训练 → 真机部署 → 自主经验回流(RECAP)→ 数据引擎
Paradigm Shift

训练范式演进:从"抄动作"到"想象后果"

动作生成范式六年走了七步:行为克隆只会模仿,扩散策略解决多模态动作,Flow Matching 成为当前主流动作头,RL 后训练补上"自我改进",世界模型预训练补上"物理常识"。

BC 行为克隆 2022 前 直接模仿示教动作 ACT 2023 动作分块抑制抖动 Diffusion Policy 2023 生成多模态动作 Flow Matching 2024 · 主流 当前主流动作头 动作 token 化 2024-25 与 LLM 统一接口 RL 后训练 2025 · π*0.6 RECAP 真机经验 RL 吞吐翻倍·失败率减半 世界模型视频预训练 2026 视频学物理规律先验 当前最优组合 = VLA 基座 + 世界模型预训练 + RL 自我改进 π*0.6 的 RECAP 被称为具身智能的「RLHF 时刻」:困难任务吞吐翻倍、失败率减半
图 3 · 训练范式演进链:BC → ACT → Diffusion Policy → Flow Matching → 动作 token 化 → RL 后训练 → 世界模型视频预训练(来源:《本体与模型深度解析》训练范式层)
Tech Philosophies

各家技术哲学对比:十条路线,三种赌法

十条路线本质是三种赌法:绑本体(特斯拉、宇树——模型为自家机器服务)、不绑本体卖模型(PI、DeepMind、自变量——赌大脑价值 > 本体价值)、卖铲子建生态(英伟达——平台化多本体)。估值最高的两家 Figure($390 亿)与 PI(传 $110 亿)赌同一个终局,下注路径完全相反。

公司架构路线数据来源本体绑定开源策略代表模型
特斯拉FSD 式端到端员工遥操 / VR / 工厂自采Optimus 强绑定不开源Optimus 内部系统
Figure分层 VLA(快慢系统)自家家庭 / 工厂遥操Figure 03闭源Helix 2025.2、Helix 02
Physical Intelligence通用 VLA + RL 后训练多本体遥操 + 真机经验(RECAP 飞轮)不绑定openpi 开源π0 → π0.5 → π*0.6
英伟达WAM 世界动作模型 + 仿真飞轮仿真神经轨迹 + Cosmos平台化多本体N1 开源、N2 计划开源GR00T N1 / N1.5 / N2
Google DeepMind多本体 VLA + 具身思考跨本体数据 + 动作迁移不绑定不开源Gemini Robotics 1.5 / ER 1.5 / 2
宇树小脑 RL 成熟 + 大脑补齐(VLA 与世界模型双线)约 2500h 真机 + 500 万推理样本自研强绑定WLA-1.0 开源UnifoLM 系列
智元ViLLA(VLM + MoE 隐式规划)100 台真机百万级 AgiBot World自研系列 + 平台输出GO-1 / 数据集开源GO-1 / GO-2
银河通用WAM / LDA 隐空间统一百亿级仿真合成数据为主轮式双臂零售 VLA 开源AstraBrain WAM 0.5
它石智航反 VLA:物理世界 AI 底座 + 触觉世界模型Human-Centric 数据引擎A 系轮式 + T 系双足闭源AWE 3.5
自变量VLA 与世界模型深度融合真机 + 世界模型生成不绑定输出模型Wall-OSS 开源WALL-A / B / WALL-WM
Reality Check

真实水平与 Scaling Law:仿真很高分,真机很诚实

评估失效:别只看仿真分数
LIBERO 仿真基准 85-98% 已饱和(智元 GO-2 称 98.5%),无法区分模型优劣。真机照妖镜是 AgiBot World Challenge 2026(ICRA 维也纳、真机商超场景):超百支队伍只做到"超越 baseline"(The Robot Report)。行业正转向 RoboArena 真机评测,但尚无公认的真机通用基准——看到高分先问一句:仿真还是真机。

Scaling Law:机器人不会简单复制 LLM 的剧本

Data Scaling Laws 首次实证
清华叉院高阳团队首次发现具身智能的 data scaling laws,实现零样本泛化——被称为该领域的"圣杯"。
规模化视频原生预训练 未核实
GEN-0 类"海量视频原生数据 + 超大规模预训练基座"路线被视为 Scaling Law 的雏形探索。源文档未收录细节,未核实,不作依据。
行业共识
机器人的 scaling law 不会简单复制 LLM:数据类型多样性、长时序恢复能力,比堆参数和堆数据量更关键。
Verdict

总体判断:模型侧正处在智驾 2021-22 年的"BEV 时刻"

一句话判断(中高置信度)

架构之争基本收敛(分层 + 融合),行业开始进入拼数据闭环的阶段——这是自动驾驶 2021-2022 年"BEV + Transformer 时刻"的对应位置。但距离"无人化"(L3 级任务全自主)还差两样东西:一个数量级的数据和误差恢复机制。
竞争焦点优先级:数据引擎 > 长时序误差恢复 > 触觉闭环 > 跨本体迁移。

与自动驾驶的映射:连坑位都一一对应

具身智能(2026)自动驾驶对应(2021-22)
快慢双系统(System 2 + System 1)感知大模型 + 规控小模型的分层回归
数据飞轮影子模式缺失后的代偿
π*0.6 RL 后训练(RECAP)端到端的"RLHF 时刻"
"50 家庭定律"场景多样性比里程数重要
评估失效(仿真基准饱和)早期刷榜时代
本章来源
主源:《本体与模型深度解析》(2026-10-09,两轮专题研究联网核实,第二部分 + 第三部分)、《具身智能行业多维系统分析报告》第 2 章技术思路、第 3.3-3.4 节数据基础设施与开放难题。关键外链: π*0.6 RECAP(pi.website) · AgiBot World Challenge 2026 真机成绩(The Robot Report) · 清华 data scaling laws(PNP Robotics) · Scaling Law 共识(清科) · RhinoVLA 端侧推理(艾邦) · 数据缺口(36氪)