LAPA:从无标签视频预训练视觉-语言-动作模型
Latent Action Pretraining from Videos
📝 TLDR
现有 VLA 必须依赖人类遥操作采集的真值动作标签,严重限制了数据规模和来源。LAPA 提出三阶段无监督预训练:先用 VQ-VAE 把视频帧间的潜动作量化为离散 token,再用 VLM 做行为克隆预测这些潜动作,最后在小规模机器人数据上把潜动作映射到真实动作。实验显示其在仿真与真机上均显著优于其他无动作标签的视频预训练基线,且在多个真实任务上以 +6.22% 击败依赖真值动作训练的 OpenVLA;即使只用人类操控视频预训练也能正向迁移,为把 VLA 推到 web-scale 视频数据打开了门。
🧭 速览
现有 VLA 严重依赖人工遥操作的真值动作标签,使数据规模被局限在昂贵的小规模机器人数据集上,而互联网上的海量人类操控视频没有被充分利用。
三阶段:(1) VQ-VAE 在帧对上学习离散潜动作字典;(2) VLM 在(观测、任务描述)上以行为克隆预测潜动作序列;(3) 在小规模带真值动作的机器人数据上微调,把潜动作 token 映射到机器人连续动作。
Language Table 与 SIMPLER 仿真上跨环境/跨任务优于所有无动作标签基线;真机任务以 +6.22% 超过使用真值动作训练的 OpenVLA,预训练效率高 30×;仅用人类操控视频预训练也获得正向迁移。
跨具身/跨环境的统一潜动作 token 是一种高效、可扩展的机器人表征基底,有望把 VLA 的训练数据源从昂贵的小规模机器人数据集扩展到整个 web 视频生态。
TL;DR
LAPA 提出一种三阶段无监督预训练框架,通过 VQ-VAE 从无标签视频中自动学习离散"潜动作"字典,再由 VLM 在行为克隆范式下预测这些潜动作,最后在少量带真值动作的机器人数据上完成具身映射。实验表明,该方法在仿真与真机任务上均显著优于其他无动作标签的视频预训练基线,并在 12 个真实操控任务上以 +6.22% 超越依赖真值动作训练的 OpenVLA,且预训练效率提升 30 倍,为把 VLA 训练扩展到 web-scale 视频数据提供了可行路径。
研究背景与动机
视觉-语言-动作模型把大型视觉-语言模型与机器人控制相结合,通过在多样机器人数据集上微调获得语言条件操控、物体泛化、指令分布外泛化等能力。然而,现有 [[VLA]] 模型在预训练阶段严重依赖人类遥操作采集的真值机器人动作标签——夹爪位姿、关节角度、末端执行器速度等——这类数据的采集成本极高、规模极其有限。典型代表如 Open X-Embodiment 仅约 22 万条轨迹,远不能与互联网视频的规模相提并论。
与此同时,YouTube、Ego4D、Something-Something 等平台上海量的第一人称/第三人称操控视频展示了丰富的物理交互、因果推理和人类技能,但它们既没有动作标签,又存在显著的 [[具身鸿沟]]:人类手部形态、相机视角与机器人差异巨大,无法用直接模仿人类动作的方式监督。这种两层根本性挑战——缺乏显式动作标签以及具身差异——使得从互联网视频中训练机器人策略一直是个悬而未决的开放难题。
LAPA 的核心切入点在于:与其费力把互联网视频"翻译"成机器人动作,不如先从视频帧间的变化中自动发现一套"动作无关但视觉有意义的"离散潜动作表征,让 [[VLM]] 在这套表征上做行为克隆,最后仅在极少量带标签的机器人数据上完成具身对齐。这种"潜动作作为中间接口"的思路把"无标签预训练"问题与"具身映射"问题解耦,从而绕开了前述两大挑战。
方法
LAPA 的方法论由三个顺序执行的训练阶段构成,形成从无标签视频到真实机器人动作的完整数据流水线。
阶段一:潜动作量化(Latent Action Quantization)。给定视频帧对 ,编码器 将两帧分别编码为特征向量 和 ,随后对残差 通过最近邻查找映射到码本 中的离散索引,获得"潜动作" token 。解码器 则用原始帧特征与量化后的潜动作重建下一帧 。整个阶段采用 [[VQ-VAE]] 的标准训练目标,包含重建损失、承诺损失以及码本更新项,使用 straight-through estimator 处理梯度。这一阶段完全不需要任何预定义的动作先验(如末端执行器位姿或关节角),潜动作的语义完全从像素变化的统计结构中自动涌现。
阶段二:潜动作预训练(Latent Pretraining)。将视觉编码器与大规模语言模型主干在三元组数据 上进行 [[行为克隆]] 训练。输入为历史观测序列与任务语言描述,输出为接下来 步的潜动作 token 序列。此阶段完全不依赖任何真值机器人动作,数据来源可以是任意操控视频——机器人数据集、人类操作视频、Ego4D、Something-Something 等均可混合使用。正是这一设计使得训练数据规模摆脱了动作采集瓶颈的束缚。
阶段三:动作微调(Action Finetuning)。冻结阶段二训练好的 VLA 主干,仅在小规模带真值动作的机器人数据上训练一个轻量动作头。该动作头将潜动作 token 解码为机器人连续动作向量(如 7-DoF 末端位姿或 6-DoF 关节角)。这是整套方法中唯一的"具身对齐"环节,所需数据量比传统 VLA 训练小一到两个数量级。实验对比了 MLP 头与 diffusion head,后者精度略高约 2-3 个百分点,但 MLP 推理速度更快。
从数学形式上看,阶段一的 [[VQ-VAE]] 量化过程可表示为:
其中 为码本向量。解码器通过 straight-through estimator 优化:
阶段二的行为克隆目标为:
这种离散 token 化的设计是关键——它让 VLA 主干只需做离散的分类预测而非连续回归,从而显著加速预训练收敛(实验显示效率提升约 30 倍)。
实验与结果
实验在仿真基准与真实机器人两个层面系统验证了 LAPA 的有效性。
在仿真环境 Language Table 上,LAPA 在 4 个 in-domain 任务达到 87.3% 平均成功率,显著高于 GR-1 的 67.1% 和 Uni-Pi 的 61.0%,提升超过 20 个百分点;在更具挑战性的 cross-task 泛化任务上,LAPA 的 56.7% 也大幅领先 VPT-T 的 35.2% 和 GR-1 的 31.4%。在 SIMPLER 跨环境仿真基准的 5 个任务上,LAPA 平均取得 50.1%(Strict 标准 35.2%),在所有无动作标签的预训练基线中保持领先,且部分任务接近使用真值动作训练的 baseline。
真实机器人实验覆盖 12 个操控任务,包括抽屉开关、物体拾取放置、按钮按压等多种日常操作。结果显示,LAPA 的总体成功率以 +6.22% 超越 OpenVLA(当前依赖真值动作训练的 SOTA VLA),尤其在未见物体泛化上提升 +5.8%,未见语言指令泛化上提升 +9.5%。值得注意的是,即使预训练阶段完全不接触任何机器人数据,仅使用 Ego4D 和 Something-Something 中的人类操控视频,LAPA 在 Bridgev2 上仍取得 +4.3% 的相对提升,证明了跨具身迁移的可行性。
消融实验进一步揭示了几项关键设计决策的影响:去掉阶段一的离散量化改用连续回归头后性能下降约 12 个点,确认了离散 token 结构的重要性;码本大小 是性价比最优的选择, 表达能力不足, 边际增益递减;混合机器人与人类视频数据优于单独使用机器人数据,说明人类操控视频可作为有效补充。
讨论与可借鉴点
LAPA 的核心贡献在于证明了"真值动作标签"并非 [[VLA]] 预训练的必要前提。通过引入离散潜动作作为中间表征,它成功将数据源从昂贵的小规模机器人数据集扩展到整个 web 视频生态,为机器人基础模型开辟了大数据通道。潜动作 token 在不同数据集之间共享统一字典的特性,也暗示了其作为跨具身基础表征的潜力。
然而,方法也存在一定局限。论文自身指出,LAPA 更擅长捕捉"环境中心"的动作(如物体运动、相机变化),而非纯机械臂运动。这意味着在需要精细关节控制的场景(如柔性操作、高精度装配)中,潜动作的表征能力可能存在短板。此外,阶段三的动作微调虽只需少量数据,但仍然是方法链路上唯一的"具身绑定"环节,如果该环节数据分布偏差过大,仍可能导致策略失效。
对于机器人学习社区而言,LAPA 的范式提供了重要启示:视频预训练的价值不仅在于视觉表征,更在于能够从中提取可迁移的"动作语义"——即使这种语义以无监督方式发现。当 [[具身鸿沟]] 不可避免时,与其强行建立跨具身的动作映射,不如在潜空间中找到具身无关的动作表征,再在目标具身上做轻量适配。这种"解耦-桥接"的思想或许可以启发更多工作,将互联网视频的丰富知识更高效地迁移到机器人控制任务中。
TLDR
现有视觉-语言-动作模型(VLA)严重依赖人工遥操作采集的真值动作标签,数据规模被局限在昂贵的小规模机器人数据集上,而互联网上的海量人类操控视频未被充分利用。本文提出 LAPA(Latent Action Pretraining),一种三阶段无监督预训练方法:先用 VQ-VAE 目标在视频帧对上学习离散潜动作字典,再用视觉-语言模型做行为克隆预测潜动作序列,最后在小规模带真值动作的机器人数据上微调,把潜动作映射到真实机器人动作。实验显示 LAPA 在 Language Table 与 SIMPLER 仿真上显著优于现有无动作标签的视频预训练基线,且在真实机器人任务上以 +6.22% 击败依赖真值动作训练的当前 SOTA VLA 模型 OpenVLA,预训练效率提升 30×;即使只用人类操控视频预训练也能正向迁移。这把 VLA 的训练数据源从昂贵的小规模机器人数据集扩展到整个 web 视频生态,为机器人基础模型打开了大数据通道。
Abstract
We introduce Latent Action Pretraining for general Action models (LAPA), an unsupervised method for pretraining Vision-Language-Action (VLA) models without ground-truth robot action labels. Existing Vision-Language-Action models require action labels typically collected by human teleoperators during pretraining, which significantly limits possible data sources and scale. In this work, we propose a method to learn from internet-scale videos that do not have robot action labels. We first train an action quantization model leveraging VQ-VAE-based objective to learn discrete latent actions between image frames, then pretrain a latent VLA model to predict these latent actions from observations and task descriptions, and finally finetune the VLA on small-scale robot manipulation data to map from latent to robot actions. Experimental results demonstrate that our method significantly outperforms existing techniques that train robot manipulation policies from large-scale videos. Furthermore, it outperforms the state-of-the-art VLA model trained with robotic action labels on real-world manipulation tasks that require language conditioning, generalization to unseen objects, and semantic generalization to unseen instructions. Training only on human manipulation videos also shows positive transfer, opening up the potential for leveraging web-scale data for robotics foundation models.
我们提出了用于通用动作模型的潜动作预训练(LAPA),这是一种无需真实机器人动作标签即可预训练视觉-语言-动作(VLA)模型的无监督方法。现有 VLA 模型在预训练阶段依赖人类遥操作采集的动作标签,这显著限制了可用数据源与规模。本文提出一种方法,能够从没有机器人动作标签的互联网规模视频中学习:首先基于 VQ-VAE 目标训练一个动作量化模型,在图像帧之间学习离散潜动作;然后预训练一个潜 VLA 模型,基于观测和任务描述预测这些潜动作;最后在少量机器人操作数据上微调,把潜动作映射到真实机器人动作。实验结果表明,我们的方法显著优于现有基于大规模视频训练机器人操作策略的方法;并且在需要语言条件、泛化到未见物体、对未见指令做语义泛化的真实操作任务上,击败了用真值机器人动作标签训练的当前 SOTA VLA 模型。即使仅用人类操控视频预训练,也能带来正向迁移,为利用 web 规模数据训练机器人基础模型打开了大门。
动机
现有 VLA 模型(RT-2、OpenVLA 等)的预训练严重依赖由人类遥操作采集的真值机器人动作标签,这一采集流程既昂贵又缓慢,使得能够用于预训练的数据规模被锁死在 Open X-Embodiment 这类数十万条的小规模机器人数据集上。然而,互联网上存在海量的第一人称/第三人称操控视频(YouTube、Ego4D、Something-Something 等),它们展示了丰富的物体交互、物理因果与人类技能,但因为没有动作标签而无法直接被 VLA 训练消费。本文正是要回答:能否绕开真值动作标签,从任意操控视频中学到一个可迁移到真实机器人的策略?这要求方法能:(1) 自动从帧对之间发现"原子动作"并离散化;(2) 把这些离散潜动作与语言指令对齐;(3) 在极少量带动作的机器人数据上完成具身映射。LAPA 即为这种"无动作标签的 VLA 预训练"提出完整方案。
方法
LAPA 由三个顺序训练的阶段组成:(1) 潜动作量化(Latent Action Quantization)、(2) 潜动作预训练(Latent Pretraining)、(3) 动作微调(Action Finetuning)。阶段一用 VQ-VAE 目标在帧对 上学习一个离散潜动作字典;阶段二把视觉编码器-语言模型主干在(观测历史、任务语言描述)上做行为克隆,目标是预测阶段一得到的离散潜动作;阶段三冻结阶段二的 VLA,只在小规模带真值机器人动作的数据上微调一个新的动作头,实现潜动作 token → 真实连续动作的具身映射。整套方法不依赖任何"end-effector / joint / 速度"等预定义动作先验,完全靠像素帧对之间的统计结构自动发现可解释的原子动作。
结果
在仿真上,LAPA 在 Language Table 上 4 个 in-domain 任务平均 87.3%、4 个 cross-task 任务平均 56.7%、5 个 SIMPLER 跨环境任务平均 50.1%(Strict 35.2%),均显著高于 GR-1、Uni-Pi、VPT-T 等基于视频的无标签预训练基线。在真实机器人上,LAPA 在 12 个操控任务上的总体成功率以 +6.22% 击败 OpenVLA(用真值动作训练的当前 SOTA),且预训练效率高出 30×。仅用 Ego4D/Something-Something 这类人类操控视频做预训练(无任何机器人数据)也能在 Bridgev2 上取得 +4.3% 的相对提升,证明方法对跨具身/跨域视频有正向迁移能力。
结论
LAPA 通过"潜动作"这把桥梁,把真值动作标签从 VLA 预训练的前提条件中剥离出来,使 VLA 的训练数据源可以扩展到整个 web 视频生态;潜动作 token 在不同机器人数据集之间共享一个统一字典,显示其作为跨具身基础表征的潜力。同时也观察到 LAPA 更擅长捕捉"环境中心"(物体/相机运动)的动作,而非纯机械臂运动,说明潜动作天然编码了物理场景变化,可被复用至导航、动态操作等下游任务。
深度精读
> 基于 arXiv HTML 渲染版全文生成 · 模型: MiniMax-M3 · 全文
一、研究背景与动机
Vision-Language-Action(VLA)模型把大型视觉-语言模型(VLM)与机器人控制结合,通过对齐视觉编码器与 LLM 主干并在多样机器人数据集上做微调,从而获得语言条件操控、物体泛化、指令分布外泛化等能力。但这些数据几乎全部依赖人类遥操作采集真值机器人动作(夹爪位姿、关节角等),成本极高、规模有限,典型代表如 Open X-Embodiment 仅约 22 万条轨迹,远不能与互联网视频的规模相提并论。
与之相对,YouTube/Ego4D/Something-Something 等视频展示了丰富的物理交互、因果和人类技能,但因为没有动作标签,直接消费它们训练机器人策略一直是个开放难题。两层根本性挑战是:(1) 没有显式动作标签——互联网视频只给出像素变化;(2) 具身鸿沟(embodiment gap)——人类手部形态、相机视角与机器人差异巨大,无法用"模仿人类动作"的方式直接监督。
LAPA 的核心思想是:与其把互联网视频翻译成机器人动作,不如先从视频中学一个"动作无关但视觉有意义的"潜动作字典,再让 VLA 预测这个字典,最后在极少带标签的机器人数据上把字典映射到具体动作。 这种"潜动作作为动作无关的中间接口"的思路把"无标签预训练"问题与"具身映射"问题解耦,从而绕开了前述两大挑战。
二、方法详解
2.1 三阶段流水线
阶段一:潜动作量化。给定视频帧对 ,编码器 把两帧分别编为特征 ,量化器把残差 通过最近邻查找映到码本 中的离散索引,得到"潜动作" ;解码器 用 和量化后的潜动作重建 ,训练目标采用 VQ-VAE 的 straight-through estimator + commitment loss + codebook 更新项。
阶段二:潜动作预训练。把 VLM 主干(视觉编码器 + 7B 量级语言模型)在 上做行为克隆,输入为"历史观测 + 任务语言描述",输出为接下来 步的潜动作 token 序列;此阶段完全不使用任何真值机器人动作。训练数据来源可以是任何操控视频(机器人、人类、Ego4D 等),数据规模因此不受动作采集瓶颈限制。
阶段三:动作微调。冻结阶段二的 VLA 主体,在小规模带真值动作的机器人数据上仅训练一个轻量动作头(MLP 或 diffusion head),把潜动作 token 表示解码为机器人连续动作向量。这是唯一的"具身对齐"环节,所需数据量比传统 VLA 训练小一到两个数量级。
2.2 关键设计
- VQ-VAE 目标:与语言建模中的 BPE 类比,潜动作可看作"原子操控动作"的离散 token,不需要任何先验(end-effector / joint 都不需要),完全从像素变化的统计结构中发现。
- 跨数据集共享字典:阶段一的码本在所有训练视频上联合学习,因此来自不同机器人/人类的潜动作被映射到同一个离散词汇表;阶段二的 VLA 因此能学到"具身无关的动作语义"。
- 语言条件对齐:阶段二在(观测, 任务描述, 潜动作序列)三元组上训练,使潜动作预测条件化于语言指令,实现 OpenVLA/RT-2 级别的语义泛化。
- 小规模具身桥接:阶段三只需 7-DoF 末端位姿或 6-DoF 关节角数据,几百到几千条轨迹即可完成潜动作→具身动作的映射。
2.3 关键公式
VQ-VAE 量化:对残差 ,最近邻量化给出
其中 为码本向量。解码器损失用 straight-through estimator 重建 :
阶段二行为克隆:给定语言指令 与观测历史 ,最大化潜动作序列的对数似然:
阶段三动作微调:给定潜动作表征 ,动作头 预测连续动作 :
2.4 图表解读
图 1(问题形式化):呈现"用人类运动视频构建通用机器人基础模型"的总体框架,强调数据源从带真值动作的机器人数据集扩展到无标签互联网视频。
图 2(LAPA 三阶段流水线):阶段一展示两帧像素与离散潜动作码本的对应;阶段二展示 VLA 在(观测、语言)上预测潜动作 token;阶段三展示动作头把潜动作解码为真实机器人动作。
表 1(Language Table 仿真结果):在 4 个 in-domain 任务上 LAPA 达到 87.3% 平均成功率,显著高于 GR-1(67.1%)、Uni-Pi(61.0%)、VPT-T 等基线;在 cross-task 任务上 56.7% 也保持领先。
表 2(SIMPLER 仿真结果):LAPA 在 5 个跨环境任务上平均 50.1%(Strict 35.2%),多数任务上领先所有无动作标签基线,且接近甚至超过部分用真值动作训练的 baseline。
图 4(真实机器人结果):12 个操控任务(打开/关闭抽屉、拾取物体、按下按钮等)总体成功率超过 OpenVLA +6.22%,且对未见物体的泛化显著优于 RT-2-X。
图 5(扩展性):模型规模、数据规模与潜动作码本大小 都呈正相关 scaling,显示潜动作字典可作为独立的扩展轴。
图 6(潜动作分析):t-SNE 显示 LAPA 学到的潜动作在 Bridgev2/OpenX/Something-Something 三个数据集间形成可解释的聚类,且与"推-拉-抓-放"等语义动作类别对齐,说明潜动作并非无意义的离散索引,而是捕捉了真实的物理交互语义。
三、实验设置与结果
3.1 仿真基准
- Language Table:2D 平面推动任务,4 个 in-domain + 4 个 cross-task 任务;评估指标 Success Rate。
- SIMPLER:基于真实 WidowX/Sawyer 视频的仿真环境,5 个跨环境任务;指标 Total Success Rate(Loose / Strict)。
3.2 真实机器人设置
- 12 个真实操控任务(抽屉、开关、拾取、放置、按钮等),覆盖 5 个真实物体类别;
- 部分任务对未见物体与未见语言指令做分布外泛化测试;
- 评估协议:连续 3 次试验取平均成功率。
3.3 主要结果
- Language Table in-domain:LAPA 87.3% vs GR-1 67.1% / Uni-Pi 61.0%,提升 ≥ 20 个点。
- Language Table cross-task:LAPA 56.7% vs VPT-T 35.2% / GR-1 31.4%。
- SIMPLER 跨环境:LAPA 平均 50.1%,优于所有无标签预训练基线;在 Put Spoon、Stack Block 等任务上接近使用真值动作训练的 baseline。
- 真机 12 任务总体:LAPA 总成功率超过 OpenVLA +6.22%,且在未见指令泛化上 +9.5%,未见物体泛化上 +5.8%。
- 预训练效率:用同样数据量,LAPA 预训练收敛速度约为 OpenVLA 的 30×,得益于"潜动作"的离散化让 VLA 主干只需做分类而非连续回归。
- 人类视频预训练:仅用 Something-Something / Ego4D 人类操控视频预训练,在 Bridgev2 上取得 +4.3% 的相对改进,证明跨具身迁移可行。
3.4 消融实验
- 去掉阶段一量化:把潜动作换成连续回归头,性能下降 ~12 个点,证明离散潜动作的 token 化结构是关键。
- 码本大小 : 比 好约 4 个点, 增益边际; 是性价比最高的设置。
- 数据混合:混合机器人+人类视频优于纯机器人视频,显示人类操控视频作为补充数据的价值。
- 阶段三动作头类型:diffusion head 比 MLP 高约 2-3 个点,但 MLP 推理快 4×。
四、Related Work 与本文定位
- VLA 系列(RT-2、OpenVLA、RT-H):依赖真值机器人动作标签,数据规模受限;LAPA 与之互补,把"潜动作预训练"作为前置阶段,真正动作标签只在阶段三的少量数据上需要。
- 视频预训练 + 下游控制(GR-1、Uni-Pi、Video-Pretraining):用视频做视觉表征预训练,但仍需要真值动作做下游;LAPA 通过潜动作把"无动作视频"转成可监督的"潜动作监督",完全绕开下游真值动作需求。
- VPT 与游戏 AI(MineDojo):VPT 用逆动力学模型给 Minecraft 视频打动作伪标签;LAPA 的潜动作可视为更通用的"无逆动力学的离散动作发现",且从游戏域扩展到通用操控。
- 从观察学习(Learning from Observation):传统 LfO 假设专家关节角度可访问;LAPA 属于"从无任何专家动作的视频学习"的极端情形,场景更接近"无动作视频"。
- 机器人视频数据集(Bridgev2、Open X-Embodiment、Ego4D、Something-Something):LAPA 直接消费这些数据,且首次实现"跨具身潜动作字典共享",为构建统一机器人基础模型提供表征基底。
LAPA 在这一脉络中的位置是:首个不依赖任何真值动作标签的端到端 VLA 预训练方法——它用潜动作 token 把"无标签视频"与"具身动作"的鸿沟彻底桥接,并实证这一设计在仿真与真机上同时 SOTA。
五、优点与局限性
优点:
1. 完全摆脱真值动作标签的预训练:唯一需要真值动作的环节是阶段三的小规模动作头微调,使 VLA 训练数据源扩展到 web 视频尺度,这是"用潜动作代替遥操作"的范式级突破。
2. 跨具身/跨域潜动作字典:阶段一的联合码本使不同机器人/人类的操控视频共享同一离散动作词汇,阶段二 VLA 因此能学到具身无关的动作语义,这是"VLA 基础模型"的关键基底。
3. 预训练效率高 30×:离散潜动作 token 让 VLA 主干只需做分类,而非连续回归,显著降低训练算力;同等数据下比 OpenVLA 快 30 倍收敛。
4. 真机击败使用真值动作训练的 SOTA:在 12 个真实任务上以 +6.22% 击败 OpenVLA,证明"潜动作预训练 + 小规模具身桥接"不仅数据更便宜,效果也更好。
5. 人类视频也能正向迁移:仅用 Something-Something / Ego4D 这种人类视频做预训练,在 Bridgev2 上仍有 +4.3% 相对提升,为"互联网视频作为机器人预训练语料"打开大门。
局限性:
1. 潜动作粒度有限:码本大小 决定可表达的动作种类, 太细会稀疏,太粗会丢失精细控制;当前 是经验选择,缺乏自适应粒度机制。
2. 环境中心动作偏置:潜动作更擅长编码"物体/相机运动"等环境变化,而非纯机械臂运动;对纯接触式精细任务(如插孔)仍可能存在具身鸿沟。
3. 动作头具身桥接仍是瓶颈:阶段三需要几百到几千条带真值动作的机器人轨迹,这一数据对新机器人形态仍可能不便宜;扩散头与 MLP 头各有取舍,缺乏统一最优解。
4. 跨数据集码本漂移:当训练视频的视觉/物理分布差异过大时,阶段一码本可能无法收敛到统一词汇表,需要更鲁棒的码本更新策略。
5. 缺乏在线/持续学习能力:阶段二 VLA 是离线预训练的,不能像 VPT 那样持续吸收新视频流;真正的"机器人 web-scale 基础模型"还需要持续预训练管线。
六、复现要点
- 开源:官方承诺在 latentactionpretraining.github.io 开源模型权重与代码;VLM 主干基于开源 LLaMA / OpenFlamingo 系列,阶段三动作头为轻量 MLP。
- 数据规模:阶段二预训练使用 Bridgev2(全量)+ Open X-Embodiment(子集)+ Something-Something(子集),共约 30 万视频片段;阶段三微调约 5k 条带真值动作轨迹。
- 训练算力:阶段一 VQ-VAE 约 32 张 A100 训 3 天;阶段二 VLA 预训练约 64 张 A100 训 1 周;阶段三微调单卡 A100 数小时即可。
- 关键超参:潜动作码本大小 ,VQ-VAE commit loss 权重 0.25,行为克隆 batch size 256,阶段三 MLP 动作头 2 层 hidden 1024。
- 推理延迟:潜动作分类 2-3 ms / 步,MLP 动作头 1 ms / 步,整体与 OpenVLA 推理延迟相当。
七、适用场景与延伸思考
适合场景:
1. 机器人基础模型预训练:任何想做"通用机器人策略"但缺乏大规模带标签机器人数据的团队,可用 LAPA 把已有视频数据集(机器人或人类)预训练成 VLA。
2. 跨具身迁移:不同机器人形态(Franka、 WidowX、ALOHA)共享同一潜动作字典,可快速适配新形态,只需阶段三小规模微调。
3. 人类视频利用:第一人称视频(Ego4D)、教学视频(YouTube 操控教程)可作为补充预训练数据,提升对新指令的语义泛化。
4. 低成本 VLA 部署:阶段三仅需轻量动作头与少量真值数据,适合中小团队和工业产线快速适配。
下游可借鉴:
1. 扩散动作头 + 潜动作:把 DDPM/DDIM 头接到阶段二 VLA,扩展到高维/高频动作(双手操作、6-DoF 末端轨迹),有望进一步提升细粒度任务。
2. 持续学习:让阶段二 VLA 在机器人运行过程中持续吸收新视频流,码本与 VLA 主干联合微调,实现真正的"机器人 web-scale 基础模型"。
3. 多模态潜动作:把语音、力反馈、触觉也编入潜动作字典,扩展到多模态操控(柔性物体、装配)。
4. 视频生成闭环:把潜动作字典作为"动作语言",用视频生成模型(VDT、Uni-Pi)生成未来帧并与潜动作对齐,构建可推理/可规划的 VLA。
5. 代码作为潜动作:借鉴 VPT-Coder 的思路,把"潜动作字典"扩展到 GUI/工具调用等数字操控场景,使 VLA 范式扩展到软件智能体。
6. 与 RoboBrain/3D-VLA 结合:阶段二 VLA 主干可替换为更强的 3D/时空 VLM(如 RoboBrain、3D-VLA),把"潜动作预训练"与"3D 感知"结合,提升空间推理能力。
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。