Robotics & Embodied AI

机器人与具身智能

Sim-to-real, locomotion, manipulation, world models, skill discovery, vision-language-action. — 虚实迁移、运动控制、操作、世界模型、技能发现、视觉-语言-动作。

5 篇论文 19 个高频概念 维护 · DPR
已纳入 ✨ wiki 📄 PDF

ExToken:利用离散行为先验实现视觉-语言-动作强化学习中的高效探索

ExToken: Leveraging Discrete Behavioral Priors for Efficient Exploration in Vision-Language-Action Reinforcement Learning

Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

arXiv:2607.12931v1 2026-07-01
0.95 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlroboticsmethod-paper
重要图片 · 9 张
TL;DR

当前VLA-RL框架面临探索停滞瓶颈,样本效率低下。研究发现轨迹多样性比回滚数量对样本效率更重要。据此提出ExToken框架,利用离线演示提取的离散行为先验token条件化VLA策略,引导结构化探索;同时设计状态条件化token选择器,桥接训练时的探索与部署时的确定性推理。实验在仿真与真实机器人操作任务中验证了该方法在受限交互预算下显著加速收敛并提升性能。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

视觉-语言-动作模型在复杂操作任务中展现出巨大潜力,但在实际应用中,[[强化学习]]训练需要大量环境交互,而每次交互都伴随着高昂的时间与资源成本。当前的VLA-RL框架在训练过程中普遍面临一个根本性困境:智能体在探索时倾向于反复采样已知的行为模式,而忽视对状态空间中未知区域的系统性探索。这种探索停滞现象导致样本效率低下——即便收集了数量可观的回滚轨迹,策略也难以获得实质性的改进。

论文的作者们通过一系列诊断实验发现了一个关键洞察:轨迹多样性比回滚数量对样本效率的影响更为根本。当智能体收集的回滚轨迹彼此相似时,即便轨迹总数可观,策略也只能在局部区域进行微调,无法有效扩展对状态-动作空间的覆盖。相反,具有高度多样性的轨迹集合即便规模较小,也能为策略优化提供更丰富的学习信号。这一发现将研究的核心问题从“如何收集更多轨迹”转向“如何引导智能体生成更多样化的轨迹”,从而为后续的方法设计指明了方向。

方法

ExToken的核心思路是利用离线演示数据中蕴含的行为知识,将其转化为引导探索的离散信号。具体而言,框架首先对离线演示轨迹进行聚类分析,识别出若干具有代表性的行为模式,并将每种行为模式编码为一个离散的token。这些token本质上是对底层行为策略的压缩表示,能够在保持语义信息的同时,以简洁的形式传递给VLA策略。

在训练阶段的回滚轨迹收集过程中,ExToken并非简单地让策略自主探索,而是通过对策略施加不同token的条件化来主动引导探索方向。当策略被条件化于特定token时,其输出动作分布会向对应的行为模式偏移;当切换至不同token时,策略则展现出差异化的行为特征。这种设计使得研究者能够系统性地覆盖多种行为模式,避免智能体固守于少数几个熟悉的动作序列。形式化地,条件化策略可以表示为 ,其中 表示从行为先验中提取的离散token, 为当前状态, 为动作输出。通过在回滚过程中遍历不同的 ,ExToken显著改善了状态-动作覆盖范围。

然而,训练与部署之间存在一个关键差异:训练时可以通过随机采样token来鼓励探索,但部署时我们期望策略能够稳定地执行有效行为,而非在多种模式之间随机切换。为解决这一挑战,ExToken引入了第二个核心组件——状态条件化token选择器。这个模块以当前状态为输入,输出一个预测的token,指导策略在推理时使用最可能有效的行为模式。直觉上,选择器学习了一种从视觉观察到最优行为模式的映射,使得智能体能够根据具体场景自适应地决定采用何种探索策略。训练过程中,选择器与主策略联合优化,其目标是最小化累积回报的负期望,从而间接学习识别不同状态对应的有利行为模式。

实验与结果

研究团队在仿真环境和真实机器人平台上进行了广泛的实验验证。仿真任务涵盖了多阶段操作、物体重新排列等典型机器人操作场景;真实机器人实验则聚焦于桌面操作任务,测试方法在物理世界中的泛化能力。实验的核心设定是高度受限的交互预算——智能体只能在有限的回滚次数内与环境交互,这直接考验了方法的样本效率。

实验结果显示,ExToken在所有测试场景中均实现了对基线方法的显著超越。在收敛速度方面,采用ExToken的VLA策略在相同交互预算下能够达到更高的最终性能曲线起点,且更快地趋于收敛。值得注意的是,当将交互预算进一步压缩至极端水平时(如仅为基线方法的四分之一),ExToken的优势变得更加突出——基线方法因探索不足而性能急剧下降,而ExToken仍能维持稳定的任务表现。在真实机器人实验中,经过仅2小时的在线微调后,ExToken使策略在未见过的物体配置上实现了超过85%的任务成功率,展现了良好的泛化能力。

消融实验进一步验证了两个组件的必要性。移除行为先验token条件化后,轨迹多样性显著降低,策略陷入局部最优;移除状态条件化选择器后,虽然训练表现尚可,但部署时性能出现明显波动,证明了选择器在桥接训练与推理过程中不可替代的作用。

讨论与可借鉴点

ExToken的核心贡献在于揭示了轨迹多样性对[[样本效率]]的深层影响,并提供了一种将这一洞察转化为实用方法的有效路径。框架的设计体现了对问题的深刻理解:不是简单地增加探索的随机性,而是利用离线数据中的结构化知识引导有意义的探索。这种思路对于其他面临高交互成本场景的RL应用具有参考价值。

当前方法仍存在一定局限。行为先验token的质量高度依赖于离线演示数据的覆盖范围——如果演示集中缺乏某类关键行为模式,ExToken可能无法引导策略探索相应区域。此外,token数量的选择需要权衡多样性表示能力与选择器的学习难度,过多的token会增加决策复杂度而过少则无法充分覆盖行为空间。未来的工作可以探索自动确定最优token数量的方法,以及如何利用在线收集的数据迭代扩展行为先验库。

概念 · 7 个
摘要

聚焦强化学习在VLA模型中的探索效率问题,属于RL与机器人交叉领域

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.12931v1
发布日期
2026-07-01
PDF
https://arxiv.org/pdf/2607.12931v1
相关度
0.950
已纳入 ✨ wiki 📄 PDF

作为对手的世界模型:用于鲁棒运动规划的多智能体自博弈微调

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

Nie, Tong, Mei, Yuewen, He, Junlin, Tang, Yihong, Sun, Jian, Ma, Wei

arXiv:2607.10630v1 2026-07-14
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

masrlrobotics
重要图片 · 6 张
TL;DR

提出对抗世界建模多智能体自博弈框架,将规划器世界模型改造为对手,提升自动驾驶长尾场景鲁棒性。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

运动规划是自动驾驶系统的核心能力之一,它决定了车辆如何在复杂交通环境中做出安全、舒适的行驶决策。近年来,主流范式从传统的规则系统转向了生成式运动建模——受大语言模型启发,现代规划器将地图元素和运动基元视为离散 token,以自回归方式逐帧生成轨迹。这种方法在海量自然驾驶数据上表现出色,但一个根本性的弱点也随之暴露:它们本质上是在「模仿」人类驾驶数据中的常见行为,面对那些在数据中罕见但却关乎生命安全的长尾场景时,往往表现脆弱。

这些长尾场景包括但不限于:旁车突然且激进的插入、前车急刹后多车协同压制、以及诱导碰撞的诱导性变道等。它们在真实道路上时有发生,但在训练数据集中出现频率极低,传统的数据驱动方法很难有效覆盖。

对抗训练提供了一条解决思路——与其被动等待这些危险场景出现,不如主动「制造」它们来训练规划器的应对能力。然而,现有对抗训练方案存在一个根本性的架构不匹配问题:许多方法依赖外部对抗代理、启发式扰动策略,或者需要大量仿真器 rollout 来生成对抗样本。这些攻击往往是针对低维控制策略、固定关注对象或手工规则设计的,难以直接迁移到基于 token 的高维自回归规划范式中。

本文的切入点正在于此:既然规划器已经内置了一个预测交通流演化的世界模型(本质上是一个自回归多智能体序列模型),那为什么不能「废物利用」,把这个世界模型本身改造成一个懂行的对手?这样就不需要引入外部不兼容的攻击者,而是让环境模型「自己攻击自己」。

方法

方法的理论框架始于一个有约束的极小小博弈建模:将自车规划器的优化目标设定为极大化其收益,而将对抗性世界模型的优化目标设定为极小化自车收益。这是一个优雅的数学抽象,但直接求解这个博弈在计算上是不可行的——多智能体环境下的信用分配本身就是组合爆炸问题。传统方法要么依赖粗粒度的奖励共享机制,要么干脆放弃精细化建模,这都会导致对手行为要么过于保守、要么缺乏针对性。

AWM 的核心设计围绕一个原则性的解耦求解器展开,将难题分而治之。

在内层极小化阶段,规划器的预测式世界模型被「重新角色化」——它不再仅仅预测自然的交通流演化,而是学会扮演一个「恶意协调者」。这里的关键创新是引入了反事实信用分配机制来学习稀疏的攻击联盟。具体而言,系统会分析在给定场景下,哪些周围车辆应该对制造危险局面负责——是前车的急刹,还是相邻车道的故意挤压,又或者是多车的协同压制。通过反事实推理,系统能够隔离出真正起决定性作用的对抗动作,而不是把所有车辆都当作攻击者。这种稀疏的、场景自适应的攻击联盟学习,使得对抗行为既具有真实感(符合交通流基本规律),又具有针对性(直击规划器的弱点)。

在外层极大化阶段,自车规划器针对这个已冻结的对抗世界模型优化一种具有遗憾感知能力的鲁棒最佳响应。这里的「遗憾感知」是一个重要的设计考量:系统不仅关注平均性能,更关注最坏情况下的表现——毕竟安全驾驶的本质就是「不能出事」。通过尾部风险加权,自车规划器会特别关注那些虽然概率低但后果严重的对抗场景。同时,参考锚定的信赖域约束确保了优化过程不会为了追求极端鲁棒性而牺牲掉正常场景下的驾驶舒适度和效率。通俗地说,规划器学会在保持正常驾驶风格的同时,对付那些「专门找茬」的对抗交通参与者。

这个框架的一个巧妙之处在于,它在同一个自回归架构、统一的动作词表和场景表示下,同时参数化了自然交通流和对抗交通流。世界模型既是教师(提供正常驾驶的预测基础),又是对手(学会制造危险局面),两者在同一个模型中被协调优化。

实验与结果

实验在两个权威的自动驾驶规划基准上进行:nuPlan 和 InterPlan。前者是目前最大的闭环规划数据集,覆盖了多种真实的城市场景;后者专门针对交互密集的复杂场景设计,能够有效测试规划器在多车博弈中的表现。

实验结果首先验证了对抗交互的可迁移性:AWM 生成的对抗场景不是过拟合于特定规划器的脆弱性,而是能够泛化到不同的规划架构。这意味着攻击本身捕捉到了交通环境中真正具有挑战性的结构,而不是偶然的数值漏洞。

关键的性能对比显示,AWM 微调后的规划器在常规场景下保持了与基线方法相当的闭环性能,说明参考锚定信赖域成功约束了优化边界,没有让鲁棒性训练破坏正常驾驶能力。而在高度交互的长尾场景下,经过 AWM 对抗训练的规划器取得了显著优于对比方法的避险成功率和碰撞避免率。量化指标方面,在 nuPlan 的长尾场景子集上,最终规划器相较于仅在自然数据上训练的基线,危险场景下的成功率提升了约 15 个百分点。

消融实验进一步揭示了各组件的贡献:反事实信用分配使得攻击更加聚焦而非弥散,尾部风险加权确保了优化资源向高危场景倾斜,参考锚定机制则有效防止了鲁棒性优化走向极端。这些分析共同验证了设计决策的有效性。

讨论与可借鉴点

这篇论文的局限性值得客观审视。首先,框架的计算开销不可忽视——在内层需要更新对抗世界模型、在外层需要优化规划器,两阶段迭代的收敛速度直接影响实用性。其次,世界模型本身的能力上限决定了对手的「聪明程度」,如果基础世界模型对某些复杂交互模式建模不足,对抗训练也难以弥补这一根本缺陷。此外,论文主要关注静态或准静态的对抗场景生成,对于动态实时响应的对抗行为(如对方车辆根据自车反应实时调整策略)的建模尚未深入探讨。

尽管如此,这项工作为自动驾驶对抗训练提供了一个新的思路框架。将内部世界模型从「被动预测者」转变为「主动对手」的设计哲学,可能对其他需要鲁棒性优化的序列生成任务具有启发意义。反事实信用分配机制在多智能体场景下分离对抗责任的做法,也值得关注——它实际上是在回答「谁该为这个失败负责」这个因果推理问题,而不仅仅是传统的梯度归因。

从更宏观的视角看,这项工作反映了自动驾驶规划领域正在经历的一个范式转变:从被动数据拟合走向主动对抗学习,从单智能体优化走向多智能体博弈。这种转变的深层驱动力在于:真实世界的交通博弈本质上是多方参与的,任何只考虑自身最优的规划器都可能在与有敌意的或仅仅是行为异常的交通参与者的交互中失败。

概念 · 7 个
摘要

AWM极小极大博弈自博弈,nuPlan/InterPlan验证

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.10630v1
发布日期
2026-07-14
PDF
https://arxiv.org/pdf/2607.10630v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

Robo-ValueRL:面向离在线强化学习的可靠价值估计

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Xia, Wenke, Ren, Pei, Yu, Wenbo, Zhang, Yizhuo, Li, Jifan, Zhang, Yixue, Zhao, Yinuo, Gao, Qingyang, Fu, Jianlong, Tang, Jian, Wen, Ji-Rong, Che, Zhengping, Hu, Di

arXiv:2607.09866v1 2026-07-10
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

rlrobotics
重要图片 · 12 张
TL;DR

提出Robo-ValueRL方法,改进从离线到在线强化学习的价值估计可靠性,缓解分布偏移。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

离线到在线强化学习是近年来机器人操作领域备受关注的研究范式,其核心思想是先利用大量离线示教数据进行策略预训练,再通过在线交互持续改进策略。这种范式兼具离线学习的样本效率与在线学习的适应性,尤其适用于需要从异构数据中学习的真实机器人任务。然而,该方向的一个关键挑战长期被忽视:价值函数在整个流程中究竟扮演了什么角色,以及其可靠性如何系统性地影响最终的策略表现。

在离线到在线强化学习的全流程中,数据来源呈现显著异质性。离线阶段的数据可能来自人类演示、远程操控或历史任务记录,数据的质量、分布密度和任务覆盖范围参差不齐。进入在线阶段后,智能体与环境交互产生的新数据又与离线数据存在分布差异。这种异构数据的有效利用需要某种机制来区分样本质量、引导策略改进方向,而价值函数正是承担这一角色的候选者。

但价值估计本身面临严峻挑战。离线数据中的回报信息往往稀疏或带有噪声,而在线交互中价值估计又需要应对由策略更新带来的分布偏移问题。已有研究大多将价值估计视为辅助工具或作为算法设计的副产品,缺乏对「价值可靠性如何塑造策略优化」这一核心问题的系统追问。正是这一研究空白,促使作者提出 Robo-ValueRL,旨在建立价值可靠性与下游策略性能之间的可量化关联。

方法

Robo-ValueRL 的设计围绕一个核心洞察:价值函数的可靠性不仅是算法性能的隐式影响因素,更应该被显式建模、追踪和利用。这一洞察催生了三个关键设计决策。

第一,学习以历史为条件的价值估计器。传统的价值函数通常只考虑当前状态和动作,而 Robo-ValueRL 让价值估计器 conditioning 在完整的历史轨迹信息上。这一设计的直觉在于,单一状态-动作对往往不足以判断某个决策的长期收益,而结合历史上下文能够更准确地从离线示教中提取动作的质量信号。具体而言,价值网络 接收当前状态 与历史轨迹 作为输入,输出对累计回报的估计。历史信息的引入使得价值估计器能够区分「幸运的状态」与「真正好的动作选择」,从而在离线数据中实现更精细的质量评估。

第二,通过双指标体系评估价值可靠性。Robo-ValueRL 引入两类互补的可靠性指标:全局进度指标衡量价值估计与任务整体进展的相关程度,即价值函数能否反映「当前策略距离目标还有多远」;局部偏好指标衡量价值估计对相邻动作质量排序的一致性,即对于相似的状态,高价值估计是否始终对应高质量动作。这两个指标分别从宏观任务层面与微观动作层面捕捉价值估计的可靠性,共同构成了一个多维度的价值质量评估框架。

第三,将可靠价值估计贯穿离线预训练与在线改进两个阶段。在离线预训练阶段,Robo-ValueRL 采用质量条件的一致性策略预训练策略。不同于传统行为克隆对所有离线样本一视同仁的做法,该方法根据价值估计为每个样本分配质量权重,使得策略在学习过程中更多地参考高质量示教,同时保留对低质量样本的覆盖以维持分布多样性。在在线改进阶段,系统设计了面向在线回放的残差适配模块。该模块利用实时更新的价值估计来优先处理高质量的在线回放数据,在探索与利用之间取得更优平衡,并为在线阶段的价值函数提供持续修正的反馈机制。

这种「评估-传播-利用」的闭环设计使得价值可靠性不再是抽象的算法属性,而是贯穿整个离线到在线流程的可操控变量。

实验与结果

实验覆盖了两种真实机器人任务场景:毫米级精度的芯片插装任务,以及可泛化的积木拆卸任务。数据集规模达到 240 小时的离线示教与超过 3,000 条在线回放轨迹,这一规模在机器人操作领域具有相当的代表性。

实验首先验证了核心假设:下游策略性能与价值可靠性之间存在显著的正相关关系。通过对比使用不同可靠性水平价值函数的实验组,作者观察到使用高可靠性价值引导的策略在两项任务上的成功率分别比低可靠性组高出约 15% 和 12%。这一结果为价值可靠性塑造策略优化的论断提供了直接的实验支撑。

消融实验进一步揭示了价值引导在不同阶段的贡献。在离线预训练阶段,价值引导使得行为克隆策略能够自动聚焦于高质量示教片段,避免了低质量示范对策略的误导。相比于朴素的行为克隆,价值引导版本在长-horizon 任务中的性能提升尤为明显,表明高质量动作估计对于学习长序列决策尤为关键。在线改进阶段,残差适配模块通过优先处理高价值回放数据,有效稳定了策略的在线微调过程,防止了价值函数的过度泛化导致的策略退化。

值得注意的是,实验还观察到价值可靠性指标与任务难度之间的交互效应。在精度要求更高的芯片插装任务中,价值可靠性的边际贡献更大,这可能是因为精细操作对动作质量判断更敏感,可靠的价值估计能够更精准地区分「接近成功」与「趋于失败」的动作序列。

讨论与可借鉴点

Robo-ValueRL 最重要的贡献在于揭示了价值估计可靠性的独立价值。长期以来,研究社区倾向于将价值估计视为策略优化的附属品,关注的是算法层面的改进而非价值质量本身。该论文通过系统性的实验设计,证明了投资于更可靠的价值建模能够获得实质性的策略性能提升,这为未来的研究指明了一个被低估的方向。

该工作的一个局限在于其双指标体系依赖于任务层面的定义,这在一定程度上需要人工介入。对于完全无监督或任务边界模糊的场景,如何自动推断全局进度与局部偏好仍是开放问题。此外,实验主要在结构化的机器人操作任务上验证,泛化到更开放的视觉导航或自然语言任务尚需进一步探索。

对于从事离线强化学习与机器人研究的研究者,Robo-ValueRL 的启发在于:应当将价值质量纳入算法评估的常规指标,而非仅关注最终策略的回报。同时,质量条件的数据加权策略为处理异构数据提供了一种简洁有效的思路,这种「让价值引导数据利用」的思路在更广泛的顺序决策问题中可能具有普适价值。

概念 · 6 个
摘要

离线到在线RL的可靠价值估计

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2607.09866v1
发布日期
2026-07-10
PDF
https://arxiv.org/pdf/2607.09866v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

约束技能发现:基于无监督强化学习的四足机器人运动

Constrained Skill Discovery: Quadruped Locomotion with Unsupervised Reinforcement Learning

Vassil Atanassov, Wanming Yu, Alexander Luis Mitchell, Mark Nicholas Finean, Ioannis Havoutis

arXiv:2410.07877 2024-10-10
0.90 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

robotics
TL;DR

现有受约束技能发现方法(LSD/METRA)通过最大化潜空间迁移模长来提升状态覆盖,但在四足 locomotion 上只能学到高速度、难部署的技能。本文替换潜空间最大化为 norm-matching 重构目标,保留相同欧氏距离约束,使 ANYmal 机器人学到覆盖更广速度区间的稳定 locomotion 技能,并在真机上无需再训练即可零样本到达任意 Cartesian 目标点。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

四足机器人的动态运动学习长期以来依赖奖励工程、模仿学习与课程学习的组合方案。这种范式虽然能在特定任务上取得良好效果,但需要大量人工设计奖励函数和任务先验,既耗时又限制了学到的行为的泛化能力。例如,若将"直接朝目标移动"设为奖励,当目标与机器人之间存在障碍物时,策略很容易陷入局部最优而无法到达目标。

技能发现(Skill Discovery)提供了另一种思路:让机器人在无任务特定奖励的情况下,通过内在动机(intrinsic motivation)自主探索,学到一组可复用、可组合的程序化行为。这类方法通常以互信息(Mutual Information)作为优化目标,通过最大化技能变量 与状态 之间的依赖关系来驱动策略探索。在互信息的变分下界框架下,学到的潜空间表示能够编码有意义的技能维度。

然而,这一族方法存在两个主要缺陷:其一,探索激励不足——判别器(discriminator)一旦能够区分不同技能,就不再奖励更远距离的探索,导致状态覆盖范围有限;其二,强任务先验——许多 locomotion 类工作不得不将判别器的输入限定为 XY 基体位置,以避免策略学到无意义的关节扰动。

Park 等人提出的 LSD 与 METRA 方法尝试解决第一个问题。它们通过对齐潜空间迁移与技能变量,并施加距离约束 ,在潜空间与状态空间两层同步驱动距离最大化。这种设计在 MuJoCo 等标准 benchmark 上确实显著提升了状态覆盖。但当研究者将这套方法应用于四足机器人 + 欧氏距离约束时,一个意想不到的问题浮现出来:策略被推向"每个方向尽可能加速"的极端,产生大量高动态、难以部署到真实硬件上的瞬态技能。

本文的核心观察正在于此:对四足 locomotion 而言,LSD/METRA 必最大化模长的设计不是优点而是缺陷。本文试图回答的问题是——能否在保留距离约束的前提下,让策略学到全速度区间的稳定运动行为?

方法

要理解本文的改进,首先要弄清楚 LSD/METRA 的目标函数为什么会导致"速度最大化"这一非预期行为。

将潜空间表示 的后验 参数化为单位方差高斯分布后,互信息的变分下界可化为:

以 episode 起点 和终点 作为输入,进一步得到损失函数:

展开平方项后丢弃与 无关的常数,只保留与 的内积项:

这就是 LSD 的核心目标。可以看到,它只约束了方向对齐——让潜空间迁移向量 与技能向量 方向一致。但对模长没有任何约束。在欧氏距离约束 下,策略的博弈均衡是让迁移模长尽可能大,因为这不会损失方向对齐的分数,同时还能让内积更大。于是所有技能都趋向于以最大速度执行。

本文提出的改进很简单:将"方向对齐 + 隐式模长最大化"替换为"norm-matching 重构"。新的目标函数为:

约束保持不变:

这意味着直接让潜空间迁移向量 回归到技能向量 ,而不是只匹配方向而让模长自由增长。物理含义是 既要编码方向又要编码大小。通过将模长匹配显式纳入优化目标,策略不再有动力去追求更高的速度。

为方便在强化学习的 batch 上优化,作者采用 telescoping trick 将目标改写为 per-step 形式:

其中 是归一化因子,与技能空间半径和 episode 长度相关。相应地,intrinsic reward 设计为:

这个奖励函数将 MSE 误差映射到 区间——误差越小,奖励越高,从而驱动策略沿 方向精确移动。

在观测与动作设计上,本文延续了 LSD 的设置:观测包含关节位置/速度、基体线速度、角速度、四元数、基体位置等完整信息,不做任何任务先验裁剪;动作输出 12 个关节相对 nominal stand 的目标位置,经 400 Hz PD 控制器执行。奖励仅包含通用正则化项(能量消耗、平滑性、足端腾空时间、姿态、高度、不期望接触等),完全不含任务特定奖励。

实验与结果

实验在 NVIDIA Isaac Gym 的 1024 并行环境中用 PPO 训练,策略和 encoder 均采用 MLP 架构,潜空间维度设为 2 或 3。基线方法包括 LSD(欧氏约束)、METRA(时序约束),以及 CASSI、ASE、DOMiNiC 等在其他四足/角色动画任务上验证过的技能发现方法。所有对比均剥离了模仿学习或预训练教师组件,以公平评估纯技能发现能力。

速度分布是衡量方法有效性的首要指标。在 1000 条均匀采样的技能下,LSD 和 METRA 学到的速度几乎全部聚集在高速度区间(约 2.5~3 m/s),几乎没有低速技能。相比之下,本文方法的速度分布在 0~3 m/s 范围内呈近似均匀分布——这直接证明了 norm-matching 目标成功解锁了低速技能的习得。

在 XY 状态空间覆盖率上,这一对比更加悬殊。LSD 的末端位置呈环形分布(因为模长总是最大化的),而本文方法展示出与技能模长严格成比例的覆盖范围——从原点附近(低速技能)一直延伸到圆盘边缘(高速技能)。ASE、CASSI、DOMiNiC 等方法由于任务先验限制或教师策略缺失,只能学到短程抖动或离散技能,覆盖范围远不及本文方法。

零样本目标跟踪(Zero-Shot Goal Tracking)是本文方法最引人注目的下游应用。由于 encoder 学到了 到状态空间的映射,推理时只需将目标状态 的潜表示与当前状态 的潜表示相减,即可得到期望的技能向量:

通过闭循环每步更新 ,机器人会在 收敛到零时停在目标点;若 保持恒定,机器人会持续穿越目标。仿真实验显示,本文方法能准确降速、到达并稳定在目标位置(误差小于 0.5 m),而 LSD 由于其潜空间"高速专用"的设计,会反复穿越目标点。

真机部署在 ANYmal 四足机器人上验证了系统的可行性。机器人在仿真中训练、不经任何微调的情况下,能够依次到达两个不同的 Cartesian 目标点并稳定停驻。进一步地,当将潜空间扩展到 3 维时,系统能够同时控制基体在 x、y 方向的位移以及偏航角(heading),这在 2 维潜空间下是不可控的维度。

讨论与可借鉴点

本文的核心贡献在于揭示了受约束技能发现方法中"最大化潜空间迁移模长"这一设计选择在不同任务场景下的双面性:它确实能提升状态覆盖,但当覆盖范围本身不是目标时(例如 locomotion 需要多种速度而非越快越好),这一设计反而成为瓶颈。通过将优化目标从方向对齐 + 隐式最大化改为 norm-matching 重构,本文在不牺牲距离约束的前提下实现了更均衡的速度分布。

从方法论角度看,本文展示了一个朴素的道理:约束条件与优化目标的组合决定了策略的行为空间。LSD/METRA 的距离约束是必要的(否则 会坍缩),但与最大化模长的目标结合后就产生了非预期的"速度竞赛"。本文的 norm-matching 目标在保留约束的同时,精确指定了"潜空间迁移应该有多大",从而将策略从速度最大化的囚笼中解放出来。

值得指出的是本文方法的局限与拓展方向。首先,约束条件只给出了潜空间迁移模长的上界,并不保证实空间距离同步等于潜空间距离,因此理论上仍可能出现"用大潜距离换小实距离"的情况。但实践中 extrinsic regularization(能量、平滑等)会将策略推向稳定行为,使得这一潜在问题并不显著。其次,更高维的潜空间(如控制更复杂的行为)需要更强的 encoder 架构来保证 的表示能力——这是一个工程上的挑战,也是未来工作的方向。

对于更广泛的无监督技能发现研究,本文提供了一个有益的视角:在设计目标函数时,不仅要问"我想让策略探索什么",还要问"在给定的约束下,策略会趋向于做什么"。约束与目标的微妙组合往往决定了方法的成败,而非某个单独组件的精巧程度。

TLDR

现有受约束的技能发现方法(LSD/METRA)通过最大化潜空间迁移模长来提升状态覆盖,但在四足 locomotion 上只能学到高速度、难部署的技能。本文替换潜空间最大化为 norm-matching 重构目标,保留相同欧氏距离约束,使 ANYmal 四足机器人学到覆盖更广速度区间的稳定 locomotion 技能,并在真机上无需再训练即可零样本到达任意 Cartesian 目标点。

Abstract (English)

Representation learning and unsupervised skill discovery can allow robots to acquire diverse and reusable behaviors without the need for task-specific rewards. In this work, we use unsupervised reinforcement learning to learn a latent representation by maximizing the mutual information between skills and states subject to a distance constraint. Our method improves upon prior constrained skill discovery methods by replacing the latent transition maximization with a norm-matching objective. This not only results in a much a richer state space coverage compared to baseline methods, but allows the robot to learn more stable and easily controllable locomotive behaviors. We successfully deploy the learned policy on a real ANYmal quadruped robot and demonstrate that the robot can accurately reach arbitrary points of the Cartesian state space in a zero-shot manner, using only an intrinsic skill discovery and standard regularization rewards.

Abstract (中文)

表示学习与无监督技能发现能让机器人在无需任务特定奖励的情况下获得多样化、可复用的行为。本工作使用无监督强化学习,通过对技能与状态之间的互信息(在距离约束下)做最大化,学习潜空间表征。我们把先前受限技能发现方法中"最大化潜空间迁移"的目标改为范数匹配范数匹配目标,从而不仅获得了远超基线的状态空间覆盖,还使机器人学到了更稳定、更易控制的运动行为。我们把学到的策略部署到了真实的 ANYmal 四足机器人上,证明机器人可以零样本精确到达 Cartesian 状态空间的任意点,完全只依赖固有的技能发现奖励与标准的正则化奖励。

动机

LSD/METRA 必最大化潜空间迁移模长,在欧氏距离约束下导致策略只能学到高速度、高动态的瞬态技能,无法用于真实硬件部署,且缺乏低速技能会让下游任务表现退化。

方法

在潜空间迁移对齐项之外增加 norm-matching 的 MSE 目标 J^Ours = -1/2 E[( (phi(s_T)-phi(s_0)) - z )^2],约束仍为 ||phi(s_T)-phi(s_0)|| <= ||s_T - s_0||;用 Smooth L1 训练 encoder,2D 技能均匀采样于半径 50 的圆内,奖励 r(t)=1/(1+sigma*e) 鼓励 latent 方向和模长同时匹配。

结果

在 1000 条均匀采样技能下,本方法速度分布横跨 0~3 m/s,LSD/METRA 几乎全部聚集在高速度区;XY 覆盖率显著高于 ASE/CASSI/DOMiNiC;真机 ANYmal 可在闭环 z_des 更新下准确到达并停在连续两个目标点,3D 潜空间可同时控制位置与朝向。

结论

把受约束技能发现的优化目标从「对齐 + 最大化模长」改为「对齐 + norm-matching 重构」,在不牺牲距离约束的前提下显著拓宽学习到的技能速度分布,让学到的策略直接具备 zero-shot goal-tracking 能力,可推广到更高维技能空间但需更强的 encoder 架构。


深度精读

> 基于 arXiv HTML 全文生成 · 模型: MiniMax-M3 · 模型生成时间 2026-07-21 · 全文 ~62 KB

一、研究背景与动机

四足机器人动态运动学习长期依赖奖励工程 + 模仿学习 + 课程学习的组合(Hwangbo et al. 2019; Lee et al. 2020; Miki et al. 2022),既耗时又强引入了任务先验。举例而言,若把"直接朝目标移动"作为 reward,当目标与机器人之间存在遮挡时该策略就会陷入局部最优。

与之相对的技能发现 / options learning(Stolle & Precup 2002; Salge et al. 2013; Choi et al. 2021; Aubret et al. 2023)依赖 intrinsic motivation 在无任务奖励下自主探索,目标是学到一组可复用的程序性行为。潜空间表示通常以互信息 (MI) 作为优化目标 I(z; s),其下界由 variational discriminator q_phi(z|s) 给出。这一族方法的两条主流缺陷是:

1. 探索激励不足:只要 discriminator 能区分技能,就不再奖励"更远"的探索,导致覆盖范围有限;

2. 强任务先验:locomotion 类工作大多把 discriminator 输入限定为 XY 基体位置(Eysenbach et al. 2018; Sharma et al. 2020b),才能避免学到无意义的关节扰动。

Park et al. (2021; 2023) 提出的 LSDMETRA 把对齐项写为 L^{LSD} = -1/2 E[(phi(s_T)-phi(s_0))^T z],并加约束 ||phi(s_T)-phi(s_0)|| <= d(s_T, s_0)(d 为 Euclidean / temporal distance),从而在 latent 与 state 两层空间同步驱动距离最大化。在 MuJoCo 等标准任务中此招对覆盖提升明显,但在 locomotion + Euclidean 约束下,策略被推向"每个方向尽可能加速"的极端,产生大量难以部署在硬件上的高动态技能。

本文的核心立论:对 4 足 locomotion 而言,LSD/METRA 必最大化模长的设计是缺陷而非优点。本文用 norm-matching 重构替代最大化,既保留距离约束又学到全速度区间下稳定的 locomotion 行为。

二、方法详解

2.1 LSD/METRA 简要回顾

Park et al. 把 q_phi(z|s) 参数化为 unit-variance Gaussian 之后,MI 下界可化为:

```

I(z; s) >= -1/2 E_{s,z}[ ||phi(s) - z||^2 ] + c (eq.5)

```

进而以 episode 起止状态作为输入,得到损失:

```

L = -1/2 E[ ||(phi(s_T) - phi(s_0)) - z||^2 ] + c (eq.6)

```

该损失分解为 L2 regularization、directional alignment、与仅依赖 z 的常数项,丢弃平方 phi 项后等价于:

```

L >= -1/2 E[ (phi(s_T) - phi(s_0))^T z ] = L^{LSD} (eq.8)

```

约束为对所有 state 转移:

```

|| phi(s_T) - phi(s_0) || <= d(s_T, s_0) (LSD/METRA 约束)

```

此时不论 z 大小,策略都倾向于"使 latent 迁移模长最大化";落到 Euclidean 距离度量下,直接体现为所有技能都跑得越来越快

2.2 本文目标(Norm-Matching Constrained Skill Discovery)

本文保留相同距离约束,但改写目标为:

```

J^{Ours} = -1/2 E_{s,z}[ || ( phi(s_T) - phi(s_0) ) - z ||^2 ],

s.t. || phi(s_T) - phi(s_0) || <= || s_T - s_0 || (eq.9)

```

— 即直接让 (phi(s_T) - phi(s_0)) 回归 z,而不是只匹配方向 + 最大化模长。这一改动把"模长匹配"显式纳入目标,以 Smooth L1 训练 encoder phi(·);策略训练仍按 cooperative game,自身最小化同一损失。

为方便 RL batch 优化,作者沿用 Park et al. 的 telescoping trick,改写为 per-step 损失:

```

J_t^{Ours} = -1/2 E[ || N ( phi(s_{t+1}) - phi(s_t) ) - z ||^2 ],

s.t. || phi(s_{t+1}) - phi(s_t) || <= || s_{t+1} - s_t || (eq.10)

```

— 该形式是原目标的一个上界(附录 A.1 给出证明)。奖励则取:

```

r(t) = 1 / (1 + sigma * e),

where e = || N ( phi(s_{t+1}) - phi(s_t) ) - z ||^2 (eq.11)

```

设计意图:r(t) 越大表示 latent 迁移与 z 越吻合。注意:距离约束只给出 latent 迁移模长的上界,并不保证实空间距离同步等于 latent 距离,所以仍会出现"用大 latent 距离换小实距离"的情况。但本文的 extrinsic regularization(能量/平滑/触地)会把策略推向稳定行为,因此实践中该潜在问题并不显著。

2.3 RL 设置

  • 观测:关节位置/速度、基体线速度 v_b、角速度 omega_b、四元数 qbar_b、基体位置 p_b;不做任务先验裁剪(与 LSD 相同,无须只喂 XY)。
  • 动作:12 个关节相对 nominal stand 的目标关节位置。
  • 控制:策略 50 Hz 输出,叠加到 PD 控制器,400 Hz 运行。
  • 奖励:仅含能量/平滑/feet-air-time/姿态/高度/不期望接触等通用正则奖励,完全不含 task-specific reward;消融实验(A.6)显示有无这部分奖励对学到的多样性无显著影响。
  • Baseline:LSD(Euclidean 约束)+ METRA(temporal 距离),复现时取 2D 技能空间、均匀采样 ||z|| <= ||z_max||=50 的圆盘(2D skill 范围,因此对 300 步 episode 而言 per-step latent 迁移 ≈ 0.17,LSD 在同等 episode 下的上界)。
  • 基础比较:除 LSD/METRA 外,还对比 CASSI / ASE / DOMiNiC 等在 quadruped / 角色动画上验证过的方法,所有比较均剥离它们的"模仿/预训练教师"组件,公平地评估 skill discovery 本身。

三、关键公式解读

```

J^{Ours} = - 1/2 E_{s,z}[ || (phi(s_T) - phi(s_0)) - z ||^2 ]

s.t. || phi(s_T) - phi(s_0) || <= || s_T - s_0 || (eq.9)

```

把"对齐 + 最大化范数"拆解成一项统一的 MSE 回归,使得 latent 迁移的模长也被显式匹配;约束保持 LSD 距离约束不变,这是与 LSD 解耦的关键。物理含义:phi(·) 既要编码方向又要编码大小

```

L^{LSD} = -1/2 E[ (phi(s_T) - phi(s_0))^T z ] (LSD baseline)

```

只约束了内积方向、不控制模长,因此策略总是把 latent 模长推到饱和点,直接体现为高速度。

```

r(t) = 1/(1+sigma * || N (phi(s_{t+1})-phi(s_t)) - z ||^2) (eq.11)

```

把 MSE 误差映射到 (0, 1] 区间,鼓励更小误差 → 更大奖励,作为 intrinsic reward 驱动策略沿 z 方向走。

```

z_des = phi(s_des) - phi(s_t) (zero-shot goal)

```

推理阶段,通过当前 latent 与目标 latent 之差算出期望技能向量 z_des,闭循环每步更新即可让 robot 在 z_des 收敛到 0 时停在目标点;若 z_des 恒定则机器人会持续穿越目标。

```

||z|| <= ||z_max|| = 50, per-step 距离 ≈ 0.17

```

设定 max skill 模长,使得 J^{Ours} 与 LSD 在最大 latent transfer 上同尺度可比,从而保证对比实验的可解释性。

四、图表解读

图 1 (系统总览) 展示 latent space Z^2 + encoder phi(·) 与 skill-conditioned policy pi(a|s,z) 的联合训练,以及"通过调节技能模长即可控制 base velocity"的核心卖点——与 LSD/METRA 必最大化迁移的方向图对照

图 2 (Learning Scheme) encoder 将 (s_t, s_{t+1}) 映射至 latent,以 MSE 对齐 z;agent 收到基于 loss 大小的 intrinsic reward + 平滑化 extrinsic reward。

图 3 (Base Velocity Histogram) 横轴 0~3 m/s,纵轴密度。LSD 几乎全堆在最右(高速度),METRA 类似,本文则在 0~3 m/s 区间呈近似均匀分布,证明低速/中速技能被有效学到。

图 4 (XY State Coverage) 把各方法在 1000 采样技能下的 XY 末端位置画在同一坐标系:

  • LSD / METRA:相同 latent 总是产生相同模长,且该模长恒定最大化,色块呈环形;
  • ASE 2D (full obs):只学到微抖动;
  • ASE 2D XYO (限 XY):可移动但幅值小;
  • CASSI 6 skills XYO:小段 < 1 m,无法远距离穿越;
  • DOMiNiC(velocity-only):能动但范围小,技能离散;
  • 本文:固定 ||z_max|| 与可变 ||z|| 都展示了与技能模长严格成比例的覆盖范围,低速端可达 0。

图 5 (Zero-Shot Goal Tracking Pipeline) 由 phi(s_des) - phi(s_t) 计算技能 z_des,闭循环每步更新。

图 6 (Goal Tracking Comparison) 上排本方法:准确降速、到达并停在目标;下排 LSD:多次穿越目标(overshoot)——因为它的 latent 空间是"高速专用"。

图 7 (Hardware Tracking) 真实 ANYmal 顺序到达两个目标点,显示系统部署可行。

图 8 (3-D Latent Space) 把 latent 维度升到 3,可同时给出 base position + heading 指令。

五、实验设置与结果

5.1 训练与硬件

  • Sim:NVIDIA Isaac Gym,1024 并行环境,PPO 更新。
  • Robot:ANYmal,12-DoF 关节。
  • 网络:MLP policy + MLP encoder phi(·),latent dim ∈ {2, 3}。
  • 部署:真机 ANYmal + 400 Hz PD 控制器(参 A.3)。
  • 基线:LSD(Euclidean)、METRA(Temporal)、ASE、CASSI、DOMiNiC。
  • 评测:在 1000 个均匀采样技能下统计 base velocity histogram 与 XY position。

5.2 主结果

1. 速度分布(图 3):本文在 0~3 m/s 内近似均匀;LSD/METRA 几乎全聚集在高速段,验证了"不最大化模长"带来的低速技能。

2. XY 覆盖(图 4):本方法在所有方法中覆盖率最高;ASE / CASSI / DOMiNiC 受限于任务先验或教师策略,只能学短程抖动。

3. Zero-Shot Goal Tracking(图 6 仿真):本方法可多次到达目标并在 0.5 m 误差内停稳,LSD 由于 latent 必饱和高速度,会反复穿越。

4. 真机部署(图 7):ANYmal 在两个连续目标点之间 3 次收敛 真实硬件实验表明该方法可直接上机。

5. 3-D 潜空间(图 8):可同时控制 x, y 与偏航角,后者在 2-D latent 下是不可控维度。

5.3 消融 / 补充

  • A.5 LSD vs METRA 对比:METRA 在本文设定下与 LSD 行为几乎相同(也是最大化模长),无法得到低速技能——证明问题主要来自最大化模长而非度量选择。
  • A.6 内在/外在奖励消融:除掉 extrinsic 正则后,multi-modal skill 仍可学到,但运动不"美观"且部分难上硬件——说明 extrinsic 正则是"美学修正"而非技能存在性的必要条件。

六、Related Work 与本文定位

  • Legged Locomotion RL:本文与 Hwangbo 2019 / Lee 2020 / Kumar 2021 / Miki 2022 等标准 velocity-tracking 与 perceptive locomotion 工作明确分离开来——本文不需要 task-specific reward,直接用 intrinsic skill discovery。
  • Skill Discovery:本文属于constrained skill discovery家族,继承了 LSD/METRA 的距离约束,没有继承它们的模长最大化目标;与 DIAYN / DADS / VALOR / DISAIN / CASSI / ASE 这一族无约束 MI 工作相比,本文既有 MI 下界又多了状态空间距离的诱导项,带来更广覆盖。
  • Loco-Manipulation:作者把本文视为把 skill discovery 应用到 loco-manipulation 的前置工作(高层指令 → 已有 skill 字典)。
  • 本文相对 DOMiNO (Cheng et al. 2024a) 的差异化:DOMiNO 用"模仿一个能到目标的预训练策略"产生多样化技能,本文完全不依赖这样的前置策略,直接通过 intrinsic reward 学到零样本目标追踪能力。

七、优点

1. 真正 zero-shot:不依赖 teacher policy / motion dataset,只需 skill discovery + 标准正则奖励。

2. 硬件可用:低速技能的存在让任何一项策略都能上真机,不需额外 sim-to-real 修复。

3. 可解释:技能模长直接控制 base velocity 量级,下游任务可"按距离挑技能"。

4. 数学简洁:只把损失从 directional alignment 替换为 norm-matching MSE,不动距离约束结构,与 LSD 兼容好。

5. 可扩展到 3D 潜空间,联合控制位置 + 朝向。

八、局限性

1. Euclidean 距离度量:关节位置等高维状态在 Euclidean 度量下会被"高频抖动"满足约束——未来可考虑 time-aligned / phase-aware 度量。

2. 3D+ 潜空间训练困难:norm-matching 比起 LSD 对 encoder 表征容量要求更高,4D+ 潜空间在本文结构下尚不能稳定收敛。

3. rotation 控制不完整:3D 潜空间仅控制偏航,绕俯仰/横滚的姿态任务不易学。

4. 下游任务仅限 goal-tracking:尚未在 manipulation / parkour / 跨地形等更复杂下游任务上验证。

5. 技能"覆盖"≠"多样性":均匀分布不能完全刻画不同技能之间的语义差距,需要更细的语义评估。

九、复现要点

  • 论文 arXiv:2410.07877(Oxford + Dyson, ICC 投稿)。
  • 代码:截至本笔记生成日(2026-07-21)未在文中给出官方仓库链接;Park et al. 2021(LSD)的 code 已公开,本文可作为 LSD 的 loss 替换复现。
  • 基线对比:必须复现 LSD 与 METRA(都来自 Park 等),否则无法验证 norm-matching 的相对收益;ASE/CASSI/DOMiNiC 的去模仿变体也需要重新训练。
  • 关键超参:||z_max|| = 50、latent dim ∈ {2, 3}、episode 长 300、PPO + 1024 envs、Smooth L1 训练 encoder。
  • 奖励:仅 extrinsic 正则(能量/平滑/feet-air-time/姿态/高度/不期望接触),不要加 task reward。
  • 真机部署:ANYmal + 400 Hz PD,姿态与速度闭环控制使用 onboard state estimator。
  • 期望硬件:与 LSD 同量级——Isaac Gym 上 8~16 GPU 即可训 ~亿步级 batch;真机实验需要 ANYmal 平台 + 实验室操控环境。

十、适用场景与延伸思考

  • 理想用途:无奖励或弱奖励下的四足基座策略预训练;其学到的 latent 可作下游 RL 的结构化 action prior;在 parkour / loco-manipulation / uneven-terrain navigation 等任务里,可用本方法找到"低速-精确"基元组合。
  • 可借鉴到的方向:让 norm-matching 的概念推广到双臂 / 移动机械臂 / 旋翼无人机等其他 embodied RL 平台,把"模长"自然映射为"轨迹速度/推进速度"。
  • 理论延伸:把 norm-matching + 距离约束看成一个泛化的 constrained skill discovery 框架——后续可以探索 weighted norm matching(避免 0 模长技能退化),或与最优传输 / Wasserstein 距离度量结合,代替 Euclidean。
  • 工程含义:norm-matching + 闭循环 z_des = 一个"用 latent 距离表达下游任务"的简洁编程模型,下游任务 = "给定点 → 用 phi 编码出 z_des → 喂给 policy 即可"。

论文基本信息

  • arXiv ID: 2410.07877v1
  • 提交日期: 2024-10-10
  • 分类: Computer Science > Robotics (cs.RO)
  • 作者机构: Department of Engineering Science, University of Oxford; Dyson
  • 通讯作者: vassilatanassov@robots.ox.ac.uk
  • 项目页/代码: 文中未提供官方仓库链接(可关注 Park et al. 2021 LSD 项目作为基础)

来源:

摘要

针对 LSD/METRA 在四足 locomotion 上必收敛到高速度技能、无法部署到真实硬件的核心问题,提出 norm-matching 目标 + 欧氏距离约束,实现更广状态覆盖与真机 zero-shot 目标追踪。

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2410.07877
发布日期
2024-10-10
PDF
https://arxiv.org/pdf/2410.07877v1
相关度
0.900
已纳入 ✨ wiki 📄 PDF

LAPA:从无标签视频预训练视觉-语言-动作模型

Latent Action Pretraining from Videos

Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Sejune Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Yuchen Lin, Lars Liden, Kimin Lee, Jianfeng Gao, Luke Zettlemoyer, Dieter Fox, Minjoon Seo

arXiv:2410.11758 2024-10-15
0.85 相关度

📒 编译结果(浏览器本地缓存,下次访问自动显示)

ICLR 2025rlroboticspretraining
TL;DR

现有 VLA 必须依赖人类遥操作采集的真值动作标签,严重限制了数据规模和来源。LAPA 提出三阶段无监督预训练:先用 VQ-VAE 把视频帧间的潜动作量化为离散 token,再用 VLM 做行为克隆预测这些潜动作,最后在小规模机器人数据上把潜动作映射到真实动作。实验显示其在仿真与真机上均显著优于其他无动作标签的视频预训练基线,且在多个真实任务上以 +6.22% 击败依赖真值动作训练的 OpenVLA;即使只用人类操控视频预训练也能正向迁移,为把 VLA 推到 web-scale 视频数据打开了门。

📖 中文解读 Polaris 风格 5 节

研究背景与动机

视觉-语言-动作模型把大型视觉-语言模型与机器人控制相结合,通过在多样机器人数据集上微调获得语言条件操控、物体泛化、指令分布外泛化等能力。然而,现有 [[VLA]] 模型在预训练阶段严重依赖人类遥操作采集的真值机器人动作标签——夹爪位姿、关节角度、末端执行器速度等——这类数据的采集成本极高、规模极其有限。典型代表如 Open X-Embodiment 仅约 22 万条轨迹,远不能与互联网视频的规模相提并论。

与此同时,YouTube、Ego4D、Something-Something 等平台上海量的第一人称/第三人称操控视频展示了丰富的物理交互、因果推理和人类技能,但它们既没有动作标签,又存在显著的 [[具身鸿沟]]:人类手部形态、相机视角与机器人差异巨大,无法用直接模仿人类动作的方式监督。这种两层根本性挑战——缺乏显式动作标签以及具身差异——使得从互联网视频中训练机器人策略一直是个悬而未决的开放难题。

LAPA 的核心切入点在于:与其费力把互联网视频"翻译"成机器人动作,不如先从视频帧间的变化中自动发现一套"动作无关但视觉有意义的"离散潜动作表征,让 [[VLM]] 在这套表征上做行为克隆,最后仅在极少量带标签的机器人数据上完成具身对齐。这种"潜动作作为中间接口"的思路把"无标签预训练"问题与"具身映射"问题解耦,从而绕开了前述两大挑战。

方法

LAPA 的方法论由三个顺序执行的训练阶段构成,形成从无标签视频到真实机器人动作的完整数据流水线。

阶段一:潜动作量化(Latent Action Quantization)。给定视频帧对 ,编码器 将两帧分别编码为特征向量 ,随后对残差 通过最近邻查找映射到码本 中的离散索引,获得"潜动作" token 。解码器 则用原始帧特征与量化后的潜动作重建下一帧 。整个阶段采用 [[VQ-VAE]] 的标准训练目标,包含重建损失、承诺损失以及码本更新项,使用 straight-through estimator 处理梯度。这一阶段完全不需要任何预定义的动作先验(如末端执行器位姿或关节角),潜动作的语义完全从像素变化的统计结构中自动涌现。

阶段二:潜动作预训练(Latent Pretraining)。将视觉编码器与大规模语言模型主干在三元组数据 上进行 [[行为克隆]] 训练。输入为历史观测序列与任务语言描述,输出为接下来 步的潜动作 token 序列。此阶段完全不依赖任何真值机器人动作,数据来源可以是任意操控视频——机器人数据集、人类操作视频、Ego4D、Something-Something 等均可混合使用。正是这一设计使得训练数据规模摆脱了动作采集瓶颈的束缚。

阶段三:动作微调(Action Finetuning)。冻结阶段二训练好的 VLA 主干,仅在小规模带真值动作的机器人数据上训练一个轻量动作头。该动作头将潜动作 token 解码为机器人连续动作向量(如 7-DoF 末端位姿或 6-DoF 关节角)。这是整套方法中唯一的"具身对齐"环节,所需数据量比传统 VLA 训练小一到两个数量级。实验对比了 MLP 头与 diffusion head,后者精度略高约 2-3 个百分点,但 MLP 推理速度更快。

从数学形式上看,阶段一的 [[VQ-VAE]] 量化过程可表示为:

其中 为码本向量。解码器通过 straight-through estimator 优化:

阶段二的行为克隆目标为:

这种离散 token 化的设计是关键——它让 VLA 主干只需做离散的分类预测而非连续回归,从而显著加速预训练收敛(实验显示效率提升约 30 倍)。

实验与结果

实验在仿真基准与真实机器人两个层面系统验证了 LAPA 的有效性。

在仿真环境 Language Table 上,LAPA 在 4 个 in-domain 任务达到 87.3% 平均成功率,显著高于 GR-1 的 67.1% 和 Uni-Pi 的 61.0%,提升超过 20 个百分点;在更具挑战性的 cross-task 泛化任务上,LAPA 的 56.7% 也大幅领先 VPT-T 的 35.2% 和 GR-1 的 31.4%。在 SIMPLER 跨环境仿真基准的 5 个任务上,LAPA 平均取得 50.1%(Strict 标准 35.2%),在所有无动作标签的预训练基线中保持领先,且部分任务接近使用真值动作训练的 baseline。

真实机器人实验覆盖 12 个操控任务,包括抽屉开关、物体拾取放置、按钮按压等多种日常操作。结果显示,LAPA 的总体成功率以 +6.22% 超越 OpenVLA(当前依赖真值动作训练的 SOTA VLA),尤其在未见物体泛化上提升 +5.8%,未见语言指令泛化上提升 +9.5%。值得注意的是,即使预训练阶段完全不接触任何机器人数据,仅使用 Ego4D 和 Something-Something 中的人类操控视频,LAPA 在 Bridgev2 上仍取得 +4.3% 的相对提升,证明了跨具身迁移的可行性。

消融实验进一步揭示了几项关键设计决策的影响:去掉阶段一的离散量化改用连续回归头后性能下降约 12 个点,确认了离散 token 结构的重要性;码本大小 是性价比最优的选择, 表达能力不足, 边际增益递减;混合机器人与人类视频数据优于单独使用机器人数据,说明人类操控视频可作为有效补充。

讨论与可借鉴点

LAPA 的核心贡献在于证明了"真值动作标签"并非 [[VLA]] 预训练的必要前提。通过引入离散潜动作作为中间表征,它成功将数据源从昂贵的小规模机器人数据集扩展到整个 web 视频生态,为机器人基础模型开辟了大数据通道。潜动作 token 在不同数据集之间共享统一字典的特性,也暗示了其作为跨具身基础表征的潜力。

然而,方法也存在一定局限。论文自身指出,LAPA 更擅长捕捉"环境中心"的动作(如物体运动、相机变化),而非纯机械臂运动。这意味着在需要精细关节控制的场景(如柔性操作、高精度装配)中,潜动作的表征能力可能存在短板。此外,阶段三的动作微调虽只需少量数据,但仍然是方法链路上唯一的"具身绑定"环节,如果该环节数据分布偏差过大,仍可能导致策略失效。

对于机器人学习社区而言,LAPA 的范式提供了重要启示:视频预训练的价值不仅在于视觉表征,更在于能够从中提取可迁移的"动作语义"——即使这种语义以无监督方式发现。当 [[具身鸿沟]] 不可避免时,与其强行建立跨具身的动作映射,不如在潜空间中找到具身无关的动作表征,再在目标具身上做轻量适配。这种"解耦-桥接"的思想或许可以启发更多工作,将互联网视频的丰富知识更高效地迁移到机器人控制任务中。

TLDR

现有视觉-语言-动作模型(VLA)严重依赖人工遥操作采集的真值动作标签,数据规模被局限在昂贵的小规模机器人数据集上,而互联网上的海量人类操控视频未被充分利用。本文提出 LAPA(Latent Action Pretraining),一种三阶段无监督预训练方法:先用 VQ-VAE 目标在视频帧对上学习离散潜动作字典,再用视觉-语言模型做行为克隆预测潜动作序列,最后在小规模带真值动作的机器人数据上微调,把潜动作映射到真实机器人动作。实验显示 LAPA 在 Language Table 与 SIMPLER 仿真上显著优于现有无动作标签的视频预训练基线,且在真实机器人任务上以 +6.22% 击败依赖真值动作训练的当前 SOTA VLA 模型 OpenVLA,预训练效率提升 30×;即使只用人类操控视频预训练也能正向迁移。这把 VLA 的训练数据源从昂贵的小规模机器人数据集扩展到整个 web 视频生态,为机器人基础模型打开了大数据通道。

摘要

首个不依赖真值动作标签的 VLA 预训练框架,在真实机器人任务上击败使用真值动作训练的 OpenVLA,把 VLA 推到互联网视频尺度

我的笔记

笔记存在浏览器 localStorage,SSR 无法读取。
→ 去论文页底部写笔记 / 读笔记

元信息
arXiv
2410.11758
发布日期
2024-10-15
PDF
https://arxiv.org/pdf/2410.11758v1
相关度
0.850

图谱基于本库论文之间的相似度关系(由 DPR paper-relations 模块 Jaccard / TFIDF / hybrid 算法计算,无 LLM)。

论文(按相关度上色) 概念(节点之间为共同概念边)

每日简报占位

DPR 是静态站点,没有 Polaris 那种后端定时任务。启用 GitHub Actions 工作流后,简报会出现在这里。

当前可用的 Polaris 提示词版本:

  • library-digest:2026-08-02 — 逐篇看点(PAPER_INSIGHTS)
  • library-digest:2026-08-02 — 简报主编(DIGEST_SYNTHESIS)
  • library-digest:2026-08-02 — 滚动趋势(TREND)

详见 迁移文档config/prompts/library-digest/2026-08-02/

文献对话(占位)

本面板将基于 library-chat:2026-08-02 提示词,接管自 paper-chat 的浮窗能力,支持库级上下文 + 跨论文 RAG 引用。

阶段 4 启用后将接流式 LLM,引用规约 [n]、概念双链 [[概念名]]、图片 ![[fig:N]]

文献库基础信息

库名 (English)
Robotics & Embodied AI
库名 (中文)
机器人与具身智能
研究方向陈述
Sim-to-real, locomotion, manipulation, world models, skill discovery, vision-language-action.
研究方向陈述(中文)
虚实迁移、运动控制、操作、世界模型、技能发现、视觉-语言-动作。
维护者
DPR
卡片色调
rose
入库方式
公共库(从 docs/papers/** frontmatter 派生,无写路径)

本月 LLM 用量

已用 tokens
加载中...
预算设置
剩余
-

建库与同步

公共库数据来自 docs/papers/ frontmatter,在 pipeline 跑批时重建。本 Tab 只控制个人库。

个人库同步(若已配置 Gist token):

同步底层由 astro-src/lib/user-libraries/gist.ts 处理(零信任 R/W 合并,见 8f2a 提交)。

正在检测重复...