arXiv 2410.07877 · 发布 2024-10-10

约束技能发现:基于无监督强化学习的四足机器人运动

Constrained Skill Discovery: Quadruped Locomotion with Unsupervised Reinforcement Learning

AUTHORS Vassil Atanassov, Wanming Yu, Alexander Luis Mitchell, Mark Nicholas Finean, Ioannis Havoutis
EVIDENCE 针对 LSD/METRA 在四足 locomotion 上必收敛到高速度技能、无法部署到真实硬件的核心问题,提出 norm-matching 目标 + 欧氏距离约束,实现更广状态覆盖与真机 zero-shot 目标追踪。
SCORE 0.9
CATEGORIES TASK robotics
GENERATED 2026-07-21 19:55:00 UTC

📝 TLDR

现有受约束技能发现方法(LSD/METRA)通过最大化潜空间迁移模长来提升状态覆盖,但在四足 locomotion 上只能学到高速度、难部署的技能。本文替换潜空间最大化为 norm-matching 重构目标,保留相同欧氏距离约束,使 ANYmal 机器人学到覆盖更广速度区间的稳定 locomotion 技能,并在真机上无需再训练即可零样本到达任意 Cartesian 目标点。

🧭 速览

动机

LSD/METRA 必最大化潜空间迁移模长,在欧氏距离约束下导致策略只能学到高速度、高动态的瞬态技能,无法用于真实硬件部署,且缺乏低速技能会让下游任务表现退化。

方法

在潜空间迁移对齐项之外增加 norm-matching 的 MSE 目标 J^Ours = -1/2 E[( (phi(s_T)-phi(s_0)) - z )^2],约束仍为 ||phi(s_T)-phi(s_0)|| <= ||s_T - s_0||;用 Smooth L1 训练 encoder,2D 技能均匀采样于半径 50 的圆内,奖励 r(t)=1/(1+sigma*e) 鼓励 latent 方向和模长同时匹配。

结果

在 1000 条均匀采样技能下,本方法速度分布横跨 0~3 m/s,LSD/METRA 几乎全部聚集在高速度区;XY 覆盖率显著高于 ASE/CASSI/DOMiNiC;真机 ANYmal 可在闭环 z_des 更新下准确到达并停在连续两个目标点,3D 潜空间可同时控制位置与朝向。

结论

把受约束技能发现的优化目标从「对齐 + 最大化模长」改为「对齐 + norm-matching 重构」,在不牺牲距离约束的前提下显著拓宽学习到的技能速度分布,让学到的策略直接具备 zero-shot goal-tracking 能力,可推广到更高维技能空间但需更强的 encoder 架构。

TL;DR

现有受约束技能发现方法 LSD 与 METRA 通过最大化潜空间迁移模长来扩展状态覆盖,但这一设计在四足机器人 locomotion 任务中导致策略只能学到高速度、难以部署的瞬态技能。本文提出将潜空间最大化的优化目标替换为 norm-matching 重构目标,在保留欧氏距离约束的前提下,使 ANYmal 机器人学到了覆盖全速度区间(0~3 m/s)的稳定运动技能,并成功在真实硬件上实现了零样本的任意 Cartesian 目标点到达。

研究背景与动机

四足机器人的动态运动学习长期以来依赖奖励工程、模仿学习与课程学习的组合方案。这种范式虽然能在特定任务上取得良好效果,但需要大量人工设计奖励函数和任务先验,既耗时又限制了学到的行为的泛化能力。例如,若将"直接朝目标移动"设为奖励,当目标与机器人之间存在障碍物时,策略很容易陷入局部最优而无法到达目标。

技能发现(Skill Discovery)提供了另一种思路:让机器人在无任务特定奖励的情况下,通过内在动机(intrinsic motivation)自主探索,学到一组可复用、可组合的程序化行为。这类方法通常以互信息(Mutual Information)作为优化目标,通过最大化技能变量 与状态 之间的依赖关系来驱动策略探索。在互信息的变分下界框架下,学到的潜空间表示能够编码有意义的技能维度。

然而,这一族方法存在两个主要缺陷:其一,探索激励不足——判别器(discriminator)一旦能够区分不同技能,就不再奖励更远距离的探索,导致状态覆盖范围有限;其二,强任务先验——许多 locomotion 类工作不得不将判别器的输入限定为 XY 基体位置,以避免策略学到无意义的关节扰动。

Park 等人提出的 LSD 与 METRA 方法尝试解决第一个问题。它们通过对齐潜空间迁移与技能变量,并施加距离约束 ,在潜空间与状态空间两层同步驱动距离最大化。这种设计在 MuJoCo 等标准 benchmark 上确实显著提升了状态覆盖。但当研究者将这套方法应用于四足机器人 + 欧氏距离约束时,一个意想不到的问题浮现出来:策略被推向"每个方向尽可能加速"的极端,产生大量高动态、难以部署到真实硬件上的瞬态技能。

本文的核心观察正在于此:对四足 locomotion 而言,LSD/METRA 必最大化模长的设计不是优点而是缺陷。本文试图回答的问题是——能否在保留距离约束的前提下,让策略学到全速度区间的稳定运动行为?

方法

要理解本文的改进,首先要弄清楚 LSD/METRA 的目标函数为什么会导致"速度最大化"这一非预期行为。

将潜空间表示 的后验 参数化为单位方差高斯分布后,互信息的变分下界可化为:

以 episode 起点 和终点 作为输入,进一步得到损失函数:

展开平方项后丢弃与 无关的常数,只保留与 的内积项:

这就是 LSD 的核心目标。可以看到,它只约束了方向对齐——让潜空间迁移向量 与技能向量 方向一致。但对模长没有任何约束。在欧氏距离约束 下,策略的博弈均衡是让迁移模长尽可能大,因为这不会损失方向对齐的分数,同时还能让内积更大。于是所有技能都趋向于以最大速度执行。

本文提出的改进很简单:将"方向对齐 + 隐式模长最大化"替换为"norm-matching 重构"。新的目标函数为:

约束保持不变:

这意味着直接让潜空间迁移向量 回归到技能向量 ,而不是只匹配方向而让模长自由增长。物理含义是 既要编码方向又要编码大小。通过将模长匹配显式纳入优化目标,策略不再有动力去追求更高的速度。

为方便在强化学习的 batch 上优化,作者采用 telescoping trick 将目标改写为 per-step 形式:

其中 是归一化因子,与技能空间半径和 episode 长度相关。相应地,intrinsic reward 设计为:

这个奖励函数将 MSE 误差映射到 区间——误差越小,奖励越高,从而驱动策略沿 方向精确移动。

在观测与动作设计上,本文延续了 LSD 的设置:观测包含关节位置/速度、基体线速度、角速度、四元数、基体位置等完整信息,不做任何任务先验裁剪;动作输出 12 个关节相对 nominal stand 的目标位置,经 400 Hz PD 控制器执行。奖励仅包含通用正则化项(能量消耗、平滑性、足端腾空时间、姿态、高度、不期望接触等),完全不含任务特定奖励。

实验与结果

实验在 NVIDIA Isaac Gym 的 1024 并行环境中用 PPO 训练,策略和 encoder 均采用 MLP 架构,潜空间维度设为 2 或 3。基线方法包括 LSD(欧氏约束)、METRA(时序约束),以及 CASSI、ASE、DOMiNiC 等在其他四足/角色动画任务上验证过的技能发现方法。所有对比均剥离了模仿学习或预训练教师组件,以公平评估纯技能发现能力。

速度分布是衡量方法有效性的首要指标。在 1000 条均匀采样的技能下,LSD 和 METRA 学到的速度几乎全部聚集在高速度区间(约 2.5~3 m/s),几乎没有低速技能。相比之下,本文方法的速度分布在 0~3 m/s 范围内呈近似均匀分布——这直接证明了 norm-matching 目标成功解锁了低速技能的习得。

在 XY 状态空间覆盖率上,这一对比更加悬殊。LSD 的末端位置呈环形分布(因为模长总是最大化的),而本文方法展示出与技能模长严格成比例的覆盖范围——从原点附近(低速技能)一直延伸到圆盘边缘(高速技能)。ASE、CASSI、DOMiNiC 等方法由于任务先验限制或教师策略缺失,只能学到短程抖动或离散技能,覆盖范围远不及本文方法。

零样本目标跟踪(Zero-Shot Goal Tracking)是本文方法最引人注目的下游应用。由于 encoder 学到了 到状态空间的映射,推理时只需将目标状态 的潜表示与当前状态 的潜表示相减,即可得到期望的技能向量:

通过闭循环每步更新 ,机器人会在 收敛到零时停在目标点;若 保持恒定,机器人会持续穿越目标。仿真实验显示,本文方法能准确降速、到达并稳定在目标位置(误差小于 0.5 m),而 LSD 由于其潜空间"高速专用"的设计,会反复穿越目标点。

真机部署在 ANYmal 四足机器人上验证了系统的可行性。机器人在仿真中训练、不经任何微调的情况下,能够依次到达两个不同的 Cartesian 目标点并稳定停驻。进一步地,当将潜空间扩展到 3 维时,系统能够同时控制基体在 x、y 方向的位移以及偏航角(heading),这在 2 维潜空间下是不可控的维度。

讨论与可借鉴点

本文的核心贡献在于揭示了受约束技能发现方法中"最大化潜空间迁移模长"这一设计选择在不同任务场景下的双面性:它确实能提升状态覆盖,但当覆盖范围本身不是目标时(例如 locomotion 需要多种速度而非越快越好),这一设计反而成为瓶颈。通过将优化目标从方向对齐 + 隐式最大化改为 norm-matching 重构,本文在不牺牲距离约束的前提下实现了更均衡的速度分布。

从方法论角度看,本文展示了一个朴素的道理:约束条件与优化目标的组合决定了策略的行为空间。LSD/METRA 的距离约束是必要的(否则 会坍缩),但与最大化模长的目标结合后就产生了非预期的"速度竞赛"。本文的 norm-matching 目标在保留约束的同时,精确指定了"潜空间迁移应该有多大",从而将策略从速度最大化的囚笼中解放出来。

值得指出的是本文方法的局限与拓展方向。首先,约束条件只给出了潜空间迁移模长的上界,并不保证实空间距离同步等于潜空间距离,因此理论上仍可能出现"用大潜距离换小实距离"的情况。但实践中 extrinsic regularization(能量、平滑等)会将策略推向稳定行为,使得这一潜在问题并不显著。其次,更高维的潜空间(如控制更复杂的行为)需要更强的 encoder 架构来保证 的表示能力——这是一个工程上的挑战,也是未来工作的方向。

对于更广泛的无监督技能发现研究,本文提供了一个有益的视角:在设计目标函数时,不仅要问"我想让策略探索什么",还要问"在给定的约束下,策略会趋向于做什么"。约束与目标的微妙组合往往决定了方法的成败,而非某个单独组件的精巧程度。

TLDR

现有受约束的技能发现方法(LSD/METRA)通过最大化潜空间迁移模长来提升状态覆盖,但在四足 locomotion 上只能学到高速度、难部署的技能。本文替换潜空间最大化为 norm-matching 重构目标,保留相同欧氏距离约束,使 ANYmal 四足机器人学到覆盖更广速度区间的稳定 locomotion 技能,并在真机上无需再训练即可零样本到达任意 Cartesian 目标点。

Abstract (English)

Representation learning and unsupervised skill discovery can allow robots to acquire diverse and reusable behaviors without the need for task-specific rewards. In this work, we use unsupervised reinforcement learning to learn a latent representation by maximizing the mutual information between skills and states subject to a distance constraint. Our method improves upon prior constrained skill discovery methods by replacing the latent transition maximization with a norm-matching objective. This not only results in a much a richer state space coverage compared to baseline methods, but allows the robot to learn more stable and easily controllable locomotive behaviors. We successfully deploy the learned policy on a real ANYmal quadruped robot and demonstrate that the robot can accurately reach arbitrary points of the Cartesian state space in a zero-shot manner, using only an intrinsic skill discovery and standard regularization rewards.

Abstract (中文)

表示学习与无监督技能发现能让机器人在无需任务特定奖励的情况下获得多样化、可复用的行为。本工作使用无监督强化学习,通过对技能与状态之间的互信息(在距离约束下)做最大化,学习潜空间表征。我们把先前受限技能发现方法中"最大化潜空间迁移"的目标改为范数匹配范数匹配目标,从而不仅获得了远超基线的状态空间覆盖,还使机器人学到了更稳定、更易控制的运动行为。我们把学到的策略部署到了真实的 ANYmal 四足机器人上,证明机器人可以零样本精确到达 Cartesian 状态空间的任意点,完全只依赖固有的技能发现奖励与标准的正则化奖励。

动机

LSD/METRA 必最大化潜空间迁移模长,在欧氏距离约束下导致策略只能学到高速度、高动态的瞬态技能,无法用于真实硬件部署,且缺乏低速技能会让下游任务表现退化。

方法

在潜空间迁移对齐项之外增加 norm-matching 的 MSE 目标 J^Ours = -1/2 E[( (phi(s_T)-phi(s_0)) - z )^2],约束仍为 ||phi(s_T)-phi(s_0)|| <= ||s_T - s_0||;用 Smooth L1 训练 encoder,2D 技能均匀采样于半径 50 的圆内,奖励 r(t)=1/(1+sigma*e) 鼓励 latent 方向和模长同时匹配。

结果

在 1000 条均匀采样技能下,本方法速度分布横跨 0~3 m/s,LSD/METRA 几乎全部聚集在高速度区;XY 覆盖率显著高于 ASE/CASSI/DOMiNiC;真机 ANYmal 可在闭环 z_des 更新下准确到达并停在连续两个目标点,3D 潜空间可同时控制位置与朝向。

结论

把受约束技能发现的优化目标从「对齐 + 最大化模长」改为「对齐 + norm-matching 重构」,在不牺牲距离约束的前提下显著拓宽学习到的技能速度分布,让学到的策略直接具备 zero-shot goal-tracking 能力,可推广到更高维技能空间但需更强的 encoder 架构。


深度精读

> 基于 arXiv HTML 全文生成 · 模型: MiniMax-M3 · 模型生成时间 2026-07-21 · 全文 ~62 KB

一、研究背景与动机

四足机器人动态运动学习长期依赖奖励工程 + 模仿学习 + 课程学习的组合(Hwangbo et al. 2019; Lee et al. 2020; Miki et al. 2022),既耗时又强引入了任务先验。举例而言,若把"直接朝目标移动"作为 reward,当目标与机器人之间存在遮挡时该策略就会陷入局部最优。

与之相对的技能发现 / options learning(Stolle & Precup 2002; Salge et al. 2013; Choi et al. 2021; Aubret et al. 2023)依赖 intrinsic motivation 在无任务奖励下自主探索,目标是学到一组可复用的程序性行为。潜空间表示通常以互信息 (MI) 作为优化目标 I(z; s),其下界由 variational discriminator q_phi(z|s) 给出。这一族方法的两条主流缺陷是:

1. 探索激励不足:只要 discriminator 能区分技能,就不再奖励"更远"的探索,导致覆盖范围有限;

2. 强任务先验:locomotion 类工作大多把 discriminator 输入限定为 XY 基体位置(Eysenbach et al. 2018; Sharma et al. 2020b),才能避免学到无意义的关节扰动。

Park et al. (2021; 2023) 提出的 LSDMETRA 把对齐项写为 L^{LSD} = -1/2 E[(phi(s_T)-phi(s_0))^T z],并加约束 ||phi(s_T)-phi(s_0)|| <= d(s_T, s_0)(d 为 Euclidean / temporal distance),从而在 latent 与 state 两层空间同步驱动距离最大化。在 MuJoCo 等标准任务中此招对覆盖提升明显,但在 locomotion + Euclidean 约束下,策略被推向"每个方向尽可能加速"的极端,产生大量难以部署在硬件上的高动态技能。

本文的核心立论:对 4 足 locomotion 而言,LSD/METRA 必最大化模长的设计是缺陷而非优点。本文用 norm-matching 重构替代最大化,既保留距离约束又学到全速度区间下稳定的 locomotion 行为。

二、方法详解

2.1 LSD/METRA 简要回顾

Park et al. 把 q_phi(z|s) 参数化为 unit-variance Gaussian 之后,MI 下界可化为:

```

I(z; s) >= -1/2 E_{s,z}[ ||phi(s) - z||^2 ] + c (eq.5)

```

进而以 episode 起止状态作为输入,得到损失:

```

L = -1/2 E[ ||(phi(s_T) - phi(s_0)) - z||^2 ] + c (eq.6)

```

该损失分解为 L2 regularization、directional alignment、与仅依赖 z 的常数项,丢弃平方 phi 项后等价于:

```

L >= -1/2 E[ (phi(s_T) - phi(s_0))^T z ] = L^{LSD} (eq.8)

```

约束为对所有 state 转移:

```

|| phi(s_T) - phi(s_0) || <= d(s_T, s_0) (LSD/METRA 约束)

```

此时不论 z 大小,策略都倾向于"使 latent 迁移模长最大化";落到 Euclidean 距离度量下,直接体现为所有技能都跑得越来越快

2.2 本文目标(Norm-Matching Constrained Skill Discovery)

本文保留相同距离约束,但改写目标为:

```

J^{Ours} = -1/2 E_{s,z}[ || ( phi(s_T) - phi(s_0) ) - z ||^2 ],

s.t. || phi(s_T) - phi(s_0) || <= || s_T - s_0 || (eq.9)

```

— 即直接让 (phi(s_T) - phi(s_0)) 回归 z,而不是只匹配方向 + 最大化模长。这一改动把"模长匹配"显式纳入目标,以 Smooth L1 训练 encoder phi(·);策略训练仍按 cooperative game,自身最小化同一损失。

为方便 RL batch 优化,作者沿用 Park et al. 的 telescoping trick,改写为 per-step 损失:

```

J_t^{Ours} = -1/2 E[ || N ( phi(s_{t+1}) - phi(s_t) ) - z ||^2 ],

s.t. || phi(s_{t+1}) - phi(s_t) || <= || s_{t+1} - s_t || (eq.10)

```

— 该形式是原目标的一个上界(附录 A.1 给出证明)。奖励则取:

```

r(t) = 1 / (1 + sigma * e),

where e = || N ( phi(s_{t+1}) - phi(s_t) ) - z ||^2 (eq.11)

```

设计意图:r(t) 越大表示 latent 迁移与 z 越吻合。注意:距离约束只给出 latent 迁移模长的上界,并不保证实空间距离同步等于 latent 距离,所以仍会出现"用大 latent 距离换小实距离"的情况。但本文的 extrinsic regularization(能量/平滑/触地)会把策略推向稳定行为,因此实践中该潜在问题并不显著。

2.3 RL 设置

  • 观测:关节位置/速度、基体线速度 v_b、角速度 omega_b、四元数 qbar_b、基体位置 p_b;不做任务先验裁剪(与 LSD 相同,无须只喂 XY)。
  • 动作:12 个关节相对 nominal stand 的目标关节位置。
  • 控制:策略 50 Hz 输出,叠加到 PD 控制器,400 Hz 运行。
  • 奖励:仅含能量/平滑/feet-air-time/姿态/高度/不期望接触等通用正则奖励,完全不含 task-specific reward;消融实验(A.6)显示有无这部分奖励对学到的多样性无显著影响。
  • Baseline:LSD(Euclidean 约束)+ METRA(temporal 距离),复现时取 2D 技能空间、均匀采样 ||z|| <= ||z_max||=50 的圆盘(2D skill 范围,因此对 300 步 episode 而言 per-step latent 迁移 ≈ 0.17,LSD 在同等 episode 下的上界)。
  • 基础比较:除 LSD/METRA 外,还对比 CASSI / ASE / DOMiNiC 等在 quadruped / 角色动画上验证过的方法,所有比较均剥离它们的"模仿/预训练教师"组件,公平地评估 skill discovery 本身。

三、关键公式解读

```

J^{Ours} = - 1/2 E_{s,z}[ || (phi(s_T) - phi(s_0)) - z ||^2 ]

s.t. || phi(s_T) - phi(s_0) || <= || s_T - s_0 || (eq.9)

```

把"对齐 + 最大化范数"拆解成一项统一的 MSE 回归,使得 latent 迁移的模长也被显式匹配;约束保持 LSD 距离约束不变,这是与 LSD 解耦的关键。物理含义:phi(·) 既要编码方向又要编码大小

```

L^{LSD} = -1/2 E[ (phi(s_T) - phi(s_0))^T z ] (LSD baseline)

```

只约束了内积方向、不控制模长,因此策略总是把 latent 模长推到饱和点,直接体现为高速度。

```

r(t) = 1/(1+sigma * || N (phi(s_{t+1})-phi(s_t)) - z ||^2) (eq.11)

```

把 MSE 误差映射到 (0, 1] 区间,鼓励更小误差 → 更大奖励,作为 intrinsic reward 驱动策略沿 z 方向走。

```

z_des = phi(s_des) - phi(s_t) (zero-shot goal)

```

推理阶段,通过当前 latent 与目标 latent 之差算出期望技能向量 z_des,闭循环每步更新即可让 robot 在 z_des 收敛到 0 时停在目标点;若 z_des 恒定则机器人会持续穿越目标。

```

||z|| <= ||z_max|| = 50, per-step 距离 ≈ 0.17

```

设定 max skill 模长,使得 J^{Ours} 与 LSD 在最大 latent transfer 上同尺度可比,从而保证对比实验的可解释性。

四、图表解读

图 1 (系统总览) 展示 latent space Z^2 + encoder phi(·) 与 skill-conditioned policy pi(a|s,z) 的联合训练,以及"通过调节技能模长即可控制 base velocity"的核心卖点——与 LSD/METRA 必最大化迁移的方向图对照

图 2 (Learning Scheme) encoder 将 (s_t, s_{t+1}) 映射至 latent,以 MSE 对齐 z;agent 收到基于 loss 大小的 intrinsic reward + 平滑化 extrinsic reward。

图 3 (Base Velocity Histogram) 横轴 0~3 m/s,纵轴密度。LSD 几乎全堆在最右(高速度),METRA 类似,本文则在 0~3 m/s 区间呈近似均匀分布,证明低速/中速技能被有效学到。

图 4 (XY State Coverage) 把各方法在 1000 采样技能下的 XY 末端位置画在同一坐标系:

  • LSD / METRA:相同 latent 总是产生相同模长,且该模长恒定最大化,色块呈环形;
  • ASE 2D (full obs):只学到微抖动;
  • ASE 2D XYO (限 XY):可移动但幅值小;
  • CASSI 6 skills XYO:小段 < 1 m,无法远距离穿越;
  • DOMiNiC(velocity-only):能动但范围小,技能离散;
  • 本文:固定 ||z_max|| 与可变 ||z|| 都展示了与技能模长严格成比例的覆盖范围,低速端可达 0。

图 5 (Zero-Shot Goal Tracking Pipeline) 由 phi(s_des) - phi(s_t) 计算技能 z_des,闭循环每步更新。

图 6 (Goal Tracking Comparison) 上排本方法:准确降速、到达并停在目标;下排 LSD:多次穿越目标(overshoot)——因为它的 latent 空间是"高速专用"。

图 7 (Hardware Tracking) 真实 ANYmal 顺序到达两个目标点,显示系统部署可行。

图 8 (3-D Latent Space) 把 latent 维度升到 3,可同时给出 base position + heading 指令。

五、实验设置与结果

5.1 训练与硬件

  • Sim:NVIDIA Isaac Gym,1024 并行环境,PPO 更新。
  • Robot:ANYmal,12-DoF 关节。
  • 网络:MLP policy + MLP encoder phi(·),latent dim ∈ {2, 3}。
  • 部署:真机 ANYmal + 400 Hz PD 控制器(参 A.3)。
  • 基线:LSD(Euclidean)、METRA(Temporal)、ASE、CASSI、DOMiNiC。
  • 评测:在 1000 个均匀采样技能下统计 base velocity histogram 与 XY position。

5.2 主结果

1. 速度分布(图 3):本文在 0~3 m/s 内近似均匀;LSD/METRA 几乎全聚集在高速段,验证了"不最大化模长"带来的低速技能。

2. XY 覆盖(图 4):本方法在所有方法中覆盖率最高;ASE / CASSI / DOMiNiC 受限于任务先验或教师策略,只能学短程抖动。

3. Zero-Shot Goal Tracking(图 6 仿真):本方法可多次到达目标并在 0.5 m 误差内停稳,LSD 由于 latent 必饱和高速度,会反复穿越。

4. 真机部署(图 7):ANYmal 在两个连续目标点之间 3 次收敛 真实硬件实验表明该方法可直接上机。

5. 3-D 潜空间(图 8):可同时控制 x, y 与偏航角,后者在 2-D latent 下是不可控维度。

5.3 消融 / 补充

  • A.5 LSD vs METRA 对比:METRA 在本文设定下与 LSD 行为几乎相同(也是最大化模长),无法得到低速技能——证明问题主要来自最大化模长而非度量选择。
  • A.6 内在/外在奖励消融:除掉 extrinsic 正则后,multi-modal skill 仍可学到,但运动不"美观"且部分难上硬件——说明 extrinsic 正则是"美学修正"而非技能存在性的必要条件。

六、Related Work 与本文定位

  • Legged Locomotion RL:本文与 Hwangbo 2019 / Lee 2020 / Kumar 2021 / Miki 2022 等标准 velocity-tracking 与 perceptive locomotion 工作明确分离开来——本文不需要 task-specific reward,直接用 intrinsic skill discovery。
  • Skill Discovery:本文属于constrained skill discovery家族,继承了 LSD/METRA 的距离约束,没有继承它们的模长最大化目标;与 DIAYN / DADS / VALOR / DISAIN / CASSI / ASE 这一族无约束 MI 工作相比,本文既有 MI 下界又多了状态空间距离的诱导项,带来更广覆盖。
  • Loco-Manipulation:作者把本文视为把 skill discovery 应用到 loco-manipulation 的前置工作(高层指令 → 已有 skill 字典)。
  • 本文相对 DOMiNO (Cheng et al. 2024a) 的差异化:DOMiNO 用"模仿一个能到目标的预训练策略"产生多样化技能,本文完全不依赖这样的前置策略,直接通过 intrinsic reward 学到零样本目标追踪能力。

七、优点

1. 真正 zero-shot:不依赖 teacher policy / motion dataset,只需 skill discovery + 标准正则奖励。

2. 硬件可用:低速技能的存在让任何一项策略都能上真机,不需额外 sim-to-real 修复。

3. 可解释:技能模长直接控制 base velocity 量级,下游任务可"按距离挑技能"。

4. 数学简洁:只把损失从 directional alignment 替换为 norm-matching MSE,不动距离约束结构,与 LSD 兼容好。

5. 可扩展到 3D 潜空间,联合控制位置 + 朝向。

八、局限性

1. Euclidean 距离度量:关节位置等高维状态在 Euclidean 度量下会被"高频抖动"满足约束——未来可考虑 time-aligned / phase-aware 度量。

2. 3D+ 潜空间训练困难:norm-matching 比起 LSD 对 encoder 表征容量要求更高,4D+ 潜空间在本文结构下尚不能稳定收敛。

3. rotation 控制不完整:3D 潜空间仅控制偏航,绕俯仰/横滚的姿态任务不易学。

4. 下游任务仅限 goal-tracking:尚未在 manipulation / parkour / 跨地形等更复杂下游任务上验证。

5. 技能"覆盖"≠"多样性":均匀分布不能完全刻画不同技能之间的语义差距,需要更细的语义评估。

九、复现要点

  • 论文 arXiv:2410.07877(Oxford + Dyson, ICC 投稿)。
  • 代码:截至本笔记生成日(2026-07-21)未在文中给出官方仓库链接;Park et al. 2021(LSD)的 code 已公开,本文可作为 LSD 的 loss 替换复现。
  • 基线对比:必须复现 LSD 与 METRA(都来自 Park 等),否则无法验证 norm-matching 的相对收益;ASE/CASSI/DOMiNiC 的去模仿变体也需要重新训练。
  • 关键超参:||z_max|| = 50、latent dim ∈ {2, 3}、episode 长 300、PPO + 1024 envs、Smooth L1 训练 encoder。
  • 奖励:仅 extrinsic 正则(能量/平滑/feet-air-time/姿态/高度/不期望接触),不要加 task reward。
  • 真机部署:ANYmal + 400 Hz PD,姿态与速度闭环控制使用 onboard state estimator。
  • 期望硬件:与 LSD 同量级——Isaac Gym 上 8~16 GPU 即可训 ~亿步级 batch;真机实验需要 ANYmal 平台 + 实验室操控环境。

十、适用场景与延伸思考

  • 理想用途:无奖励或弱奖励下的四足基座策略预训练;其学到的 latent 可作下游 RL 的结构化 action prior;在 parkour / loco-manipulation / uneven-terrain navigation 等任务里,可用本方法找到"低速-精确"基元组合。
  • 可借鉴到的方向:让 norm-matching 的概念推广到双臂 / 移动机械臂 / 旋翼无人机等其他 embodied RL 平台,把"模长"自然映射为"轨迹速度/推进速度"。
  • 理论延伸:把 norm-matching + 距离约束看成一个泛化的 constrained skill discovery 框架——后续可以探索 weighted norm matching(避免 0 模长技能退化),或与最优传输 / Wasserstein 距离度量结合,代替 Euclidean。
  • 工程含义:norm-matching + 闭循环 z_des = 一个"用 latent 距离表达下游任务"的简洁编程模型,下游任务 = "给定点 → 用 phi 编码出 z_des → 喂给 policy 即可"。

论文基本信息

  • arXiv ID: 2410.07877v1
  • 提交日期: 2024-10-10
  • 分类: Computer Science > Robotics (cs.RO)
  • 作者机构: Department of Engineering Science, University of Oxford; Dyson
  • 通讯作者: vassilatanassov@robots.ox.ac.uk
  • 项目页/代码: 文中未提供官方仓库链接(可关注 Park et al. 2021 LSD 项目作为基础)

来源:

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记