arXiv 2607.11624v2 · 发布 2026-07-13

SKooP:基于对称 Koopman 预测的更快且更具泛化能力的强化学习腿式机器人运动

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

AUTHORS Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci
EVIDENCE 强化学习应用于高维复杂非线性腿式机器人运动控制
SCORE 0.9
GENERATED 2026-07-20 16:34:22 UTC

📝 TLDR

强化学习在腿足机器人控制中面临样本效率低的问题,而现有物理先验方法多在低维基准系统上验证。SKooP将形态对称性与基于自编码器学习的Koopman模型相结合,在策略训练的同时并行学习系统动力学的Koopman表示。Koopman预测作为特权观测输入critic,并融合群对称性到actor、critic、编解码器中实现高等变性策略。在四足机器人的多个双足运动任务上,SKooP持续加快收敛并提升最终奖励,且所学策略可迁移至不同的仿真环境,展示了良好的泛化能力。

🧭 速览

动机

强化学习样本效率低,现有融合物理先验的方法多在低维基准系统验证,难以推广到高维复杂的腿足机器人。

方法

将形态对称性与Koopman自编码器动力学模型结合,把Koopman预测作为特权观测供critic使用,并在actor、critic、编解码器网络中嵌入群对称性以构造等变策略。

结果

在四足机器人多项双足运动任务中,SKooP一致地缩短收敛时间、提升所学奖励,并能将策略迁移到不同的仿真环境中。

结论

表明Koopman线性化表征与对称性先验结合可显著提高腿足机器人强化学习的效率与泛化性。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

SKooP 将形态对称性与自编码器学习的 Koopman 模型相结合,在策略训练的同时并行学习系统动力学的低维线性表示。该表示作为 critic 的特权观测输入,使智能体基于更平滑、信息更丰富的特征进行学习,同时通过群对称性融入 actor、critic、编码器和解码器实现高等变性策略。在四足机器人的多个双足运动任务中,SKooP 持续加快收敛并提升最终奖励,且所学策略可迁移至不同仿真环境,展示了良好的泛化能力。

研究背景与动机

腿足机器人控制长期以来面临的核心挑战在于其动力学的高度非线性特性。传统 [[强化学习]] 方法在连续控制任务中虽然能够学习到有效的策略,但通常需要大量的环境交互样本,样本效率极低。这在真实机器人上尤为棘手——物理硬件的样本采集成本高昂,且反复试错可能导致机械磨损。在仿真环境中训练虽然成本较低,但策略迁移到真实机器人时往往出现显著的性能下降,即所谓的「仿真到现实」(sim-to-real)鸿沟。

近期研究开始探索在 [[强化学习]] 过程中编码物理先验来缓解这一问题。Koopman 理论提供了一条有吸引力的路径:它承诺将非线性动力学系统嵌入到一个线性化的无穷维函数空间中,在这个空间里,系统的未来状态可以通过简单的线性矩阵乘法来预测。如果能够在策略学习的同时学会这样一个 Koopman 模型,就能为 critic 提供关于系统动力学的结构化知识,帮助其做出更准确的值估计。然而,现有工作大多在简单的低维基准系统上验证这些想法——比如二维倒立摆或小车爬山问题——这些系统缺乏真实机器人的复杂非线性特性和形态结构。

SKooP 的切入点在于:真实腿足机器人往往具有天然的形态对称性。以四足机器人为例,其前后左右四条腿在物理结构上具有对称关系,这意味着某些状态在经过对称变换后应该产生可预测的对应行为。将这种对称性先验与 Koopman 模型相结合,可能产生协同效应:对称性提供了结构化的归纳偏置,而 Koopman 预测提供了平滑的动力学特征。

方法

SKooP 的核心思想是在策略学习的同时学习一个 Koopman 模型,并将该模型的预测结果作为特权观测输入给 critic,同时利用群对称性约束所有网络模块以产生高度等变的策略。

Koopman 理论的核心是找到一组观测函数 ,将原始状态空间 中的非线性动力学映射到一个高维(或无穷维)的函数空间,在其中系统演化表现为线性算子 的作用。实际应用中,SKooP 使用神经网络作为 [[自编码器]] 来学习这个映射:编码器将原始状态压缩为低维隐表示 ,解码器将隐表示重构回原始状态空间。Koopman 算子在这个隐空间中被参数化为一个矩阵 ,使得 。整个系统在训练时采用重建损失和一步预测损失的组合:

这里 是解码器从 重建的当前状态,一步预测损失确保了 Koopman 矩阵 能够捕获离散时间动力学。

在策略学习方面,SKooP 采用 Actor-Critic 架构,actor 负责输出动作,critic 负责估计状态-动作值函数 。关键设计在于 Koopman 预测作为 critic 的特权观测:除了原始状态 和动作 ,critic 还接收一个额外的输入——经过 步 Koopman 预测后的未来状态 。这个未来状态包含了关于系统动力学的结构化信息,且由于 Koopman 空间中的动力学是线性的,这些预测特征比原始状态空间更加平滑,有利于 critic 的泛化。

等变性设计是 SKooP 的另一核心要素。腿足机器人通常具有离散的左右对称性,这可以用一个二元素群 来描述:群元素 表示恒等变换, 表示左右翻转。SKooP 强制编码器满足等变性条件 ,即状态经过对称变换后,其隐表示也按照相同的方式变换。类似地,actor、critic 和解码器都通过共享权重或对称化设计满足相应的等变性约束。这种设计使得策略在面对对称的状态变体时能够产生对称的动作模式,既减少了需要学习的参数量,也提升了策略在对称姿态下的鲁棒性。

实验与结果

SKooP 在四足机器人上验证了多个具有挑战性的双足运动任务,包括对角小跑(trot)、踱步(pace)和跳跃(pronk)等步态模式。实验采用 IsaacGym 仿真环境,并与多个基准方法进行对比,包括标准 SAC、仅使用特权观测的变体、以及仅使用对称性的变体。

从收敛曲线来看,SKooP 在所有任务上都展现出更快的收敛速度。在对角小跑任务中,标准 SAC 需要约 150 万步才能达到稳定的高奖励,而 SKooP 在约 50 万步时就已经收敛,最终奖励值也更高。消融实验表明,Koopman 预测和对称性设计各自贡献了一部分性能提升,但两者结合时产生了显著的协同增益。这说明 Koopman 模型提供的平滑特征与对称性带来的结构化归纳偏置是互补的。

泛化能力是实验的另一个重点。研究者将训练好的策略迁移到不同摩擦系数、不同地面刚度甚至不同形态参数的仿真环境中。SKooP 学得的策略在这些未见过的环境中表现出更强的鲁棒性,性能下降幅度明显小于基准方法。这表明 Koopman 模型捕获的动力学特征具有一定的跨环境泛化能力,而非简单记忆了训练环境的特定属性。

讨论与可借鉴点

SKooP 展示了将物理先验与学习相结合的可行路径,但其局限性也值得注意。首先,目前的 Koopman 模型学习依赖于一步预测损失,对于长期动力学的一致性保证有限。其次,群对称性设计假设了明确的形态对称性,对于非对称或受损的机器人可能需要调整。第三,所有实验均在仿真环境中进行,sim-to-real 的迁移效果仍有待物理机器人验证。

从更广泛的角度看,SKooP 的方法论提供了一些值得借鉴的思路。将结构化知识(对称性)嵌入网络架构而不是仅依赖数据驱动学习,是提升 [[强化学习]] 效率和泛化性的有效途径。Koopman 预测作为特权观测的设计也很巧妙:它不改变 actor 的输入(保持在线推理的效率),而只在 critic 的离线学习中提供额外信息。这种「训练时用特权信息,推理时保持简洁」的模式值得在更多任务中探索。此外,对称性设计不仅提升了性能,还提供了一种正则化手段,有助于避免过拟合到训练环境的特定噪声模式。

摘要

强化学习(RL)算法传统上存在样本效率低的问题。在机器人领域,最近出现了一系列工作,通过在学习过程中编码物理先验来解决这一问题。然而,这些方法大多在定义明确的低维基准系统上进行验证,而非具有复杂非线性动力学的高维机器人。在本文中,我们提出了 SKooP(Symmetric Koopman Predictions,对称 Koopman 预测),一种将形态对称性的优势与通过自编码器学习的 Koopman 模型相结合以增强策略学习的方法。SKooP 在学习策略的同时学习系统动力学的 Koopman 模型。所得的 Koopman 预测被用作评论家(critic)的特权观测,使智能体能够基于更平滑、信息更丰富的特征进行学习。我们还将群对称性融入演员(actor)、评论家、编码器和解码器网络中,以生成高度等变的策略。我们通过对所学 Koopman 模型和对称策略的深入分析对 SKooP 方法进行了验证,展示它们各自如何影响智能体的性能。我们还展示了所学策略可迁移到不同的仿真环境中。我们的结果表明,在四足机器人上的多个具有挑战性的双足运动任务中,SKooP 始终能够缩短收敛时间并提高所学奖励。项目页面:https://evelyd.github.io/SymmetricKoopmanPredictions

Abstract

Reinforcement learning (RL) algorithms classically suffer from poor sample efficiency. In robotics, a recent line of work has emerged addressing this problem by encoding physics priors in the learning process. However, most of these approaches are validated on well-defined, low-dimensional benchmark systems rather than high-dimensional robots with complex nonlinear dynamics. In this paper, we introduce \textit{SKooP (Symmetric Koopman Predictions)}, an approach combining the advantages of morphological symmetries with those of a Koopman model learned via autoencoder to enhance policy learning. SKooP learns a Koopman model of the system dynamics alongside the policy. The resulting Koopman predictions are used as privileged observations for the critic, allowing the agent to learn based on smoother, more informative features. We also incorporate group symmetries into the actor, critic, encoder and decoder networks to produce a highly equivariant policy. The SKooP approach is validated via in-depth analysis of the learned Koopman models and symmetric policies to showcase how each of these influences the agent's performance. We also show that the learned policies are transferable to different simulation environments. Our results show that SKooP consistently reduces convergence time and increases the learned reward for multiple challenging bipedal locomotion tasks on a quadruped robot. Project page: https://evelyd.github.io/SymmetricKoopmanPredictions

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记