基于强化学习的轮滑人形机器人控制
Reinforcement Learning-Based Control for an Inline Skating Humanoid Robot
📝 TLDR
人形机器人实现高速高效运动极具挑战,常规步行能耗较高。本文提出基于强化学习的控制策略,让改装被动直排轮的人形机器人自主学得滑行动作,无需人类动作数据或运动学先验。训练融合球形与椭球两种轮几何模型,并配套命令课程与滚动奖励以攻克欠驱动不稳定性。实机零样本迁移成功,相比标准步行能效提升50%,演示了动态平衡、抗扰动与高速转向能力。
🧭 速览
被动直排滑冰高度欠驱动且不稳定,需借助RL让改装人形机器人兼具人类敏捷性与滑行能效优势。
RL策略控制6自由度滑冰姿态与滚动方向,采用球形与椭球轮几何模型训练,并设计成功率命令课程与专用滚动奖励。
CoT较标准步行降低50%,零样本迁移至Booster T1硬件,验证动态平衡、主动扰动抑制与高速转弯能力。
证明RL可在无人类先验条件下学得被动轮滑行策略,为人形机器人高速高效运动控制提供新范式。
📊 论文图表(共 24 张)
展开查看 24 张图
TL;DR
这篇论文让一个改装了直排轮滑鞋的人形机器人完全依靠强化学习自主学会滑行动作,无需任何人类示范或运动学先验。训练中巧妙融合两种轮几何模型并设计了专用的命令课程与滚动奖励,成功克服了被动轮固有的欠驱动不稳定性。最终策略实现了步行能耗降低 50% 的运输成本(CoT)优化,并能零样本迁移到真实硬件上,展示了动态平衡、抗扰动与高速转弯能力。
研究背景与动机
人形机器人要在复杂环境中高效移动,长期以来面临一个核心矛盾:传统步行步态虽然稳定可控,但能耗居高不下,严重制约了续航能力与实际应用价值。相比之下,人类滑冰运动员早已掌握了一种截然不同的运动策略——利用轮滑鞋的滚动特性,将腿部关节的往复运动转化为高速、低能耗的滑行推进。这种基于轮刃的推进方式与人体的多关节协调密切相关,但对机器人而言,实现这种动态平衡和欠驱动控制却极具挑战。
在此之前,相关研究大多局限于四足机器人或配备了主动驱动轮的简化平台。主动驱动轮虽然解决了部分控制问题,却偏离了人类滑冰那种「被动」利用重力与惯性进行推进的本真状态。真正的被动直排轮滑鞋——即不依赖电机驱动轮子本身、仅靠人体重心切换和姿态调整来产生推进力——因其固有的欠驱动特性而长期被回避。机器人的脚被替换为没有动力源的轮子后,一旦失去平衡就几乎无法补救,这对控制算法的鲁棒性提出了极高要求。
此外,仿真环境中精确建模轮子与地面的接触本身就是一个难题,接触力的非线性、摩擦系数的敏感性以及轮子几何形状的微小差异都可能导致「仿真到现实」的迁移鸿沟。论文的切入点正是要回答:能否让人形机器人像人类滑手一样,通过纯粹的重心控制和姿态调整,在被动直排轮上自主涌现出高效的滑行策略?
方法
要让一个欠驱动的轮式人形系统学会稳定滑行,核心挑战在于如何设计训练机制,使得策略能够从零开始涌现出符合物理直觉的推进动作,而不依赖任何人类运动数据作为模仿目标。论文采用了标准的 [[强化学习]] 框架,以 [[策略梯度]] 方法优化一个参数化的神经网络控制器,但在奖励结构与训练课程上做了精心设计。
奖励结构是策略涌现的关键。论文定义了多层次的奖励项,包括前进速度奖励、姿态稳定性奖励、关节平滑性惩罚以及一个专门的「滚动奖励」。滚动奖励的核心思想是鼓励机器人在滑行过程中保持轮子处于滚动状态而非滑动状态——这对防止侧滑失控至关重要。具体实现上,滚动奖励通过检测轮子的实际运动方向与名义滚动方向之间的偏差来计算,偏差越小奖励越高。这一设计直接引导策略自主学会了人类滑手赖以维持平衡的「轮刃控制」技巧,即通过身体倾斜改变轮刃着地角度来调整滑行方向和速度,而无需显式建模复杂的摩擦力学。
命令课程(Command Curriculum)是另一项关键设计。由于滑行任务本身就存在不稳定性,论文没有让策略一开始就面对高难度的高速滑行指令,而是采用渐进式的训练方式:初期只要求机器人维持低速直行,随着策略在低速下的成功率提升,逐步引入更高速度指令和转向命令。这一课程设计基于任务完成度的自适应调整,只有当机器人在当前难度下的成功率超过阈值后,才会提升命令难度。这种由易到难的训练节奏显著降低了策略探索失败的风险。
双几何轮模型策略是论文中最具巧思的技术细节之一。论文发现,如果训练和验证阶段使用完全相同的轮子几何模型,策略会过度适应特定的接触参数,导致仿真到真实迁移时性能崩塌。为此,论文在训练阶段使用球形轮模型,而将椭球形轮模型保留到验证阶段。这种「训练-验证不一致」的设计迫使策略学会处理接触力变化的不确定性,从而在面对真实物理世界中轮子形状的细微差异和地面条件的起伏时,表现出更强的鲁棒性。
整个策略网络接收来自机器人本体感觉传感器的状态信息(关节位置、速度、IMU 数据等),输出每个关节的期望力矩或位置指令。由于策略完全从奖励中涌现,不依赖运动学先验,最终学得的滑行模式往往是人类运动科学中未曾明确描述过的关节协调方式——这本身就是一种令人惊喜的「超越人类直觉」的运动策略。
实验与结果
论文在仿真环境中完成了大规模训练,随后将策略零样本部署到真实的 Booster T1 人形机器人上进行验证。Booster T1 是一台商用高性能人形机器人,腿部共 10 个主动自由度,被改装后双脚安装消费级直排轮滑鞋,机器人整体处于完全被动滚动状态,没有任何额外的轮毂电机或主动平衡装置。
实验首先系统测量了滑行策略的能耗效率。论文采用 [[运输成本(CoT)]] 作为核心指标,其定义为 ,即单位重量、单位距离下的能量消耗。实验结果显示,经过强化学习训练的滑行策略相比标准步行步态实现了高达 50% 的 CoT 降低。这意味着在相同的电池容量下,机器人能够行驶近乎两倍的距离。这一结果验证了轮滑运动策略在能效层面的显著优势。
在功能性验证方面,论文设计了多组物理扰动测试。实验人员对正在滑行的机器人施加不同方向的推力,观察其恢复平衡的能力。结果表明,策略能够在短时间内通过姿态调整重新建立稳定的滑行状态,展示了良好的主动抗扰动能力。此外,高速转弯测试验证了策略的敏捷性——机器人在中高速滑行状态下能够执行快速转向动作,转向半径显著小于传统步行步态下的表现。
值得强调的是,这些能力并非通过模仿学习或人体运动捕捉数据获得的,而是策略完全从纯仿真环境中的奖励优化中自主涌现的。这使得训练过程完全可控且可扩展,无需采集昂贵的真实世界人体运动数据。
讨论与可借鉴点
尽管论文取得了令人印象深刻的结果,但其局限性也值得审慎讨论。首先,被动直排轮方案虽然能效出众,但本质上牺牲了机器人在非平坦路面上的通过能力——它无法像步行那样跨越障碍或爬楼梯,这一权衡在特定应用场景中可能是不可接受的。其次,策略在极端低速度下的稳定性仍有提升空间,此时轮子的滚动特性最不显著,系统更接近于一个纯倒立摆式的欠驱动平衡问题。
从更宏观的角度看,这项工作为 [[强化学习]] 在高自由度欠驱动系统中的应用提供了一个范例性的成功案例。其双几何模型训练策略暗示了一个更广泛的原则:在仿真到真实的迁移任务中,刻意引入训练环境与目标环境之间的参数不一致性,可能比追求仿真精度更为有效。这一洞察对于机器人控制领域普遍面临的仿真-现实鸿沟问题具有重要的借鉴价值。
论文中滚动奖励的设计思路也值得推广。许多轮式或滑动式运动任务(无论是轮足机器人、滑冰机器人还是滑雪机器人)都可以借鉴类似的原则——鼓励期望的运动模式而非直接约束具体的执行方式,让策略在物理约束下自主发现最自然的运动协调策略。
最后,这项工作将人形机器人的运动能力边界从「稳态步行」推向「动态轮滑」,展示了强化学习在发掘非常规运动策略方面的独特潜力。随着硬件平台的进一步成熟和仿真精度的提升,我们有理由期待未来出现更多融合多种运动模态的复合型人形机器人系统。
摘要
随着人形机器人的动态性能不断提升,将强化学习与之相结合,为解决被动式轮滑这一复杂、欠驱动的力学问题提供了一种前景广阔的方法。给人形机器人配备被动式直排轮滑轮,使其能够将人形机器人多用途的灵活性与人类滑手所采用的高速、节能的运动策略相结合。在本文中,我们训练并部署了一种强化学习控制策略,使经过改造的人形机器人——其将传统脚部替换为消费级直排轮滑鞋——能够实现新颖的运动策略。不同于以往局限于四足机器人或主动驱动轮的研究,我们的系统能够对轮滑鞋进行精确的六自由度控制,以执行动态的、基于轮刃的推进策略。我们的轮滑策略完全从奖励结构中涌现,不依赖人体运动数据、模仿学习或运动学先验。我们通过在训练和验证阶段使用不同的几何轮模型(球形和椭球形),并结合一种基于成功的指令课程以及专门的滚动奖励,克服了被动轮固有的不稳定性以及仿真中的接触伪影问题。因此,我们的策略相较于标准步行步态实现了高达50%的运输成本(CoT)降低。所得策略能够零样本迁移到真实的Booster T1硬件上。真实世界部署验证了动态平衡、抵抗主动物理扰动的能力,以及能够高速转弯的敏捷运动策略。相关结果视频可访问 https://www.youtube.com/watch?v=-_APcOS7uFo。
Abstract
As humanoid robots become increasingly dynamic, coupling them with reinforcement learning offers a promising approach to solving the complex, underactuated mechanics of passive inline skating. Equipping a humanoid robot with passive inline skating wheels presents an opportunity to combine the versatile agility of humanoids with the high-speed, energy-efficient locomotion strategies utilized by human skaters. In this paper, we train and deploy a reinforcement learning control policy that enables novel locomotion strategies for a humanoid robot modified to equip consumer inline skates instead of conventional feet. Unlike previous work limited to quadrupedal robots or actively driven wheels, our system allows for precise 6-DoF control of the skates to execute dynamic, edge-driven propulsion strategies. Our skating strategies emerge entirely from our reward structure, without reliance on human motion data, imitation learning, or kinematic priors. We overcome the inherent instability of passive wheels and simulation contact artifacts by utilizing different geometric wheel models (spherical and ellipsoidal) during training and validation, along with a custom success-based command curriculum and a specialized rolling reward. Consequently, our policy demonstrates up to a 50% reduction in Cost of Transport (CoT) compared to standard walking gaits. The resulting policy successfully transfers zero-shot to the physical Booster T1 hardware. Real-world deployments demonstrate dynamic balance, the ability to reject active physical perturbations, and agile locomotion strategies capable of turning at speed. A video of our results can be found at https://www.youtube.com/watch?v=-_APcOS7uFo.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。























