基于强化学习的可达-规避任务学习:向量化仿真与基准测试
Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark
📝 TLDR
深度强化学习长期被用于解决机械臂到达-避障任务,但既有研究多在简化桌面场景中评估。本文基于MuJoCo MJX物理引擎和Brax并行化库,首次构建面向真实复杂场景的综合基准,覆盖UR5e与Franka等机械臂。实验表明,简化场景下表现优异的DRL智能体在更逼真环境中性能显著下降,揭示该方向仍需深入研究。
🧭 速览
既有DRL到达-避障研究多依赖简化与受限的桌面场景,缺乏对真实复杂环境的系统性评估。
采用MuJoCo MJX物理引擎配合Brax库,并行化仿真环境与DRL算法,构建多机器人可达-避障基准平台。
UR5e与Franka上到达成功率分别达96.1%与98.8%,静态避障成功率分别为86.8%与95.2%,但整体性能低于简化场景。
DRL智能体在简化场景表现优异,在更逼真环境中性能崩溃,到达-避障任务距离真正解决仍有距离。
📊 论文图表(共 12 张)
展开查看 12 张图
TL;DR
这篇论文首次为机械臂的可达-规避任务构建了一套基于 GPU 并行仿真的综合基准测试平台,在完整可达工作空间内系统评估了深度强化学习智能体的真实能力。研究的核心发现颇具警示意义:在简化桌面场景中近乎完美的 DRL 智能体,一旦扩展到机械臂完整工作空间并引入随机障碍,性能会显著下降——例如,用 PandaGym 场景训练的智能体在 Full 工作空间评估时到达率仅为 4.0%,而自碰撞率却飙升至 63.2%,揭示该领域仍需深入研究。
研究背景与动机
深度强化学习在机械臂控制领域有着悠久的应用历史,其中「可达-规避」(reach-avoid)任务——即驱动机械臂末端到达指定目标位置、同时避免与环境中的障碍物发生碰撞——常被研究者用作检验算法能力的基准环境。然而,细究已有文献会发现一个普遍现象:这些评估几乎无一例外地建立在高度简化的场景之上。
以广泛使用的 PandaGym 基准为例,其工作空间被限制在仅仅 30 × 30 × 30 厘米的桌面范围内,障碍物形态单一,初始化条件固定可控。这种简化带来的后果是,研究者报告的成功率往往接近 100%,给外界一种「该任务已被解决」的错觉。但直觉告诉我们,真实的工业或服务场景远比这复杂:机械臂需要在完整可达范围内运动,可能遭遇形状各异的障碍物,目标位置也无法事先预知。
更关键的问题在于,既有研究多采用笛卡尔空间控制策略,智能体仅控制末端执行器的位置,根本无法「感知」或「操控」肘部等中间关节连杆的动态——这意味着即使智能体成功到达了目标,肘部仍可能与障碍物发生碰撞。论文的核心追问正是在此:当工作空间扩展到机械臂完整可达范围、引入随机障碍与随机初始化时,[[深度强化学习]]智能体是否仍能有效学习可达-规避任务?
方法
回答这个问题需要一套能够忠实捕捉真实世界复杂性的仿真基准。论文的方法论从仿真平台选择到任务定义再到训练框架,形成了一条完整的技术链路。
仿真平台的选择是首要决策。研究者选用了 MuJoCo MJX 物理引擎,这是 MuJoCo 的 GPU 加速版本,能够在单块 NVIDIA RTX 3090 Ti 上同时运行多达 8,192 个并行仿真环境。结合 Brax 库(基于 JAX 的可微分物理引擎),整个仿真与训练流程可以实现端到端的 JIT 编译,吞吐率达到每秒约 185,000 步,相比基于 CPU/GPU 分离架构的 Stable Baselines 3 提速超过 10 倍。这种大规模并行能力对于系统性基准测试至关重要——只有足够的采样效率才能支撑得起多维度、大规模的消融实验。
机器人建模方面,论文聚焦于两种主流机械臂:UR5e 与 Franka Emika Panda。为了适配 MJX 的碰撞几何要求,研究者将 UR5e 的末端圆柱碰撞体替换为胶囊体(使仿真速度提升 2 倍),将 Franka 的网格碰撞几何也替换为胶囊体。此外,一个容易被忽视但至关重要的细节是关节阻尼的校准——原始 MJX 模型中机械臂最高速度可达真实物理限制的 5 倍,研究者通过引入关节阻尼项来修正这一偏差,使仿真行为更贴近真机。
任务定义包含两个层次。可达任务要求机械臂从随机初始关节配置运动到随机目标位置,并在到达后保持在该位置,单回合限制 125 步(对应约 5 秒仿真时间)。可达-规避任务则在此基础上加入一个半径 10 厘米的静态球形障碍物,智能体必须在到达目标的同时避免与障碍物碰撞。这两个任务构成了基准的核心评估场景。
动作空间设计了两种控制模式供对比:绝对位置控制下智能体直接输出目标关节角度;相对位置控制下智能体输出当前关节位置的增量。观测空间则从最精简的关节位置+末端笛卡尔位置+目标位置,到包含关节速度、加速度、末端速度、障碍物位置与尺寸、各连杆到障碍物的欧氏距离等多种配置不等。
奖励函数的设计尤为值得关注。研究者系统对比了三种形式:[[稀疏奖励]]仅在成功到达时给予 +1,否则为零;半稀疏奖励在稀疏奖励基础上叠加距离奖励项,引导智能体向目标方向移动;[[密集奖励]]采用指数衰减形式 ,使智能体在每一步都能获得与目标距离相关的梯度信号。可达-规避任务额外引入连杆-障碍物碰撞惩罚项,量化各连杆与障碍物的接近程度。实验采用了 PPO(Proximal Policy Optimization)作为主要训练算法,批大小 512,学习率 ,配合大规模并行仿真环境实现高效训练。
实验与结果
实验设计的核心思路是通过控制变量逐层剥离各因素对性能的影响,构建一张完整的评估矩阵。研究设置了四个递进的工作空间尺度:PandaGym(30 × 30 × 30 cm 桌面级)、Front(机器人前方 180° 区域)、Upper(完整桌面范围)、Full(完整可达球面工作空间)。这种设计使得研究者能够精确观察工作空间复杂度上升时智能体性能的变化趋势。
奖励函数的效力差异是实验中最为醒目的发现之一。[[稀疏奖励]]在 Full 工作空间下完全失效——随机策略在 1 厘米目标下的成功概率仅为 0.006%,平均需要 200 万步才能获得第一个非零奖励。这种「大海捞针」式的稀疏信号对于探索算法的挑战是致命的。[[密集奖励]]则表现最佳,学习速度最快、到达精度最高,在 Full 工作空间下达到了 UR5e 96.1%、Franka 98.8% 的可达成功率,以及 86.8% 与 95.2% 的可达-规避成功率。
动作空间的对比同样出人意料。虽然绝对控制与相对控制在到达率上相当(均约 96.5%),但稳定性指标揭示了本质差异:相对控制在目标内保持的步数平均为 99.1 步,而绝对控制仅为 41.5 步;相对控制离开目标的次数平均为 0.05 次,绝对控制则高达 21.7 次。这意味着绝对控制策略在到达目标后缺乏保持能力,频繁「越过」目标后需要重新调整。
工作空间迁移的灾难性失效构成了论文最具警示性的结论。用 PandaGym 小工作空间训练的智能体在 Full 工作空间评估时,到达率暴跌至 4.0%,自碰撞率却飙升至 63.2%。这一结果表明,简化场景中习得的策略严重过拟合于受限的空间分布,无法泛化到更广阔的部署环境。有趣的是,反向迁移(小→大)表现良好,这提示研究者在选择训练场景时应「低估」而非「高估」部署环境的复杂度。
障碍物尺寸泛化也呈现类似的过拟合现象:在某一固定障碍半径上训练的智能体,对未训练尺寸的泛化能力有限,尤其是小尺寸障碍训练出的策略无法适应更大的障碍。
讨论与可借鉴点
这项研究的价值不仅在于提出了一个新的基准,更在于它以系统化的方式揭示了[[深度强化学习]]在机械臂控制领域尚未解决的深层问题。
从方法论角度看,论文提供了一个可靠的基准构建范本:利用 GPU 并行仿真实现大规模系统性评估,通过多维度消融(动作空间、奖励函数、观测空间、网络规模、工作空间尺度、障碍尺寸)揭示各因素的主效应与交互效应。这种「穷举式」的基准设计思路值得借鉴——它不只是报告最优结果,而是完整呈现「在什么条件下会失败」。
从实践角度看,研究揭示的Sim-to-Real 鸿沟的微观基础值得关注。即使在仿真环境中,当场景从简化走向真实时,DRL 智能体的性能衰减是渐进的而非突变的:PandaGym 场景近乎完美,Front 场景开始出现碰撞,Full 场景则出现不可忽视的失败率。这种层次化的性能退化模式提示研究者,在评估 DRL 方法时应警惕「完美仿真结果」的欺骗性。
可借鉴的核心设计原则包括:训练时应优先使用更大、更复杂的工作空间以提升泛化能力;相对位置控制在小空间可能不如绝对控制直观,但在大空间中的稳定性优势使其成为更可靠的选择;[[密集奖励]]虽然不够「优雅」,但在学习效率与最终性能上显著优于[[稀疏奖励]],应被视为复杂场景下的首选。
局限性同样需要正视。论文仅涉及静态球形障碍,未考察动态障碍或非规则几何形状;仿真结果尚未在真实机械臂硬件上验证 Sim-to-Real 迁移效果;目标尺寸对学习的影响也未系统化研究。这些开放问题为后续研究指明了方向——动态障碍的引入、基于域随机化的泛化能力提升、以及最终的真机部署验证,都是值得深耕的课题。
摘要
深度强化学习(DRL)在解决可达-规避任务问题方面有着悠久的传统,尤其是在机械臂控制领域。尽管该任务在研究社区中常被用作基线环境,但 DRL 是否能够在简化且受限的桌面场景之外的复杂且真实的环境中有效学习可达-规避任务仍不确定。本文首次提出了一个全面的可达-规避任务基准,该基准准确捕捉了真实世界的复杂性,且未做任何简化。我们展示了多种机械臂可达-规避任务的设定,可用于评估 DRL 研究。我们通过使用 MuJoCo MJX 物理引擎以及利用 Brax 库对仿真环境和 DRL 算法进行并行化来实现这一目标。我们在可达任务上取得了最先进的成果,成功率分别为 96.1%(UR5e)和 98.8%(Franka Emika Robot);在静态可达-规避任务上,成功率分别为 86.8%(UR5e)和 95.2%(Franka)。我们的结果表明,尽管在之前的工作中 DRL 智能体能够完美地解决简化场景中的可达任务,但当在真实场景中进行评估时,它们的性能会出现显著下降。总体而言,本工作表明,要声称使用 DRL 成功解决了机械臂可达-规避任务,仍需要进行更多的研究。环境和基准测试代码已开源,可通过以下链接获取。
Abstract
Deep reinforcement learning (DRL) has a longstanding tradition in addressing the reach-avoid task problem, especially for controlling robotic arms. While this task serves as a baseline environment within the research community, the ability of DRL to effectively learn the each-avoid task in complex and realistic scenarios beyond simplified and restricted tabletop settings remains uncertain. In this paper, we present, for the first time, a comprehensive benchmark for the reachavoid task that accurately captures real-world complexities without simplifications. We demonstrate a diverse range of settings for robotic arm reach-avoid task, which can be used for evaluating DRL research. We achieved this by utilizing the MuJoCo MJX physics engine and parallelizing both the simulation environment and DRL algorithms using the Brax library. We achieved state-of-the-art results with success rates of 96.1% (UR5e) and 98.8% (Franka Emika Robot) for the reach task and 86.8% (UR5e) and 95.2% (Franka) for the static reachavoid task. Our results indicate that while in previous works DRL agents could solve, for example, a reach task in a simplified setting perfectly, their agents performance collapses when evaluated in realistic scenarios. Overall, this work identifies that additional research is still required to claim the successful resolution of the robotic arm reach-avoid task using DRL. The environment and benchmarking code is available as open source at the following link
论文详细总结(自动生成)
论文总结:基于强化学习的可达-规避任务学习——向量化仿真与基准测试
1. 核心问题与整体含义
研究动机与背景:
- 深度强化学习(DRL)长期以来被用于解决机械臂的"可达-规避"(reach-avoid)任务,但绝大多数已有工作建立在简化的桌面场景(如 PandaGym 的 cm 工作空间)之上。
- 这种简化导致以下问题:
- 笛卡尔空间控制的智能体无法控制肘部等关节连杆,难以真正避障;
- 工作空间受限、障碍简单,使得"成功"结果难以反映真实场景性能;
- 现有研究多报告近乎完美的成功率,造成"该任务已被解决"的错觉。
- 论文核心问题:当工作空间扩展到机械臂完整可达范围、引入随机障碍与随机初始化时,DRL 智能体是否仍能有效学习可达-规避任务?
2. 方法论
2.1 核心思想
- 利用 MuJoCo MJX 物理引擎 + Brax 库,在单块 GPU 上实现大规模并行仿真与端到端 DRL 训练;
- 采用关节级直接控制(end-to-end joint control),而非笛卡尔空间控制,以实现真正意义的多连杆避障;
- 在机器人完整可达工作空间内进行系统性基准评测。
2.2 关键技术细节
仿真平台:
- 物理引擎:MuJoCo MJX(GPU 加速),默认 2 ms 时间步、Newton 求解器;
- 训练框架:Brax(基于 JAX 的可微分物理引擎);
- 求解器:1 次迭代、6 次线搜索、稠密 Jacobian;
- 每个环境步使用 20 个物理子步;
- UR5e:将末端圆柱碰撞几何替换为胶囊体,仿真速度提升 2 倍;
- Franka:将网格碰撞几何替换为胶囊体(因 MJX 不兼容原网格);
- 加入关节阻尼以匹配真实速度上限(修正最高 5 倍速度异常)。
软件架构:
- 无状态(stateless)设计,封装于
Statedataclass,与 JAX 的 JIT 编译兼容; - 模块化抽象:
Env基类 →reach/reach-avoid任务类;Robot抽象基类支持不同机器人; - 兼容 Gymnasium API 与 Brax 环境封装。
任务定义:
可达任务:从随机初始关节配置到达随机目标,到达后需保持(reach-and-stay),单回合 125 步(≈ 5 s 仿真时间)。
可达-规避任务:在可达任务基础上加入一个半径 10 cm 的静态球形障碍物。
动作空间:
- 绝对位置控制:智能体直接输出目标关节角度;
- 相对位置控制:智能体输出当前关节位置的增量。
观测空间(可配置):
- 基础:关节位置、末端执行器笛卡尔位置、目标位置;
- 可扩展:关节速度/加速度、末端笛卡尔速度、末端→目标向量、上一动作;
- 可达-规避额外加入障碍物位置、尺寸、以及各连杆到障碍物的欧氏距离。
奖励函数(三种形式):
1. 稀疏奖励:到达得 ,否则 ,碰撞隐式通过回合终止处理。
2. 半稀疏奖励:
3. 密集奖励:
可达-规避任务增加连杆-障碍物距离惩罚:
算法:
- PPO(Proximal Policy Optimization):批大小 512,64 minibatches,学习率 ,折扣因子 ,unroll 长度 10;
- SAC(Soft Actor-Critic):128 并行环境,批大小 256,学习率 ,奖励缩放 20,经验回放池 transitions。
3. 实验设计
3.1 场景与数据集
- 机器人:UR5e、Franka Emika Panda;
- 任务:reach(无障碍)、reach-avoid(静态球形障碍);
- 工作空间(由小到大四档):
- PandaGym: cm 桌面级;
- Front:机器人前方 180° 区域;
- Upper:完整桌面范围;
- Full:完整可达球面工作空间。
- 采样设置:
- 初始姿态从完整关节范围均匀采样(剔除碰撞);
- 目标从可达球面或末端可达位置采样;
- 障碍从 m 立方体均匀采样。
3.2 对比基线
可达任务基线(表 I):
- Random:随机动作;
- Standstill:保持初始姿态;
- Pseudo IK:基于已知可达解的伪逆运动学。
可达-规避任务基线:直接使用训练好的 reach 智能体(无障碍训练)。
3.3 评估指标
- 目标到达率(target reached rate);
- 碰撞率(自碰撞 / 障碍碰撞);
- 末端到目标距离(最后 10 步平均);
- 在目标内的步数、离开目标次数。
3.4 Benchmark 内容
实验维度包括:
- 动作空间(绝对 vs 相对位置控制);
- 奖励函数(稀疏 / 半稀疏 / 密集);
- 观测空间(最小化 vs 完整化);
- 网络规模( 到 不等);
- 工作空间尺寸(PandaGym / Front / Upper / Full);
- 障碍尺寸(、、、、 m);
- 跨工作空间泛化与跨障碍尺寸泛化;
- 初始关节范围对性能的影响。
4. 资源与算力
- GPU:单块 NVIDIA RTX 3090 Ti;
- CPU:Intel Core i7-13700k;
- 并行规模:最多 8,192 个并行环境;
- 仿真吞吐:
- UR5e reach 任务:约 185,000 步/秒;
- UR5e reach-avoid 任务:约 125,000 步/秒;
- 加速比:相比 Stable Baselines 3 训练速度提升 10 倍以上(得益于 GPU 端并行 + 单进程 JIT);
- 每个实验:5 个随机种子,评估时使用 4,096 个并行环境;
- 训练时长未在论文中以绝对小时数明确给出,但通过吞吐量可推算单次实验训练量级在数十亿步(数小时到数十小时不等)。
5. 实验数量与充分性
- 实验规模:论文汇报了数十组消融与对比实验,覆盖:
- 2 种机器人 × 2 种任务 × 4 种工作空间 × 5 种奖励/动作/观测组合 × 5 种障碍尺寸;
- 多组泛化交叉评估(训练工作空间 A 评估工作空间 B);
- 随机种子:每组实验 5 个种子,最终结果取平均±标准差;
- 公平性:
- 所有对比实验使用相同的硬件、并行规模与训练框架;
- PPO 与 SAC 在相同基准上对比;
- 跨评估矩阵系统化呈现训练/评估分布差异;
- 充分性:消融维度较完整(动作/奖励/观测/网络/工作空间/障碍尺寸),但部分维度(如跨机器人对比)样本仍有限,且 SAC 实验在 reach-avoid 上未充分展开。
6. 主要结论与发现
6.1 性能结果
| 任务 | UR5e | Franka |
|---|---|---|
| Reach(目标到达率) | ||
| Reach-Avoid(目标到达率) |
6.2 关键发现
- 简化场景近乎完美,现实场景性能显著下降:PandaGym 工作空间中可达 100% 到达率,零碰撞;Full 工作空间仍残存约 1–2.5% 碰撞率。
- 奖励函数:稀疏奖励在大工作空间中完全无法学习(1 cm 目标下随机成功概率仅 0.006%,平均需 200 万步才收到首个非零奖励);密集奖励最快、精度最高。
- 动作空间:绝对与相对控制到达率相当(≈ 96.5%),但相对控制在精度与稳定性上显著优越(保持在目标内步数 vs ,离开次数 vs )。
- 观测空间:加入末端笛卡尔位置显著提升相对控制下的学习速度与精度;进一步加入速度/历史动作无明显收益。
- 网络规模: 对相对控制足够;绝对控制下 略优且训练更快。
- 工作空间尺寸的剧烈影响:SAC 在大工作空间下性能崩溃(图 7);大工作空间训练策略不能泛化到小工作空间以外(如 PandaGym 训练的智能体在 Full 工作空间到达率仅 ,自碰撞率 ),但反向泛化(小→大)良好。
- 初始姿态分布敏感性:使用前一回合终止姿态作为初始姿态的方法会损害泛化能力。
- 障碍尺寸影响:障碍越大,目标到达率越低,但障碍碰撞率保持在约 4% 的下限;固定尺寸训练的智能体对未训练尺寸过拟合(小→大差,大→小好)。
7. 优点与亮点
- 首个面向真实复杂场景的综合基准:填补了 DRL 机械臂 reach-avoid 任务在"现实复杂度"层面的评估空白;
- GPU 并行化训练管线:单 GPU 内完成仿真+训练的 JIT 全流程,吞吐比传统 CPU/GPU 分离方案高 10 倍以上;
- 系统化的消融设计:动作、奖励、观测、网络、任务复杂度五个维度全面对比;
- 跨泛化分析:明确揭示"小工作空间训练→大工作空间部署"的性能崩溃现象,方法论上有警示意义;
- 多机器人支持:UR5e 与 Franka 双平台结果对比,揭示关节构型对碰撞行为的影响;
- 开源:环境与基准代码全部开源,便于复现与扩展;
- 仿真细节贴近真实:修正关节阻尼、几何简化等,使速度与碰撞行为更接近真机;
- 明确的失败案例分析:并未仅展示最优结果,而是完整呈现"哪些条件下会失败"。
8. 不足与局限
- 仅限静态球形障碍:未涉及动态障碍、非规则几何形状障碍;
- Sim-to-Real Gap 未弥合:仿真结果尚未在真实硬件上验证;
- 障碍尺寸单一训练:智能体对未训练尺寸存在过拟合,缺乏尺寸随机化训练策略;
- 目标尺寸固定:reach 任务未系统化研究目标尺寸对学习的影响(仅对比 1 cm 与 2 cm 一次);
- 基线选择有限:reach-avoid 任务仅与无障碍训练的 reach 智能体对比,缺乏与传统运动规划(如 RRT*、MPC)或学习+规划混合方法的直接比较;
- SAC 探索不充分:SAC 在 reach-avoid 任务上的实验覆盖较少;
- 评估回合长度限制:125 步(≈ 5 s)可能不足以反映长时域稳定性;
- 报告偏见:论文未给出完整训练时长(小时数)与计算能耗,难以判断实际训练成本;
- 奖励调参:、、、、 等超参数的选取过程未充分披露;
- 泛化声明有限:跨机器人、跨形态的迁移能力未测试。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。











