arXiv 2607.09336v1 · 发布 2026-07-10

用于高效离线强化学习的捷径轨迹规划

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

AUTHORS Guanquan Wang, Yoshimasa Tsuruoka
EVIDENCE 离线基于模型的强化学习,采用捷径轨迹规划提升效率
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-13 21:46:50 UTC

📝 TLDR

扩散轨迹规划在离线强化学习中表现优异,但迭代去噪导致推理成本高昂。已有的一致性规划器虽能减少采样步数,却依赖两阶段师生蒸馏,训练开销大且稳定性差。本文提出Shortcut Trajectory Planning(STP),将捷径模型作为高效轨迹生成器,采用单阶段训练并通过步长条件化支持灵活的一步或少步推理,结合可行性修正的critic筛选候选方案。在D4RL的运动、导航、操作与灵巧控制等多类基准上,STP均取得强性能,同时显著简化了生成式规划的训练流程。

🧭 速览

动机

扩散规划推理慢,一致性模型又依赖两阶段蒸馏,训练成本高且不稳定,亟需更高效的离线轨迹生成方案。

方法

STP将捷径模型作为轨迹生成器,单阶段训练,通过步长条件化支持一步或少步推理,并用可行性修正的critic筛选候选方案。

结果

在D4RL运动、导航、操作与灵巧控制等多类基准任务上取得强性能,并显著简化了训练流程。

结论

STP以单阶段捷径模型统一了效率与稳定性,为离线RL中的快速生成式规划提供了实用方案。

📊 论文图表(共 7 张)

展开查看 7 张图

TL;DR

Shortcut Trajectory Planning(STP)提出用单阶段训练的捷径模型替代传统两阶段师生蒸馏管线,从而在保持离线强化学习规划性能的同时大幅简化训练流程并降低推理成本。实验表明,STP 在 D4RL 的运动、导航、操作与灵巧控制等多样化任务上均取得竞争力成绩,并通过步长条件化实现了一步到少步的灵活推理。

研究背景与动机

在离线强化学习中,如何从固定的数据集中学到有效的决策策略是一个核心挑战。近年来,基于[[扩散模型]]的轨迹规划器(如 Diffuser、Decision Diffuser)展现出强大的多模态轨迹建模能力,能够在复杂环境中生成高质量的动作序列。然而这类方法的固有局限在于:推理时需要进行数十步的迭代去噪,每一步都需要完整的前向传播,在需要快速响应的场景中带来了难以忽视的计算延迟。

为了加速推理,研究者引入了[[一致性模型]]的思想。一致性规划器(Consistency Planning、Consistency Trajectory Planning)通过学习从任意噪声状态到对应干净状态的一致性映射,将原本需要几十步的采样压缩到少数几步,显著降低了每步规划的延迟。但这种提升并非免费——当前的一致性规划器依赖一个两阶段的师生蒸馏流程:首先训练一个标准的[[扩散模型]]作为教师,随后将其蒸馏为一个一致性学生模型。这一管线带来两个深层问题:训练成本几乎翻倍,因为需要依次完成两个模型的训练;其次,蒸馏过程引入的误差会与教师模型的质量耦合,最终规划器的性能同时取决于两个阶段是否各自成功,这在离线 RL 中数据分布偏移和多模态轨迹并存的情况下尤为脆弱。

STP 的核心动机正是直面这个两难:如何在不引入蒸馏管线复杂性的前提下,获得快速、可调的少步推理能力?作者认为捷径模型(Shortcut Model)提供了一条可行的路径——它天然支持步长条件化,可以通过单阶段训练直接学习不同步长下的更新方向,从而在保持生成质量的同时跳过蒸馏这一中间环节。

方法

STP 的方法框架围绕三个核心组件展开:条件捷径轨迹模型、可行性感知修正评论家,以及推理时的 warm-start 策略。这些组件共同构成一个完整的规划-执行闭环。

捷径模型的基本原理

捷径模型建立在 [[Flow Matching]] 框架之上。标准 Flow Matching 的核心思想是学习一个连续速度场,使得任意噪声样本沿线性插值路径被输送到数据分布中的对应点,其数学形式为 ,其中 表示插值进度。在采样时,需要通过数值积分来逐步推进状态,即 。问题在于,当采样步数 过少时,每一步的离散化步长 较大,数值积分的误差会显著累积,导致生成质量下降。

捷径模型的关键设计在于:网络直接以步长 作为额外输入,学习有限步更新量。具体而言,模型 接收当前状态 、时间步 和步长 ,输出一个增量 ,使得 。这意味着网络学会的不是"在当前时刻的瞬时速度",而是"以步长 执行一步更新后的结果",从而绕过了离散化误差的问题。

为了保证不同步长之间的一致性,捷径模型引入了递归自一致性约束:两步等效于在中间点再做一次一步更新。这一约束可以写作 。直觉上,如果从 以步长 更新到 ,再从 以步长 更新一次,应该与直接以步长 更新一次得到相同的结果。这一约束被加入到训练目标中,与 Flow Matching 回归项共同优化,使得学到的捷径模型在任意步长下都能保持一致的生成行为。

STP 的轨迹建模与训练

在离线强化学习的语境下,STP 采用了跳跃步(jumping-step)规划范式。设当前环境状态为 ,规划视野内包含 个关键帧,跳跃步长为 ,则规划的目标序列定义为 。这意味着规划器不是在每一个时间步都生成动作序列,而是跳跃式地预测远期状态,在保持长期一致性的同时将规划频率降低到 步一次。

条件捷径轨迹模型以当前状态 为条件,学习从噪声轨迹到目标轨迹的映射。训练目标包含两部分:Flow Matching 项 负责学习基本的轨迹生成能力,确保在零步长(瞬时)条件下预测正确的目标位移;自一致性项 则强制不同步长之间的几何一致性。两项加权求和得到总目标 ,整个训练在单阶段完成,无需任何预训练的教师模型。

动作提取与 Critic 筛选

规划出的状态序列需要转化为可执行的动作。STP 训练了一个基于 stride 的逆动力学模型 ,其输入为相邻关键帧状态对 ,输出为对应的动作 。该模型在离线数据集的转移三元组上以简单的 L2 损失训练,形式简洁且不引入额外的策略约束。

在推理阶段,STP 先生成 条候选轨迹,随后用可行性感知修正的评论家进行排序。评论家 以去噪后的目标轨迹为输入,预测折扣累积回报。为了惩罚不可行的轨迹(如在导航任务中穿越障碍物),论文引入了环境约束惩罚项 ,最终的评分为 ,选择得分最高的候选轨迹执行。这一设计的直觉在于:未经修正的评论家可能对物理上不可行但在视觉上看起来"更优"的轨迹给出高分,而可行性惩罚项提供了一个直接的约束信号来纠正这一偏差。

Warm-start 策略

在推理流程中,STP 还引入了一个关键的工程技巧:除第一步外,后续规划不再从纯噪声开始初始化,而是对前一步的去噪轨迹 加噪后作为起点。具体而言,新规划的初始状态为 ,然后从 开始执行捷径模型去噪至 。这一 warm-start 策略显著提升了时间一致性——前一步规划的轨迹信息被部分保留并注入到新的规划中,避免了两步规划之间可能出现的剧烈跳变,尤其在长视野导航任务中效果显著。

实验与结果

实验在标准 D4RL 基准上覆盖了五个任务域:Gym MuJoCo 运动控制、Maze2D 导航、Kitchen 多阶段操作、AntMaze 高维目标条件控制,以及 Adroit 灵巧操作。对比方法涵盖了扩散规划器(Diffuser、Decision Diffuser)、一致性规划器(CP、CTP)、基于 Actor-Critic 的扩散策略(Diffusion-QL、Consistency-AC)以及多种经典离线 RL 方法。

在采样预算方面,STP 在 AntMaze 仅用 步生成轨迹,而 Diffuser 需要 步、Decision Diffuser 需要 步;即使与同为少步推理的 Diffusion-QL( 步)相比,STP 的步数也更少。候选轨迹数 设为 30,在 AntMaze-Large 等极端场景下有所调整。

核心结果体现在与最直接竞争者 CTP 的对比上。STP 在 Maze2D(平均 183.8 vs 179.3)、Kitchen(83.6 vs 82.85)、AntMaze(85.33 vs 83.33)和 Adroit(114.3 vs 106.9)四个域上均取得了不同程度的提升,而 Locomotion 任务两者基本持平(73.9 vs 73.3)。值得注意的是,STP 的所有提升是在单阶段训练下取得的,这印证了捷径模型作为轨迹生成器的有效性。

消融实验进一步揭示了各个设计决策的贡献。Warm-start 策略在 Maze2D 上带来平均 33.0 分的提升(150.8→183.8),在 AntMaze 上带来 17.3 分的提升(68.0→85.3),说明在前一步轨迹基础上进行局部调整对于长视野任务的执行稳定性至关重要。可行性惩罚在 Maze2D-Large 这一复杂布局上效果尤为显著(181.9→215.1),而在简单环境(如 U-Maze)上的增益有限,这符合"任务越复杂越需要物理可行性过滤"的直觉。

然而,论文也诚实地承认了当前方法的局限。在 Locomotion 任务上,Diffusion-QL(78.9)和 Consistency-AC(78.5)仍然领先于 STP(73.9),这表明在缺乏显式策略优化的纯生成式规划框架下,性能上限仍受到约束。此外,论文未提供训练时间、GPU 消耗或单次规划延迟等量化指标,使得"训练更简单"这一定性论断缺乏数据支撑。

讨论与可借鉴点

STP 的核心贡献在于证明了捷径模型可以作为一种高效且简洁的轨迹生成器,替代蒸馏式一致性模型来完成少步推理任务。这一结论的实践意义在于:单阶段训练不仅降低了工程复杂度,还避免了蒸馏误差的累积,使得规划器对数据质量和分布偏移的鲁棒性有所提升。

从更宽的视角看,STP 的步长条件化设计提供了一种"一个模型、多套推理预算"的范式。通过在训练时让模型接触不同的步长 ,推理时可以根据任务对速度与精度的需求动态选择采样步数——对延迟敏感的场景用 ,对精度要求更高的场景可以适当增加步数。这种灵活性是蒸馏方法难以实现的,因为蒸馏学生模型通常针对特定的教师-学生步数配比进行优化。

然而,这项工作也留下了若干开放问题。首先,可行性惩罚项 依赖于手工定义的物理约束,对于难以显式表征的环境(如高维灵巧操作)尚无通用机制,其可扩展性有待进一步探索。其次,论文未涉及视觉输入或真实机器人实验,所有结论均基于 D4RL 仿真基准,在线迁移和 sim-to-real 的挑战仍然悬而未决。最后,STP 在 Locomotion 上落后于纯策略优化方法的事实提示我们:对于状态空间相对简单、 reward 信号密集的任务,显式的策略改进可能比生成式规划更具优势。

从方法论的角度,STP 中"递归自一致性约束"的设计值得借鉴。这种在训练目标中直接编码多尺度一致性的思路,本质上是在没有显式教师信号的情况下,通过几何约束来实现知识传递。这为那些难以获取有效教师模型、但又希望获得快速推理能力的领域提供了一种可行的替代方案。

摘要

基于扩散的轨迹规划器在离线强化学习中表现强劲,但其迭代去噪过程往往带来较高的推理成本。基于一致性的规划器减少了采样步数,但通常依赖于两阶段的教师-学生蒸馏流程,这增加了训练成本并可能引入不稳定性。我们提出了捷径轨迹规划(STP),一个将捷径模型作为高效轨迹生成器融入其中的基于模型的离线强化学习框架。STP 在单一阶段中训练条件捷径轨迹模型,通过步长条件化支持可调节的单步和少步推理,并使用经过可行性感知修正增强的评论家来选择候选方案。在包括运动、导航、操作和灵巧控制任务在内的标准 D4RL 基准测试中,STP 在简化训练流程的同时实现了强劲性能,可用于快速生成式规划。

Abstract

Diffusion-based trajectory planners have shown strong performance in offline reinforcement learning, but their iterative denoising process often incurs high inference cost. Consistency-based planners reduce the number of sampling steps, yet they typically rely on a two-stage teacher--student distillation pipeline that increases training cost and may introduce instability. We propose Shortcut Trajectory Planning (STP), an offline model-based reinforcement learning framework that incorporates shortcut models as efficient trajectory generators. STP trains a conditional shortcut trajectory model in a single stage, supports adjustable one-step and few-step inference through step-size conditioning, and selects candidate plans using a critic augmented with feasibility-aware correction. Across standard D4RL benchmarks, including locomotion, navigation, manipulation, and dexterous control tasks, STP achieves strong performance while simplifying the training pipeline for fast generative planning.


论文详细总结(自动生成)

论文总结:Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

1. 核心问题与整体含义

  • 研究背景:基于扩散模型的轨迹规划器(如 Diffuser、Decision Diffuser)在离线强化学习中表现优异,但其迭代去噪过程需要数十步采样,导致推理延迟较高,难以满足实时/高频控制需求。
  • 已有方案的局限:一致性规划器(CP、CTP)通过一致性模型将多步去噪压缩到少量步骤,显著降低推理成本,但必须先训练一个 EDM 教师扩散模型,再蒸馏到学生一致性模型,依赖两阶段师生蒸馏流程,带来两个核心问题:
  • 训练成本翻倍:需要依次完成教师训练与学生蒸馏;
  • 稳定性下降:最终规划器质量同时依赖教师训练成功与蒸馏过程成功,对离线 RL 中常见的多模态轨迹分布与分布偏移问题尤为不利。
  • 本文目标:在不牺牲规划性能的前提下,用单阶段、可调步数的捷径模型(Shortcut Model)替代蒸馏式一致性生成器,构造一个更简洁、更稳定的离线模型化 RL 规划框架。

2. 方法论

2.1 捷径模型基础(Shortcut Models)

  • 建立在 Flow Matching 框架上,学习连续速度场将噪声沿线性插值路径运输到数据分布:
  • 传统 Flow Matching 在采样时需要数值积分(),步数 过少会引入大的离散化误差。
  • Shortcut 模型的关键设计:网络同时以步长 为条件,直接学习有限步更新:
  • 通过递归自一致性约束保证不同步长之间的一致性:
  • 训练目标同时包含 Flow Matching 项与自一致性项:

2.2 STP(Shortcut Trajectory Planning)框架

  • 轨迹表示:采用跳跃步(jumping-step)规划,用当前状态 条件化生成未来状态序列

其中 为规划视野, 为跳跃步长,覆盖 个环境步。

  • 单阶段捷径轨迹模型 :以当前状态为条件,预测有限步增量:
  • 训练目标(无需任何教师模型):
  • Stride-based 逆动力学模型 ,在数据 上训练,恢复可执行动作:
  • 评论家 :以去噪轨迹为输入,预测折扣累积回报 ,训练目标:

2.3 推理流程

  • 采样:给定当前状态 ,设置 为 shortcut 步数),迭代执行 ,直至
  • Warm-start 策略:除第一步外,后续环境步不再从纯噪声重新采样,而是对前一步去噪轨迹 加噪后用作初始化:

然后从 出发采样至 ,提升时间一致性与执行平滑度。

  • 可行性修正的选择规则

其中 是对违反环境约束(如穿越障碍物)的惩罚;最优候选为

  • 动作提取,随后环境执行并在新状态下重新规划(Algorithm 1)。

3. 实验设计

  • 基准:标准 D4RL 离线 RL 基准(Fu et al., 2020),覆盖四类任务:
  • Gym MuJoCo 运动控制:HalfCheetah、Hopper、Walker2d 的 medium / medium-replay 数据集;
  • Maze2D 长视野稀疏奖励导航:U-Maze、Medium、Large;
  • Kitchen 多阶段组合操作:Mixed、Partial;
  • AntMaze 高维目标条件控制:Medium/Large × Diverse/Play;
  • Adroit 灵巧操作(expert 数据集):Door、Hammer、Pen、Relocate。
  • 评估协议:报告 150 个独立规划种子的平均标准化 D4RL 回报(normalized return)。
  • 对比方法
  • 扩散规划器:Diffuser(Janner et al., 2022)、Decision Diffuser(DD, Ajay et al., 2023);
  • 一致性规划器:Consistency Planning (CP)、Consistency Trajectory Planning (CTP);
  • 基于 Actor-Critic 的扩散策略:Diffusion-QL (D-QL)、Consistency-AC (C-AC);
  • 经典离线 RL 方法:MPPI、CQL、IQL、BCQ、BC、LEQ、AlignIQL;
  • 蒸馏加速方法:Reward-Aware Consistency Trajectory Distillation (RACTD)。
  • 采样预算对比:STP 在 AntMaze 用 步,其他任务用 步;Diffuser 用 ,DD 用 ,D-QL 用 ;候选轨迹数 (AntMaze-Large 除外),CP/CTP 用
  • 网络结构:基于 Diffusion Transformer (DiT) + adaLN-Zero 的 backbone;评论家与逆动力学模型沿用 CTP 的设置。

4. 资源与算力

  • 论文正文与附录均未明确说明所使用 GPU 型号、数量、训练时长或总算力消耗。
  • 附录仅给出训练超参(使用 Adam 优化器)、采样步数与候选数量等设置,未涉及硬件或 wall-clock 训练时间。
  • 这使得与其他方法的训练成本对比缺乏一手数据支撑,只能在论文结论层面定性地宣称"单阶段训练简化了流程"。

5. 实验数量与充分性

  • 主实验:5 张主表,覆盖 6 个 Locomotion 数据集、3 个 Maze2D、2 个 Kitchen、4 个 AntMaze、4 个 Adroit 任务,共 19 个独立数据集/任务,与 Diffusion-QL、CTP、CP、C-AC、Diffuser、DD、RACTD、IQL、CQL、AlignIQL、LEQ 等 10 余种基线进行比较。
  • 消融实验
  • Warm-start 在 Maze2D(3 个任务)与 AntMaze(4 个任务)共 7 组对照;
  • Feasibility penalty 在 Maze2D(3 个任务)共 3 组对照;
  • 总计 10 组受控消融,验证两个关键推理设计的影响。
  • 定性分析:在 Maze2D-Large 上提供了有/无可行性惩罚的轨迹可视化对比。
  • 充分性评估
  • 任务域多样,跨越运动控制、长视野导航、稀疏奖励、组合操作与高维灵巧控制,跨任务的一致性能增益具有较强说服力;
  • 所有表均给出多 seed 的均值 ± 标准差;
  • 多数 baseline 结果直接引用先前文献,统一在同一评估协议下(按 150 seed 取平均),保持对比公平;
  • 但 STP 与 CTP 的比较严格控制了 horizon、stride、网络架构、评论家与逆动力学模型,使得差异主要归因于"轨迹生成器",这一点在附录中有显式说明。

6. 主要结论与发现

  • 总体性能:在 Maze2D(183.8 vs CTP 179.3)、Kitchen(83.6 vs 82.85)、AntMaze(85.33 vs 83.33)以及 Adroit(114.3 vs 106.9)四个域上,STP 的平均得分均优于 CTP;Locomotion 上小幅领先(73.9 vs 73.3)。
  • 单阶段训练的优势:用单阶段捷径模型替代师生蒸馏链后,规划性能并未下降,验证了 shortcut 模型作为轨迹生成器的有效性。
  • 关键发现 1 — Warm-start 的必要性:在 Maze2D 平均提升 33.0 分(150.8→183.8),在 AntMaze 平均提升 17.3 分(68.0→85.3),证明复用前一步轨迹对长视野任务的执行稳定性极为关键。
  • 关键发现 2 — 可行性修正在复杂环境中的价值:在 Maze2D-Large 上得分由 181.9 跃升至 215.1,复杂布局下不可行轨迹被 critic 误打分的影响更显著;在较简单的 U-Maze、Medium 上增益有限,符合"任务越复杂越需要物理可行性过滤"的直觉。
  • 结论:捷径模型提供了一种"单阶段训练 + 灵活步数推理 + 稳定规划"的实用替代方案,是离线 RL 中快速生成式规划的一种有效方向。

7. 优点

  • 方法简洁性:用单个 shortcut 网络替代 EDM 教师 + 一致性学生的两阶段管线,避免了误差累积与训练不稳定问题。
  • 推理可调:通过步长条件化 即可在一步、少步、多步之间切换,无需重训模型,适配不同任务的速度/精度权衡。
  • 完备的离线 RL 协议:完整包含 warm-start、可行性修正、critic 排序、逆动力学动作恢复等组件,形成可端到端运行的规划-执行闭环。
  • 广泛的实验覆盖:跨越 5 类任务域、19 个数据集、10+ 基线,跨域一致性增益显著。
  • 受控的对照设计:与 CTP 的对比严格控制 horizon、stride、backbone 与辅助模型,使结论可归因到轨迹生成器本身。
  • 消融充分:对两个关键推理模块分别进行多任务消融,并附可视化佐证可行性惩罚的效果。

8. 不足与局限

  • 算力与训练成本缺失:未报告 GPU 型号/数量、训练小时数、显存占用、每次规划延迟等客观指标,"训练更简单"目前仅是定性论断,缺乏量化对比。
  • 与强基线的差距:Locomotion 上 Diffusion-QL 与 Consistency-AC 仍占优(平均 78.9 与 78.5 vs STP 73.9),说明在缺乏显式 value-based policy optimization 的纯生成式规划框架下,性能上限仍受限。
  • 采样步数选择:在 Maze2D-Large 与 Locomotion 中使用不同 (3 步 vs 2 步),附录承认简单环境可用更少步数(Walker2d、Hopper 用 ,AntMaze-Medium 用 即接近饱和),但主表采用统一 ,未系统报告步数-性能曲线。
  • 可行性惩罚的局限:依赖手工定义的环境约束(如 maze 中的墙体),对于难以显式表征物理可行性的复杂高维环境(如 Adroit)尚无通用机制,可能限制其可扩展性。
  • 可解释性与失败模式分析较少:论文未深入分析 STP 在 Locomotion 上落后 Diffusion-QL 的原因(如模式坍缩、critic 偏差等)。
  • 未涵盖视觉控制/真实机器人:所有实验均在 D4RL 仿真基准上,未在高维观测或真实硬件上验证,在线迁移与 sim-to-real 仍是开放问题。
  • warm-start 中间噪声水平 为经验选取:缺乏对这两个超参数的敏感性分析。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记