用于强化学习的阶段转换稠密奖励建模
Stage-Transition Dense Reward Modeling for Reinforcement Learning
📝 TLDR
长horizon机器人操作任务中,稀疏奖励难以为RL提供有效引导,而人工设计密集奖励代价高且对环境敏感。提出STDR视觉奖励学习框架,从无结构专家视频中推断任务阶段结构,训练时同时给出阶段转换与阶段内进度两类学习信号,并引入OOD检测与抓取调节模块增强鲁棒性、防止reward hacking。在14个跨平台操作任务上一致提升样本效率与成功率,多项任务达到或超越人工密集奖励,真机测试验证了奖励分配的稳定性与校准性。
🧭 速览
长horizon机器人操作任务中稀疏奖励难以为RL提供有效引导,人工设计密集奖励代价高且对环境与物体配置变化敏感脆弱。
STDR从专家视频推断任务阶段结构,训练时提供阶段转换反馈与阶段内进度反馈两类信号,并集成OOD检测与抓取调节模块以防reward hacking。
在MetaWorld、ManiSkill、Franka Kitchen共14个操作任务上提升样本效率与成功率,多个任务达到或超过人工密集奖励水平,真机实验也验证稳定性。
STDR为长horizon操作任务提供可从视频学习、逻辑可解释且抗reward hacking的密集奖励方案,具身部署可行。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
STDR(Stage-Transition Dense Reward)提出从无结构的专家视频中自动推断任务的功能性阶段结构,并同时提供阶段转换反馈与阶段内进度反馈两类互补的稠密奖励信号,在14个跨平台机器人操作任务上显著超越基于视觉距离的基线方法,在多项高难度任务上达到或接近人工设计稠密奖励的效果,真机实验验证了其奖励分配的稳定性与校准性。
研究背景与动机
长视野机器人操作任务中的[[稀疏奖励]]问题长期困扰着[[强化学习]]在机器人领域的落地应用。在传统设置下,智能体仅在任务完全成功时获得二值奖励反馈,这意味着在达到最终目标之前的所有中间探索都得不到任何有意义的信号引导。以“将方块插入目标孔”这一看似简单的任务为例,智能体需要依次完成接近物体、视觉定位、执行抓取、移动到目标区域、精确对准以及放置等一系列子目标,而稀疏奖励只能告诉智能体“你成功了”或“你失败了”,至于“距离目标还有多远”“当前抓取是否稳固”“是否需要调整姿势”等关键信息一概缺失。这导致策略在前期几乎处于随机摸索状态,样本效率极低。
人工设计[[稠密奖励]](reward shaping)虽然能缓解这一问题,但代价高昂且极度脆弱。每设计一个任务的稠密奖励都需要领域专家深入理解任务逻辑,而当环境布局、物体形状或目标位置发生微小变化时,原本精心设计的奖励函数可能完全失效甚至产生误导性梯度。这种缺乏可扩展性的特点使得人工稠密奖励难以成为通用解决方案。
近年来,基于视频的奖励学习方法尝试从专家演示中自动学习奖励信号,但现有方法往往停留在“视觉相似度”层面,忽视了任务本身的语义结构。一个视觉上相似的状态在语义上可能对应完全不同的任务阶段(例如“接近目标”和“绕过障碍”可能呈现相似的运动轨迹),仅依赖像素级相似度会导致奖励信号的错位。
STDR的切入点是:长视野操作任务天然具有“功能性阶段序列”的结构——无论环境如何变化,“接近-抓取-移动-放置”这一基本逻辑链始终存在。论文的核心假设是,只要从专家视频中准确识别出这种阶段结构,就能将稀疏的终态奖励分解为层次化的稠密信号,既保证全局目标导向,又提供细粒度的过程引导。
方法
STDR的核心设计围绕一个关键洞察展开:长视野任务可以建模为“功能性阶段序列”,而有效的稠密奖励需要同时满足两个条件——阶段间单调性(确保目标导向)和阶段内连续性(提供稠密梯度)。基于此,方法采用离线-在线两阶段架构。
离线预训练阶段的核心任务是从专家视频中蒸馏出任务的结构化表征。首先利用视觉语言模型(VLM)对每条专家视频进行时间分割,将视频划分为个功能段(例如接近、抓取、移动、放置),输出每个阶段的起止帧索引。由于单次VLM调用可能存在边界模糊问题,系统对多条参考视频的分割结果进行mode或trimmed-mean聚合,以提高伪标签的鲁棒性。
基于这些伪标签,训练两个关键组件。阶段判别器(Stage Discriminator)以长度为的滑动观察窗口作为输入,通过LSTM编码时间依赖性,预测当前所处的阶段索引。为防止分布外(OOD)状态产生虚假奖励跃迁,判别器集成了VAE进行重建误差检测——当重建误差超过阈值时,强制将阶段索引重置为0。阶段奖励定义为 ,保证跨阶段转移时的单调递增特性。
阶段内进度估计器(Intra-stage Progress Estimator)则提供细粒度的局部信号。该估计器以ResNet为视觉主干,通过FiLM(Feature-wise Linear Modulation)机制以阶段嵌入为条件进行仿射调制,使同一视觉流在不同阶段自适应关注相关特征。训练损失包含四个分量:回归损失 用阶段内局部时间目标监督;成对排序损失 强制同轨迹时间靠后的帧具有更高进度值,保证时间方向性;等渗正则 惩罚连续帧之间的进度下降;一致性损失 对强/弱增强的同一帧输出保持一致。
此外,系统还集成了抓取调节模块(Grasping Regulation)——一个基于MLP的视觉验证门。在机器人操作中,“是否成功抓取”是一个关键里程碑,若在抓取尚未稳固时就允许阶段推进,往往导致后续操作失败并引发reward hacking。该模块通过视觉验证确保只有在判定“稳定抓握”状态后,才允许阶段从抓取阶段推进到后续移动/放置阶段。
在线训练阶段则将预训练好的奖励模型冻结,仅用于推理奖励。系统维护阶段级专家检索库,采用Mahalanobis距离进行OOD检测,计算自适应融合门 调节进度估计与最近邻回退之间的权重。当状态远离专家分布时,系统回退到保守的最近邻估计而非高置信度的回归预测,避免OOD状态下的奖励作弊。最终奖励函数为:
这一设计确保了全局激励景观在阶段层面单调递增( 随阶段推进只增不减)、在阶段内连续稠密( 提供细粒度梯度)的双层结构。
实验与结果
实验在三大仿真平台上进行:MetaWorld(8个任务,验证随机初始位姿下的空间适应性)、ManiSkill(3个任务,验证高精度物理仿真中的细粒度控制)、Franka Kitchen(3个任务,验证杂乱背景与多关节约束下的时序阶段识别)。每任务使用30条专家演示,策略优化统一采用PPO算法。
对比基线涵盖多个层次:Sparse(环境原始稀疏奖励)、Human-Dense(基于真值的人工稠密奖励,代表理论上界)、VIP(基于视觉表征距离的奖励)、LIV(基于语言-图像跨模态相似度的奖励)。此外,在ManiSkill上还与使用相同演示数据的Diffusion Policy进行公平对比。
实验结果呈现清晰的层次分化。在所有14个任务上,STDR稳定优于VIP和LIV;在ManiSkill的高精度任务(如Peg-Insertion)上,LIV/VIP/Sparse几乎无法取得任何进展,而STDR仍保持稳定收敛,验证了阶段分解对细粒度控制的关键作用。在Pick-Place、Stick-Push等困难任务上,STDR达到或超过了Human-Dense上界。最引人注目的是数据效率对比:在PullCube任务上,STDR达到0.959的成功率,而Diffusion Policy仅为0.120——二者在相同的30条演示数据下,性能差距接近一个数量级。
消融实验进一步揭示了层次化设计的必要性。Stage-Only版本因缺乏细粒度引导而收敛缓慢、方差较大;Progress-Only版本虽然能快速探索,但由于缺乏逻辑约束,最终成功率受限;只有两者协同才能兼顾逻辑正确性与稠密引导效果。抓取调节模块的消融实验同样表明,移除该模块后,Pick-Place任务的奖励作弊现象明显增多,成功率显著下降。
真机验证在Franka机械臂上进行。实验设计了一个精心构造的测试场景:分别采集成功执行视频与多种失败视频(如物体掉落、中途卡滞)。结果显示,在成功轨迹上,STDR的奖励曲线呈稳定单调递增;而在失败轨迹上,奖励被恰当压低到接近零的水平。相比之下,基线方法(如VIP)在物体意外掉落时仍可能给出正奖励,暴露了缺乏语义理解的风险。
讨论与可借鉴点
STDR最值得借鉴的设计原则是将“全局单调性”与“局部稠密性”显式解耦,形成层次化、可解释的奖励景观。这一思想具有跨任务的通用性:任何长视野任务都可以分解为阶段序列,而阶段间/阶段内的不同优化目标天然适合用层次化结构处理。此外,离线-在线解耦的架构设计也值得关注——视觉语言模型仅用于离线生成伪标签,训练全程不依赖大模型在线调用,既保证了部署效率,又规避了大模型输出不稳定带来的训练风险。
然而,论文的局限性同样明显。首先,方法完全依赖视觉观察,未融合本体感知与触觉反馈,这对需要精细物理交互的任务(如柔性物体操作)可能存在感知瓶颈。其次,阶段序列假设较为刚性,仅适用于阶段顺序基本固定的任务,对可交换或条件分支的场景不适用。再次,真机实验的统计强度有限(仅5条评估视频),不足以支撑“完全真机稳定”的强结论。最后,超参数(阶段数、OOD阈值等)对不同任务的敏感性未被系统分析,这影响了方法的可复现性。
未来方向可以包括:引入多模态感知扩展输入模态、将固定阶段序列扩展为可学习的有向无环图以处理条件分支、探索VLM在零样本阶段分割中的潜力,以及建立更严格的统计评估框架。
摘要
面向长时序机器人操作的强化学习常常受限于稀疏且延迟的奖励信号,而人工设计稠密塑形奖励既代价高昂,又对环境和物体配置的变化十分脆弱。本工作提出阶段转换稠密奖励(Stage-Transition Dense Reward, STDR),一种视觉奖励学习框架,能够将非结构化的专家视频转化为逻辑上合理、可用于从零训练强化学习智能体的稠密奖励。STDR 利用语义理解从演示中推断任务的阶段结构,并在在线训练过程中提供两个互补的学习信号:(i) 阶段转换反馈,提供目标导向的奖励;(ii) 阶段内进度反馈,为完成每个阶段提供细粒度的引导。此外,还集成了分布外(OOD)检测机制和抓取调节模块,以增强鲁棒性并防止奖励作弊。在涵盖 MetaWorld、ManiSkill 和 Franka Kitchen 的 14 项操作任务上的实验表明,STDR 在样本效率和成功率上均稳定优于多个基线方法,并在若干具有挑战性的任务上达到或超过了人工设计的稠密奖励。真实机器人的进一步评估显示,STDR 在成功执行过程中能分配稳定且与进度对齐的奖励,而在失败情况下则给出恰当的低奖励,表明其对视觉噪声具有鲁棒性,并在不同场景下能给出更合理校准的奖励分配。
Abstract
Reinforcement learning for long-horizon robotic manipulation is often limited by sparse and delayed rewards, while manually designing dense shaping signals is costly and brittle to changes in environments and object configurations. This work proposes Stage-Transition Dense Reward (STDR), a visual reward-learning framework that converts unstructured expert videos into logically grounded dense rewards for training RL agents from scratch. STDR leverages semantic understanding to infer a task's stage structure from demonstrations, and delivers two complementary learning signals during online training: (i) stage-transition feedback that provides goal-directed reward, and (ii) within-stage progress feedback that supplies fine-grained guidance toward completing each stage. Furthermore, an out-of-distribution (OOD) detection mechanism and a grasping regulation module are integrated to enhance robustness and prevent reward hacking. Experiments on 14 manipulation tasks across MetaWorld, ManiSkill, and Franka Kitchen show that STDR consistently improves sample efficiency and success rates over multiple baselines, and matches or surpasses handcrafted dense rewards on several challenging tasks. Real-robot evaluations further indicate that STDR assigns stable, progress-aligned rewards on successful executions while producing appropriately low rewards for failures, suggesting robustness to visual noise and better-calibrated reward assignment across settings.
论文详细总结(自动生成)
论文总结:Stage-Transition Dense Reward Modeling for Reinforcement Learning
一、核心问题与研究动机
长视野(long-horizon)机器人操作任务的强化学习面临两个核心瓶颈:
- 稀疏奖励困境:传统 RL 环境往往仅在任务完全成功时返回一次性二值奖励,难以驱动策略有效探索,导致样本效率极低、交互开销巨大。
- 人工稠密奖励的脆弱性:人工设计稠密塑形奖励(reward shaping)虽然能缓解稀疏问题,但代价高昂、任务专属,且对环境扰动和物体配置的微小变化极为敏感,缺乏可扩展性。
论文的核心问题是:能否从非结构化的专家视频中自动学习具有逻辑结构的稠密奖励,从而摆脱对手工奖励工程的依赖,并在长视野任务上达到或超越人工稠密奖励的效果?
二、方法论概述
2.1 整体思路
STDR 将长视野任务视为"功能性阶段序列"(如接近、抓取、插入、移动、放置),并提供两层互补奖励信号:
- 阶段转换反馈(Stage-Transition Feedback):粗粒度的、跨视野的、单调的目标导向信号。
- 阶段内进度反馈(Within-Stage Progress Feedback):细粒度的局部稠密梯度信号。
整体框架分为离线预训练(从专家视频蒸馏结构化监督)和在线 RL 训练(冻结奖励模型,从零训练 PPO 策略)两阶段。
2.2 关键模块与技术细节
(1) 基于 VLM 的阶段分割
利用 Qwen3 VLM 对每条专家视频 进行时间分割,输出 JSON 形式的阶段边界(start frame, end frame),将视频划分为 个功能段,每帧被赋予伪标签 。为降低对单次 VLM 调用的敏感性,对多条参考视频做 K 值的 mode/trimmed-mean 聚合。
(2) Stage Discriminator(阶段判别器)
- 输入为长度 的滑动观察窗口 。
- 使用 LSTM 编码时间依赖,预测当前阶段索引 。
- 集成 VAE 进行 OOD 检测:若重建误差超过阈值 ,则强制将 ,抑制 OOD 状态下的虚假奖励跃迁。
- 训练时加入 5 条随机策略 rollout 作为负样本,以拉远专家与非专家分布。
阶段奖励定义为:
(3) Grasping Regulation(抓取调节模块)
基于 MLP 的视觉验证门:当且仅当模块判定当前为"稳定抓握"状态时,阶段索引 才允许从抓取阶段推进到后续阶段(如移动、放置)。
(4) Intra-stage Progress Estimator(阶段内进度估计器)
- 视觉主干为 ResNet,通过 FiLM(Feature-wise Linear Modulation)以阶段嵌入 进行仿射调制,使同一视觉流在不同阶段自适应关注相关线索:
- 总损失为四个分量的加权组合:
- 回归损失 :用阶段内局部时间目标 监督。
- 成对排序损失 :在同轨迹上 时强制 ,保证时间方向性。
- 等渗正则 :惩罚连续帧之间的进度下降,鼓励单调性。
- 一致性损失 :对强/弱增广的同一帧输出一致化。
- 应用 Video Rewind(来自 ReWiND)增强对失败状态的判别能力。
(5) OOD-Aware Progress Fusion
维护阶段级专家检索库,采用 Mahalanobis 距离 计算自适应融合门 :
该机制在远离专家分布时回退到保守的最近邻估计,避免奖励作弊。
阶段内奖励为:
(6) 总奖励
此设计保证了全局激励景观在阶段层面单调、在阶段内连续稠密的双层结构。
三、实验设计
3.1 仿真 Benchmark
| 平台 | 任务数 | 特点 |
|---|---|---|
| MetaWorld | 8 | 随机初始位姿下的空间适应性 |
| ManiSkill | 3 | 高精度物理仿真,细粒度引导验证 |
| Franka Kitchen | 3 | 杂乱背景 + 多关节约束,验证时序阶段识别 |
共 14 个长视野操作任务,每任务 30 条专家演示。策略优化统一使用 PPO(MetaWorld、Franka Kitchen 用 Stable Baselines3;ManiSkill 用官方实现)。
3.2 基线方法
1. Sparse (Official):环境原始稀疏奖励。
2. Human-Dense:基于真值的官方/自写稠密奖励(如 MetaWorld、ManiSkill 的官方函数,Franka Kitchen 自定义)。
3. VIP:基于价值隐式预训练的视觉表征距离奖励。
4. LIV:基于语言-图像跨模态相似度的奖励。
3.3 数据效率对比
在 ManiSkill 上,与纯离线模仿学习 Diffusion Policy (DP) 进行公平对比(DP 使用完全相同的 30 条演示)。STDR 在数据利用率上远超 DP 与 LIV/VIP。
3.4 真机评估
Franka 机械臂 + Intel RealSense 相机,每任务采集 15 条成功视频(10 训练 + 5 评估)+ 多条失败视频。对 VIP/LIV 进行 TCL 微调以保证公平。
四、资源与算力
- 论文未明确披露具体 GPU 型号、数量、单任务训练时长等算力细节。
- 仅提及视觉编码器采用预训练 ResNet,策略优化使用 PPO。
- 所有 14 个仿真任务使用统一超参(、、 等),以体现框架的鲁棒性,但缺少算力透明度,限制了对复现成本与可扩展性的判断。
五、实验数量与充分性
5.1 实验规模
- 14 个仿真任务(跨三大平台,覆盖随机化初始、高精度控制、杂乱场景)。
- 4 组基线对比(Sparse、Human-Dense、VIP、LIV)。
- 1 组 DP 对照(ManiSkill 上离线模仿学习的额外基准)。
- 1 项真机验证(成功 + 失败视频上的奖励曲线分析)。
- 2 组消融实验:
- 层级结构消融(Stage-Only / Progress-Only / Full)。
- 抓取调节消融(Pick-Place、Coffee-Push)。
5.2 客观性评估
优点:
- 多平台、多任务覆盖增强了泛化结论可信度。
- 基线包含"奖励上界"(Human-Dense),提供了较高参照。
- 消融直接针对每个核心组件(Stage Discriminator、Progress Estimator、Grasping Regulation)。
- 真机评估展示了从仿真到真实的迁移能力。
潜在偏倚与不足:
- 每任务仅 30 条演示(真机仅 10 条),未系统演示数据规模敏感性。
- 未对 的选择、超参(、、、)做敏感性扫描。
- 缺少与更多先进基线(如 RWR、ReWiND 本身、T-REX 等)的直接对比。
- 4 个种子的多次运行统计仅以均值曲线呈现,未报告置信区间数值与显著性检验。
- 真机实验样本量很小,仅 5 条评估视频,结论的统计强度受限。
六、主要结论与发现
1. 一致优越性:STDR 在全部 14 个仿真任务上稳定优于 VIP 与 LIV,并在多项高难度任务(如 Pick-Place、Stick-Push)上达到或超过 Human-Dense。
2. 高精度优势:在 ManiSkill 上,LIV/VIP/Sparse 几乎无法取得进展,STDR 仍保持稳定收敛,验证了阶段分解对细粒度控制的关键作用。
3. 数据效率:在相同演示数据下,STDR 显著优于 Diffusion Policy(在 PullCube 上 0.959 vs 0.120)。
4. 真机鲁棒性:在物理平台上:
- 成功视频中,奖励曲线呈稳定单调递增;
- 失败视频中,奖励恰当压低(基线方法在物体掉落时仍给出正奖励)。
5. 消融结论:Stage-Only 收敛慢、方差大;Progress-Only 最终成功率低;只有两个组件协同才能保证逻辑正确与稠密引导。
七、方法与实验设计的优点
- 奖励结构化原则明确:将"全局单调"与"局部稠密"显式解耦,形成可解释的层次化奖励景观。
- 充分的安全机制:VAE + Mahalanobis 双重 OOD 检测 + 抓取验证门,从多个维度防御 reward hacking。
- 离线-在线解耦干净:VLM 仅用于离线伪标签生成,奖励推理全程在线闭环,无需调用大模型。
- 视觉-only 的强基线:仅依赖像素输入,却能匹配甚至超越利用真值的稠密奖励。
- 跨域迁移实证:真机验证 + 失败视频分析增强了实际部署说服力。
八、不足与局限
1. 输入模态单一:完全依赖视觉观察,未融合本体感知(proprioception)与触觉反馈,对需要精细接触感知的任务存在瓶颈。
2. 阶段序列假设刚性:仅适合阶段顺序基本固定的任务,对阶段可交换或条件分支的任务不适用。
3. 算力与统计透明度不足:缺乏 GPU 型号、训练时长、单任务环境步数及种子统计指标(如均值±标准差数值表)。
4. 超参与演示规模敏感性未系统化: 系数组、、OOD 阈值对不同任务的鲁棒性未深入分析。
5. 真机样本量有限:仅 5 条评估视频 + 1–2 个任务,覆盖度不足以支撑"真机稳定"的全称命题。
6. 基线选择偏窄:缺少与 RWR、ReWiND、T-REX 等直接视频奖励学习方法的对比,可能低估同类型方法的竞争表现。
7. VLM 伪标签噪声影响未量化:阶段边界轻微偏差对下游训练的具体影响缺乏定量分析。
8. 整体奖励接近 1.0 时稠密度下降**:阶段奖励为离散 ,可能造成阶段切换瞬间梯度的不连续性。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




