以少学多:基于事后回溯的强化学习
Learning More from Less: Reinforcement Learning from Hindsight
📝 TLDR
VLA模型通过强化学习后训练时,每次更新都依赖昂贵的机器人轨迹,样本效率是核心瓶颈。稀疏奖励下早期策略几乎全部失败,但失败轨迹可能恰好完成其他任务。本文提出LfH方法,由单一视觉语言模型对失败轨迹批量提出后视指令并打分其完成度,重标记后的轨迹与原始轨迹联合训练。在LIBERO-PRO分布外任务上实现5倍样本效率提升,超越稠密进度奖励基线,并在真实Franka机器人上得到验证。
🧭 速览
强化学习后训练VLA模型样本开销巨大,稀疏奖励下早期失败轨迹几乎无可学信号。
用单个VLM对失败轨迹批量重标记指令与奖励并打分,重标记轨迹与原始轨迹联合训练策略。
LIBERO-PRO分布外任务样本效率提升5倍,超越稠密进度奖励基线,跨VLA骨架与Franka机器人验证。
后视重标记为VLA的RL后训练提供了高样本效率的失败轨迹利用方案。
📊 论文图表(共 26 张)
展开查看 26 张图
TL;DR
这篇论文提出了 Learning from Hindsight(LfH)方法,旨在解决视觉-语言-动作(VLA)模型在强化学习后训练中面临的样本效率问题。其核心思路是利用单一视觉-语言模型对失败的机器人轨迹进行事后重标注——不仅改写指令,还重新评估每条轨迹对"如果当初任务是X会怎样"的完成度。通过将失败轨迹转化为隐含成功样本,LfH 在 LIBERO-PRO 分布外任务上实现了约 5 倍的样本效率提升,并超越了使用稠密进度奖励的基线方法,同时在真实 Franka 机械臂上验证了效果。
研究背景与动机
在机器人操控领域,将 [[视觉-语言-动作模型]] 后训练以适应新任务已成为标准范式。然而每次策略更新都依赖于物理机器人采集的真实轨迹数据,这些 rollout 采集成本高昂、速度缓慢,使得样本效率成为制约其规模化落地的核心瓶颈。
操控任务通常采用稀疏二元奖励——只有当机器人精确完成指定指令时才获得奖励,否则为零。这种设置在训练初期带来了一个看似无解的困境:弱策略几乎在每次执行中都会失败,由于组内所有 rollout 的奖励方差为零,基于组相对优势估计的强化学习方法(如 GRPO)会将整个 rollout 组丢弃,策略几乎学不到任何东西。
然而,一个关键观察是:这些失败并非真正"毫无价值"。失败轨迹往往完成了其他有意义的子目标或中间状态——例如指令要求"关闭微波炉",执行过程中却成功抓起了杯子。在原始指令下这条轨迹被判为零分,但如果指令是"抓起杯子",它就是一条完美的成功示范。问题在于,如何在不引入额外人工标注的前提下,系统性地挖掘这些隐含的成功信号。
此前的事后经验回放(Hindsight Experience Replay,HER)方法已在经典强化学习(如 FetchPush 任务)中证明了这一思路的可行性。但 VLA 模型的特殊之处在于:其策略和价值函数以自然语言为条件进行泛化,这为通过语言层面的事后重标注提供了独特优势——语言空间提供了丰富的语义空间来描述"轨迹实际做了什么"。
方法
LfH 的核心设计围绕一个简单但关键的假设:失败轨迹中蕴含的监督信号,可以通过语言层面的重新标注来释放。具体而言,论文采用单一大型视觉-语言模型(VLM)同时完成两项任务——对失败 rollout 组提出事后指令(hindsight instruction),并评估组内每条轨迹对该事后指令的满足程度。
方法的执行流程始于对 rollout 组的筛选。给定一组 条轨迹 及其对应原始指令 和奖励 ,系统仅在组均原始奖励低于阈值 (默认为 0.8)时触发事后重标注。这一设计的直觉是:高质量成功轨迹不需要重标注,只有低信号组才需要事后挖掘。
对于满足条件的失败组,LfH 首先均匀采样一条锚点轨迹 ,由 VLM 根据这条轨迹的视频内容生成一条事后指令 。为过滤掉没有实际物体交互的纯噪声轨迹,论文引入了"Nothing"选项——如果 VLM 认为轨迹中没有可描述的有效动作,则重标注被跳过。
随后,对组内所有轨迹在共享的事后指令 下统一打分:。值得注意的是,VLM 被允许输出"unsure"选项以表示不确定性,这种设计有效降低了错误标注的噪声。
在训练阶段,LfH 面临一个关键技术问题:轨迹是按照原始指令 采样的,但优化却要按照事后指令 进行,这两者之间的分布不匹配需要修正。论文借鉴了 Hindsight Policy Gradients 的重要性采样思想,引入了修正比率:
最终的训练目标结合了原始 GRPO 损失与事后 GRPO(H-GRPO)损失,并以后者权重 进行平衡:
其中裁剪阈值 取训练早期 85 分位数的 H-GRPO 损失值,用于防止早期 VLM 噪声过大时产生破坏性梯度。
实验与结果
论文在 LIBERO-PRO 仿真基准和真实 Franka 机械臂两个层面进行了系统验证。
在仿真实验中,LIBERO-PRO 被设计为分布外(OOD)任务——通过任务扰动(task perturbation)保留场景和物体,仅改变指令措辞,从而测试方法在未见指令上的泛化能力。LfH 相比标准 GRPO 实现了约 5 倍样本效率提升:标准 GRPO 需要约 40 步训练才能达到的性能,LfH 仅需约 5 步。更值得关注的是,LfH 还超越了使用 RoboMETER 稠密进度奖励的基线方法,说明"改变任务分配"(即重标注)比"密集化反馈"在这一场景下更为有效。
消融实验进一步揭示了方法的关键组件。移除指令重标注(仅保留奖励重标注)会使性能大幅下降;同样,仅改写指令而不重新评分也无法复现完整 LfH 的增益;注入随机奖励方差(Random-reward 变体)的对比表明,VLM 评分的语义正确性是性能提升的核心来源,而非简单的奖励方差注入。
LfH 的另一显著效果体现在数据利用率上。在 GRPO 框架下,由于大量 rollout 组因零方差被丢弃,只有 20-40% 的轨迹组得以保留用于训练;而 LfH 将这一比例提升至 70-80%,意味着大部分被浪费的失败轨迹被转化为有效的学习信号。
在真实 Franka 机械臂实验中,初始策略在目标任务"put the green container into the bowl"上的成功率为零。经过约 160 条 rollout 的训练后,GRPO 达到 22% 成功率,而 LfH 达到 56%,增益约为 2.5 倍。这一结果验证了方法从仿真到真实的迁移能力,尽管真实实验仅覆盖单一 OOD 任务,其结论的稳健性仍需更多场景验证。
讨论与可借鉴点
LfH 的核心贡献在于揭示了一个此前未被充分利用的监督来源:失败轨迹的语言语义。论文的实验表明,即使事后指令与原始任务在语义上完全无关,它仍然可以作为"对比性 grounding 信号"——帮助策略区分"目标是抓杯子"与"目标是开抽屉"这两种状态,从而缓解 GRPO 在低奖励区域退化为单一失败模式的坍缩问题。
然而,这一方法也存在明显的局限性。首先,VLM 的标注质量直接决定了重标注信号的可靠性——错误的对象名、过于通用的描述或幻觉式判定都会引入难以察觉的噪声,尽管"Nothing"和"unsure"选项提供了一定缓解,但无法根除。其次,当策略崩溃为重复、无信息量的失败时(例如持续抖动或无目的移动),事后指令也无从描述有意义的子目标,形成方法的有效性下限。第三,论文依赖的超大 VLM(235B 参数)在推理延迟和算力成本上构成工程门槛。最后,sim-to-real 实验仅涵盖单一任务,LfH 对真实场景多样性的泛化能力尚需更广泛的验证。
对于 [[强化学习后训练]] 领域的研究者而言,LfH 提供了一个值得借鉴的范式转换思路:与其执着于设计更精细的奖励函数或收集更多数据,不如重新审视"失败"本身——失败轨迹中可能蕴含的监督信号,往往比直觉想象的更丰富。语言作为连接视觉观测与动作空间的桥梁,为这种事后挖掘提供了天然的语义空间。
摘要
强化学习(RL)越来越多地用于对视觉-语言-动作(VLA)模型进行后训练,但每次更新都需要消耗机器人轨迹数据,而这类数据采集缓慢且成本高昂,因此样本效率成为一个核心关注点。操控任务通常只提供稀疏奖励,因此在训练初期,较弱的策略几乎每次轨迹执行都会失败,并且几乎学不到任何东西,即使这些失败执行了连贯的行为。然而,这样的失败在另一个任务上却是一次成功。我们提出了事后学习(Learning from Hindsight, LfH),它通过对失败轨迹按照其实际完成的任务进行评分,将事后经验回放(hindsight relabeling)引入到 VLA 的强化学习后训练中。单个视觉-语言模型同时对指令和奖励进行重新标注,为一组失败轨迹提出一条事后指令,并对其满足程度进行评分,而策略则在重新标注后的轨迹与原始轨迹上进行联合训练。由于 VLA 模型能够在语言层面进行泛化,通过语言进行重新标注使策略能够从相同的轨迹中学到更多。在标准强化学习提升缓慢的分布外 LIBERO-PRO 任务上,LfH 实现了 5 倍的样本效率提升,并优于使用密集进度奖励的基线方法。这些增益在不同的 VLA 骨干网络上以及在真实的 Franka 机器人上均成立。
Abstract
Reinforcement learning (RL) is increasingly used to post-train vision-language-action (VLA) models, but every update consumes robot rollouts that are slow and costly to collect, making sample efficiency a central concern. Manipulation tasks typically provide only sparse rewards, so a weak policy fails almost every rollout early in training and has little to learn from, even when those failures execute coherent behavior. Such a failure, however, is a success at a different task. We present Learning from Hindsight (LfH), which brings hindsight relabeling to RL post-training of VLAs by scoring failed rollouts against the tasks they actually achieved. A single vision-language model relabels both the instruction and the reward, proposing a hindsight instruction for a group of failed rollouts and scoring how well each satisfies it, and the policy trains on the relabeled and original rollouts jointly. Because VLAs generalize across language, relabeling in language lets the policy learn more from the same trajectories. On out-of-distribution LIBERO-PRO tasks, where standard RL improves only slowly, LfH achieves improvement in sample efficiency, and outperforms a dense progress-reward baseline. The gains hold across VLA backbones and on a physical Franka robot.
论文详细总结(自动生成)
论文总结:Learning More from Less: Reinforcement Learning from Hindsight(以少学多:基于事后回溯的强化学习)
1. 核心问题与研究动机
- 背景:强化学习(RL)正成为视觉-语言-动作(VLA)模型后训练的标准工具,但每次策略更新都依赖于物理机器人真实轨迹(rollout),其采集成本高、速度慢,难以规模化,使样本效率成为核心瓶颈。
- 稀疏奖励困境:操控任务普遍采用稀疏二元奖励,仅当机器人完成指定指令时才获得 1,否则为 0。早期弱策略几乎全部失败,整个 rollout 组因方差为零被 GRPO 丢弃,训练陷入"冷启动"。
- 关键观察:大量失败轨迹并非真正的"无意义"失败——它们完成了其他有意义的子任务(如命令"关微波炉"却抓起了杯子)。在原指令下被判为失败,在另一条指令下却是成功示范。
- 研究目标:挖掘失败轨迹的潜在监督信号,提升 VLA 模型 RL 后训练的样本效率,并使失败轨迹成为可重用的训练资源。
2. 方法论:Learning from Hindsight(LfH)
2.1 核心思想
利用单个视觉-语言模型(VLM,Qwen3-VL-235B-A22B-Thinking-FP8)对失败 rollout 组同时进行指令重标注与奖励重标注,将原指令 下零奖励的失败组转化为事后指令 下有监督的成功样本,与原始 GRPO 联合训练。
2.2 算法关键步骤
- 触发条件:仅对组均原始奖励 (默认 )的低信号组启用 hindsight relabeling,高奖励组保留标准 GRPO 信号。
- 指令重标注:从失败轨迹中均匀采样锚点 ,VLM 基于轨迹视频生成事后指令 ;通过"Nothing"选项过滤无实际物体交互的轨迹。
- 奖励重标注:对组内所有轨迹在共享指令 下统一打分 (含"unsure"选项);保证组内奖励可比较,便于 GRPO 计算优势函数。
2.3 GRPO 目标函数与重要性修正
标准 GRPO 目标为:
其中优势函数在组内归一化:
对 hindsight 组,由于轨迹在原指令 下采样、却在 下优化,采用 Hindsight Policy Gradients 的重要性修正:
hindsight 损失:
整体目标:
其中 为 hindsight 权重, 为防止早期噪声过大而设的损失裁剪阈值(取早期训练 85 分位数)。
2.4 算法流程(Algorithm 1)
对每个采样指令 ,rollout 组 ;若 ,通过 VLM 生成 hindsight 组 并入 ;最后以 更新参数。
3. 实验设计
3.1 数据集与基准
- 仿真基准:LIBERO-PRO(Goal / Object / Spatial / 10 四个 suite),采用任务扰动(task perturbation)构造分布外(OOD)任务,保留场景与物体,仅改变指令(物体、目标状态或动作)。
- 基模型:默认 (RLinf-Pi05-LIBERO-SFT checkpoint);额外验证 GR00T、OpenVLA-OFT。
- 真实场景:Franka FR3 机械臂,含可操作物体、两个抽屉和双层架;10 个 SFT 任务(每任务 20 条 SpaceMouse 演示);fine-tune 任务为"put the green container into the bowl"(初始策略成功率 0)。
3.2 对比方法
- 标准 GRPO:使用环境稀疏二元奖励。
- GRPO + RoboMETER:使用 RoboMETER 提供的稠密进度奖励。
- 消融变体:Rephrase-only(仅改写指令)、Reward-only(仅奖励重标注)、Random-reward(注入随机奖励方差)。
3.3 评估指标
- Gain = :相对初始策略的成功率提升倍数。
- 评估每次用 480 条 rollout;仿真实验使用 4 个随机种子;真实场景采用人工二元奖励。
4. 资源与算力
- 算力信息:论文未明确给出 GPU 型号、数量、训练时长等算力细节。
- 模型规模:VLM 标注器为 Qwen3-VL-235B-A22B-Thinking-FP8;仿真并行 64 环境;真实场景 32 训练环境 + 32 评估环境;batch size = 512,micro batch = 32。
- 训练规模:仿真 40 步()/ 60 步(OpenVLA-OFT)/ 200 步(GR00T);真实场景约 160 条 rollout。
5. 实验数量与充分性
- 仿真实验:覆盖 4 个 LIBERO-PRO suite × 多个扰动 × 4 随机种子,对比 3 类基线方法。
- 消融实验:
1. Rephrase-only / Reward-only / Random-reward 与完整 LfH 对比;
2. 组选择策略(阈值 0.8 vs 随机选 70% vs 全选)以及阈值扫描(0.1 / 0.5 / 0.8);
3. 更新轮次(ue = 2/3/4)对比 GRPO 与 PPO;
4. rollout 采样噪声水平(0.1/0.3/0.5/0.7/1.2);
5. VLM prompt 三要素消融(场景物体列表 / "Nothing" 选项 / "unsure" 选项);
6. 位置扰动 OOD(与指令扰动对比);
7. 跨 VLA 骨干网络泛化(、GR00T、OpenVLA-OFT)。
- 真实实验:Franka 单一 OOD 任务,对比 GRPO 与 GRPO+LfH。
- 充分性评价:消融体系较为系统,覆盖了方法关键组件、组选择策略、prompt 工程、数据多样性、跨骨架迁移与 sim-to-real,论证较为充分;但真实实验任务数量较少(仅 1 个),sim-to-real 结论的稳健性受限。
6. 主要结论与发现
- 样本效率提升显著:在 LIBERO-PRO OOD 任务上,LfH 以约 5 步达到标准 GRPO 40 步的性能,约 5× 样本效率提升,并超越 RoboMETER 稠密奖励基线。
- 失败轨迹利用率高:LfH 保留了约 70–80% 的轨迹组,而 GRPO 仅保留 20–40%,说明其将大量被丢弃数据转化为有效训练信号。
- 对比性奖励信号比稠密奖励更关键:仅靠奖励方差(Random)或单一指令改写均不能复现 LfH 增益;指令与奖励的联合重标注才是关键。
- 机制解释:即使 hindsight 指令在语义上与原任务无关,仍可作为"对比性 grounding 信号",帮助策略区分目标指令与无关行为;同时保持行为多样性,避免 GRPO 在 OOD 区域坍缩到单一失败模式。
- 跨 VLA 泛化:在 、GR00T、OpenVLA-OFT 三种骨架上均提升样本效率。
- 真实机器人:在 Franka 上,128 rollouts 时 LfH 约为 GRPO 的 2 倍成功率;160 rollouts 时达到 56%(GRPO 仅 22%)。
7. 优点
- 思路新颖:将 hindsight relabeling 范式从经典 HER 扩展到 VLA-RL 后训练的语言空间重标注,开辟了"失败轨迹的语言层复用"路径。
- 方法简洁:单个 VLM 同时完成指令与奖励重标注,无需训练专用奖励模型;端到端即插即用。
- 工程细致:设计了"Nothing"过滤、"unsure"模糊奖励、损失裁剪、Same-instruction skip 等机制以降低 VLM 噪声影响。
- 实验完整:覆盖多骨干、多 suite、多消融维度,并完成 sim-to-real 验证。
- 效果领先:在稀疏、低成功率冷启动场景下显著超越稠密奖励基线,揭示了"改变任务分配"比"密集化反馈"更有效。
- 行为多样性:相对 GRPO,LfH 维持了更多样化的 rollout 分布,潜在缓解了策略坍缩。
8. 不足与局限
- 依赖 VLM 质量:错误的对象名、过于通用的指令或幻觉式成就判定会引入噪声监督;当前缓解手段(Nothing / unsure)尚不充分。
- 依赖失败质量:当策略崩溃为重复、无信息失败时,几乎无可挖掘的 hindsight 目标。
- 真实实验覆盖有限:仅 1 个 OOD 任务、单一物体集,sim-to-real 泛化结论仍需更多任务验证。
- 算力与可复现性:论文未披露 GPU 型号、训练时长等算力细节,且依赖超大 VLM(235B 参数),工程成本与推理延迟较高。
- 机制解释仍偏推测:论文承认"对比性 grounding 信号"的解释为猜想之一,缺乏更严密的因果分析。
- 指令与目标任务的语义差距:hindsight 指令可能与原任务语义无关,存在训练分布漂移风险,对最终收敛性能上限的影响尚不明确。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

























