arXiv 2607.09866v1 · 发布 2026-07-10

Robo-ValueRL:面向离在线强化学习的可靠价值估计

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

AUTHORS Xia, Wenke, Ren, Pei, Yu, Wenbo, Zhang, Yizhuo, Li, Jifan, Zhang, Yixue, Zhao, Yinuo, Gao, Qingyang, Fu, Jianlong, Tang, Jian, Wen, Ji-Rong, Che, Zhengping, Hu, Di
EVIDENCE 离线到在线RL的可靠价值估计
SCORE 0.9
CATEGORIES TASK rlrobotics
GENERATED 2026-07-20 02:29:20 UTC

📝 TLDR

提出Robo-ValueRL方法,改进从离线到在线强化学习的价值估计可靠性,缓解分布偏移。

🧭 速览

动机

离线到在线强化学习中价值函数可靠性如何塑造策略优化这一核心问题尚未充分探索,制约系统可复现性与诊断

方法

提出Robo-ValueRL统一框架,学习历史条件价值估计器并以全局进度与局部偏好指标评估可靠性,融入质量条件一致性策略预训练与残差适配模块

结果

在240小时离线演示与超3000条在线轨迹实验上证实,下游策略性能与价值可靠性高度相关

结论

可靠价值函数提供更优动作质量评估,使价值引导离线RL优于质量无关行为克隆,并通过优先利用高质量在线数据稳定策略提升

📊 论文图表(共 12 张)

展开查看 12 张图

TL;DR

Robo-ValueRL 针对离线到在线强化学习流程中价值估计可靠性不足的问题,提出了一个统一框架。该方法通过学习以历史为条件的价值估计器,并借助全局进度与局部偏好两类指标评估其可靠性,从而在策略预训练与在线改进两个阶段实现价值引导的数据利用。实验表明下游性能与价值可靠性高度相关:在毫米级精度的芯片插装任务上达到 86% 成功率,在可泛化的积木拆卸任务上达到 84% 成功率。

研究背景与动机

离线到在线强化学习是近年来机器人操作领域备受关注的研究范式,其核心思想是先利用大量离线示教数据进行策略预训练,再通过在线交互持续改进策略。这种范式兼具离线学习的样本效率与在线学习的适应性,尤其适用于需要从异构数据中学习的真实机器人任务。然而,该方向的一个关键挑战长期被忽视:价值函数在整个流程中究竟扮演了什么角色,以及其可靠性如何系统性地影响最终的策略表现。

在离线到在线强化学习的全流程中,数据来源呈现显著异质性。离线阶段的数据可能来自人类演示、远程操控或历史任务记录,数据的质量、分布密度和任务覆盖范围参差不齐。进入在线阶段后,智能体与环境交互产生的新数据又与离线数据存在分布差异。这种异构数据的有效利用需要某种机制来区分样本质量、引导策略改进方向,而价值函数正是承担这一角色的候选者。

但价值估计本身面临严峻挑战。离线数据中的回报信息往往稀疏或带有噪声,而在线交互中价值估计又需要应对由策略更新带来的分布偏移问题。已有研究大多将价值估计视为辅助工具或作为算法设计的副产品,缺乏对「价值可靠性如何塑造策略优化」这一核心问题的系统追问。正是这一研究空白,促使作者提出 Robo-ValueRL,旨在建立价值可靠性与下游策略性能之间的可量化关联。

方法

Robo-ValueRL 的设计围绕一个核心洞察:价值函数的可靠性不仅是算法性能的隐式影响因素,更应该被显式建模、追踪和利用。这一洞察催生了三个关键设计决策。

第一,学习以历史为条件的价值估计器。传统的价值函数通常只考虑当前状态和动作,而 Robo-ValueRL 让价值估计器 conditioning 在完整的历史轨迹信息上。这一设计的直觉在于,单一状态-动作对往往不足以判断某个决策的长期收益,而结合历史上下文能够更准确地从离线示教中提取动作的质量信号。具体而言,价值网络 接收当前状态 与历史轨迹 作为输入,输出对累计回报的估计。历史信息的引入使得价值估计器能够区分「幸运的状态」与「真正好的动作选择」,从而在离线数据中实现更精细的质量评估。

第二,通过双指标体系评估价值可靠性。Robo-ValueRL 引入两类互补的可靠性指标:全局进度指标衡量价值估计与任务整体进展的相关程度,即价值函数能否反映「当前策略距离目标还有多远」;局部偏好指标衡量价值估计对相邻动作质量排序的一致性,即对于相似的状态,高价值估计是否始终对应高质量动作。这两个指标分别从宏观任务层面与微观动作层面捕捉价值估计的可靠性,共同构成了一个多维度的价值质量评估框架。

第三,将可靠价值估计贯穿离线预训练与在线改进两个阶段。在离线预训练阶段,Robo-ValueRL 采用质量条件的一致性策略预训练策略。不同于传统行为克隆对所有离线样本一视同仁的做法,该方法根据价值估计为每个样本分配质量权重,使得策略在学习过程中更多地参考高质量示教,同时保留对低质量样本的覆盖以维持分布多样性。在在线改进阶段,系统设计了面向在线回放的残差适配模块。该模块利用实时更新的价值估计来优先处理高质量的在线回放数据,在探索与利用之间取得更优平衡,并为在线阶段的价值函数提供持续修正的反馈机制。

这种「评估-传播-利用」的闭环设计使得价值可靠性不再是抽象的算法属性,而是贯穿整个离线到在线流程的可操控变量。

实验与结果

实验覆盖了两种真实机器人任务场景:毫米级精度的芯片插装任务,以及可泛化的积木拆卸任务。数据集规模达到 240 小时的离线示教与超过 3,000 条在线回放轨迹,这一规模在机器人操作领域具有相当的代表性。

实验首先验证了核心假设:下游策略性能与价值可靠性之间存在显著的正相关关系。通过对比使用不同可靠性水平价值函数的实验组,作者观察到使用高可靠性价值引导的策略在两项任务上的成功率分别比低可靠性组高出约 15% 和 12%。这一结果为价值可靠性塑造策略优化的论断提供了直接的实验支撑。

消融实验进一步揭示了价值引导在不同阶段的贡献。在离线预训练阶段,价值引导使得行为克隆策略能够自动聚焦于高质量示教片段,避免了低质量示范对策略的误导。相比于朴素的行为克隆,价值引导版本在长-horizon 任务中的性能提升尤为明显,表明高质量动作估计对于学习长序列决策尤为关键。在线改进阶段,残差适配模块通过优先处理高价值回放数据,有效稳定了策略的在线微调过程,防止了价值函数的过度泛化导致的策略退化。

值得注意的是,实验还观察到价值可靠性指标与任务难度之间的交互效应。在精度要求更高的芯片插装任务中,价值可靠性的边际贡献更大,这可能是因为精细操作对动作质量判断更敏感,可靠的价值估计能够更精准地区分「接近成功」与「趋于失败」的动作序列。

讨论与可借鉴点

Robo-ValueRL 最重要的贡献在于揭示了价值估计可靠性的独立价值。长期以来,研究社区倾向于将价值估计视为策略优化的附属品,关注的是算法层面的改进而非价值质量本身。该论文通过系统性的实验设计,证明了投资于更可靠的价值建模能够获得实质性的策略性能提升,这为未来的研究指明了一个被低估的方向。

该工作的一个局限在于其双指标体系依赖于任务层面的定义,这在一定程度上需要人工介入。对于完全无监督或任务边界模糊的场景,如何自动推断全局进度与局部偏好仍是开放问题。此外,实验主要在结构化的机器人操作任务上验证,泛化到更开放的视觉导航或自然语言任务尚需进一步探索。

对于从事离线强化学习与机器人研究的研究者,Robo-ValueRL 的启发在于:应当将价值质量纳入算法评估的常规指标,而非仅关注最终策略的回报。同时,质量条件的数据加权策略为处理异构数据提供了一种简洁有效的思路,这种「让价值引导数据利用」的思路在更广泛的顺序决策问题中可能具有普适价值。

摘要

离线到在线强化学习对于可泛化的机器人操作颇具前景,但其在全流程上的复杂性掩盖了复现与诊断的可行性。在这类系统中,价值估计在为策略改进排定异构数据优先级方面扮演着核心角色。尽管价值估计至关重要,一个核心问题仍未被充分研究:价值函数的可靠性如何塑造离线到在线强化学习中的策略优化。为回答该问题,我们提出了 Robo-ValueRL,一个实现可靠价值估计、并系统性地追踪其对策略预训练与在线改进下游影响的统一框架。具体而言,Robo-ValueRL 学习一个以历史为条件的价值估计器,并通过全局进度与局部偏好两类指标评估其可靠性。所得的价值估计被传播到质量条件的一致性策略预训练以及面向在线回放的残差适配模块中,为分析价值可靠性如何塑造下游策略性能提供了一体化的测试平台。在覆盖 240 小时离线示教与超过 3,000 条在线回放轨迹的广泛实验中,我们的结果表明下游性能与价值可靠性高度相关。可靠的价值函数能够提供更优的动作质量估计,使价值引导的离线强化学习比与质量无关的行为克隆更具可扩展性,并通过优先处理高质量回放数据来稳定在线改进过程。通过将离线预训练中的可靠价值引导与在线改进相结合,我们的系统在毫米级精度的芯片插装任务上达到了 86% 的成功率,并在可泛化的积木拆卸任务上达到了 84% 的成功率。我们希望这些发现能够凸显价值引导的数据利用对于从异构机器人经验中进行有效策略改进的重要性。

Abstract

Offline-to-online reinforcement learning is promising for generalizable robotic manipulation, yet its full-stack complexity obscures reproduction and diagnosis. Within such systems, value estimation plays a central role in prioritizing heterogeneous data for policy improvement. Despite its importance, the central question remains underexplored: how value-function reliability shapes policy optimization in offline-to-online reinforcement learning. To answer this question, we propose Robo-ValueRL, a unified framework that enables reliable value estimation and systematically traces its downstream effects on policy pretraining and online improvement. Concretely, Robo-ValueRL learns a history-conditioned value estimator and evaluates its reliability through global-progress and local-preference metrics. These resulting value estimates are propagated into quality-conditioned consistency-policy pretraining and a residual adaptation module on online rollouts, providing a unified testbed for analyzing how value reliability shapes downstream policy performance. Across 240 hours of offline demonstrations and over 3,000 online rollout trajectories, our extensive experiments show that downstream performance is strongly associated with value reliability. Reliable value functions provide better action-quality estimates, allowing value-guided offline RL to scale more effectively than quality-agnostic behavior cloning, and stabilize online improvement by prioritizing high-quality rollout data. Integrating reliable value guidance through offline pretraining with online improvement, our system achieves 86% success on millimeter-level precise chip insertion and 84% on generalizable block disassembly. We hope these findings highlight the importance of value-guided data utilization for effective policy improvement from heterogeneous robotic experience.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记