arXiv 2607.00392v1 · 发布 2026-07-01

基于数据高效无监督强化学习的可泛化技能策略学习

Learning Generalizable Skill Policy with Data-Efficient Unsupervised RL

AUTHORS Jongchan Park, Seungjun Oh, Seungho Baek, Yusung Kim
EVIDENCE 无监督强化学习框架,技能重标注与信息瓶颈
SCORE 0.8
CATEGORIES TASK rl
GENERATED 2026-07-04 21:37:51 UTC

📝 TLDR

无监督强化学习旨在预训练可扩展的技能条件策略,但现有方法面临技能语义非平稳与泛化能力脆弱两大瓶颈。本文提出 GenDa 框架,通过技能重标注机制缓解非平稳性并提升预训练数据效率,同时设计互补信息瓶颈 CIB 鼓励策略关注自我中心特征。多种实验表明 GenDa 显著增强了无监督强化学习的可扩展性,在泛化能力和数据效率上均优于基线。该工作为下游控制任务提供了更稳健的预训练基础。

🧭 速览

动机

现有 off-policy 无监督强化学习方法受限于技能语义非平稳与泛化能力脆弱两大被忽视的瓶颈。

方法

GenDa 通过技能重标注机制缓解非平稳性,并采用互补信息瓶颈 CIB 聚焦自我中心特征以提升分布迁移鲁棒性。

结果

多种实验显示 GenDa 显著提升 URL 可扩展性,在泛化能力与数据效率上均优于现有基线方法。

结论

为下游控制任务提供了数据高效、可扩展且鲁棒泛化的无监督预训练新范式。

📊 论文图表(共 32 张)

展开查看 32 张图

TL;DR

本文针对离线策略无监督强化学习中长期被忽视的两个关键瓶颈——技能语义的非平稳性与策略泛化能力脆弱——提出了 GenDa 统一框架。GenDa 通过技能重标注机制重塑潜变量与轨迹的对应关系,显著提升预训练数据效率;同时引入互补信息瓶颈 CIB 引导策略关注以自我为中心的本体感知特征而非全局上下文。实验表明,GenDa 在 7 种环境中均大幅超越基线方法,仅需约五分之一的交互步数即可达到甚至超越基线的渐近性能,并在分布偏移的下游任务中展现出数倍至数十倍的泛化优势。

研究背景与动机

无监督强化学习的核心愿景是:在没有任何外部奖励信号的环境中进行大规模预训练,学到一组可复用、可组合的技能条件策略 ,使得下游任务仅需微调一个高层控制器 即可快速适应。这种范式与自然语言处理中预训练语言模型的思路一脉相承,被视为构建机器人控制领域"基础模型"的关键路径。

然而,现有的离线策略方法在实际应用中暴露出两个深层矛盾。第一,在 off-policy 设定下,replay buffer 中存储的轨迹与技能标签对是历史snapshot,而用于定义技能方向的表征函数 却在持续演化。这意味着,同一个技能代码 在不同训练阶段可能指向截然不同的行为模式——重放缓冲区中的"旧标签"与"新表征"之间出现错位,论文将这种现象称为语义漂移。语义漂移不仅污染了表示学习过程,还导致大量历史数据无法被有效利用,使得预训练的数据效率远低于预期。

第二,现有方法通常将完整的状态 直接输入策略网络,而 中包含了大量与技能本质无关的全局信息——机器人所在的世界坐标、环境背景颜色、相机视角等。这些冗余线索使得策略在预训练环境中表现出色,却极易在初始条件或视觉背景发生偏移的下游任务中失效。换言之,学到的并非真正可泛化的技能,而是对特定环境的过拟合。

这两个问题相互叠加,使得现有方法难以同时满足"高效预训练"与"鲁棒迁移"两个目标,制约了无监督强化学习向规模化应用迈进的步伐。

方法

GenDa 的设计围绕上述两个瓶颈分别给出解法,形成一套统一且模块化的框架。

技能重标注机制 针对语义漂移问题,论文提出了 Relabel-and-Optimize 迭代过程。直观想法是:既然旧标签与当前表征不再对齐,那就用当前的 重新为历史轨迹打标签。具体而言,对于 replay buffer 中的任意轨迹 ,不再使用训练初期确定的 ,而是基于当前表征网络的端点差重新计算方向向量:

其中 unit 表示归一化操作以保证 的约束得以满足。实现中使用 的 EMA 目标网络以确保重标注的稳定性。整个训练循环交替执行两个步骤:先用 冻结标签来优化表征 -step),再用更新后的 重新计算所有历史轨迹的标签(-step)。

重标注后有一个隐患: 的分布可能偏离先验 ,进而引发表示坍缩。为此,GenDa 引入了一个均匀性正则化项 ,通过对比学习的方式最大化重标注技能在单位球面上的均匀分布程度,防止所有技能向量塌缩到少数几个方向上。

策略侧重的互补信息瓶颈 针对策略的泛化脆弱性问题,论文设计了一个变分信息瓶颈编码器 ,与解码器 联合训练,最小化如下目标:

这个目标的精妙之处在于:解码器已经能够通过 恢复大部分状态信息,因此编码器若试图保留 已编码的全局特征,解码器不会给出额外奖励。编码器被迫去捕获那些" 不擅长的信息"——这恰恰是以自我为中心的本体感知特征,如关节角度、局部速度等与技能执行直接相关的局部状态。训练完成后,策略网络的输入从完整状态 替换为瓶颈编码 ,从而在根本上切断策略对全局上下文的依赖路径。

两个模块各司其职:重标注机制解决的是"数据能不能高效利用"的问题,而 CIB 解决的是"学到的策略能不能迁移"的问题。两者结合,使 GenDa 在预训练效率和下游泛化两个维度上同时获得显著提升。

实验与结果

实验覆盖了从低维数值状态到高维像素输入的多种环境。在 DeepMind Control Suite 的 Humanoid-Numeric(226 维状态)、Quadruped-Numeric、Fish-Numeric 等环境中,GenDa 均取得了最高的预训练覆盖率曲线。特别值得注意的是 Dog 和 Fish 环境——基线方法在此类高维数值状态下完全失效,而 GenDa 仍能学到有意义的技能表征,验证了其在高维空间中的可扩展性。

数据效率方面的对比尤为突出。论文以 METRA 和 CSF 为主要基线,在 2M 步预训练条件下报告下游任务成功率。GenDa 在 Humanoid 和 Quadruped 环境上仅用约五分之一的交互步数即可达到基线在 10M 步处的渐近性能,这意味着同等硬件预算下,GenDa 能完成约五倍数量的环境探索。

泛化能力的验证通过构造初始位置偏移和背景颜色偏移的下游任务来完成。在 (不同初始状态与奖励目标的未见组合)以及 MazeHard 等难度较高的导航任务中,GenDa 相对 METRA 和 CSF 提升数倍至数十个百分点。CIB 的消融实验进一步表明,去掉 CIB 后策略在 Unicolor 和 Gradation 等未见背景下的成功率从接近 100% 分别退化至 81% 和 62%,而其他模块的消融则对这一指标影响甚微——证实了 CIB 确实是泛化能力提升的主要来源。

讨论与可借鉴点

GenDa 的一项重要贡献在于问题形式化:将离策略训练中的语义漂移与全局上下文过拟合显式建模为两个独立瓶颈,并分别给出针对性的技术解法。这种"诊断先行、模块化应对"的思路值得借鉴——在复杂系统中,往往不存在单一的全能解法,而将系统级问题拆解为若干正交的子问题再逐个击破,是工程上更可行的路径。

从方法论角度看,技能重标注机制本质上是一种动态标签对齐策略,它在不引入额外环境交互的前提下盘活了历史数据。这种"用算法改进弥补数据质量不足"的思路在强化学习的多方面问题中具有普适意义。而互补信息瓶颈的设计哲学——让不同模块各司其职、强制互补而非冗余——为信息瓶颈方法在策略学习中的应用提供了一种优雅的范式。

当然,论文也坦诚地指出了若干局限。重标注机制目前依赖"一技能一完整轨迹"的假设,对于单条轨迹内包含异质行为的复杂情形尚无良好解决方案。CIB 的有效性部分依赖于 metric-aware 表征函数的存在,向非度量感知方法迁移时可能需要调整。此外,当前下游任务以导航-到达类为主,对长视野规划、稀疏奖励或精细操作等更复杂的场景覆盖尚不充分。

总体而言,GenDa 为无监督强化学习的实用化迈出了坚实一步。它揭示的"数据效率"与"泛化鲁棒性"之间的张力,实际上是整个"预训练-微调"范式在强化学习领域面临的核心挑战,其诊断框架和解决思路有望为后续研究提供有价值的参考。

摘要

无监督强化学习(URL)旨在无需外部奖励的情况下预训练可扩展的、以技能为条件的策略,作为下游控制任务的基础。尽管近年来取得了一定进展,我们认为现有的离线策略无监督强化学习方法受到两个关键且被忽视的瓶颈限制:(1)技能语义的非平稳性,以及(2)脆弱的泛化能力。为应对这些挑战,我们提出了GenDa(Generalizable Data-efficient Agent,可泛化数据高效智能体),一个用于鲁棒无监督强化学习的统一框架。首先,我们引入了一种技能重标注机制,以缓解非平稳性问题,并显著提升预训练的数据效率。其次,我们提出了互补信息瓶颈(Complementary Information Bottleneck, CIB),促使所学到的技能策略聚焦于以自我为中心的特征,从而对下游任务的分布偏移具有鲁棒性。通过大量实验,我们证明GenDa显著提升了无监督强化学习的可扩展性,同时具备卓越的泛化能力和数据效率。我们的代码和视频可在 https://ihatebroccoli.github.io/official-GenDa 获取。

Abstract

Unsupervised Reinforcement Learning (URL) aims to pre-train scalable, skill-conditioned policies without extrinsic rewards, serving as a foundation for downstream control tasks. Despite recent progress, we argue that current off-policy URL methods are limited by two critical, overlooked bottlenecks: (1) non-stationary skill semantics and (2) brittle generalization. To address these challenges, we propose GenDa (Generalizable Data-efficient Agent), a unified framework for robust unsupervised reinforcement learning. First, we introduce a skill relabeling mechanism to mitigate non-stationarity and significantly improve data efficiency for pre-training. Second, we propose a Complementary Information Bottleneck (CIB), encouraging the learned skill policy to focus on ego-centric features and become robust to distribution shifts for downstream tasks. Through various experiments, we demonstrate that GenDa significantly enhances the scalability of URL with superior generalizability and data efficiency. Our code and videos are available at https://ihatebroccoli.github.io/official-GenDa.


论文详细总结(自动生成)

论文总结:基于数据高效无监督强化学习的可泛化技能策略学习

1. 核心问题与研究动机

无监督强化学习(URL)旨在无需外部奖励的前提下,从环境交互中预训练出可扩展的、以技能(skill)为条件的策略 ,作为下游控制任务的"通用基础模型"。其核心目标是:当下游任务给出奖励后,仅需微调一个高层控制器 即可复用预训练技能。

论文指出,当前主流 off-policy URL 方法(如 METRA、CSF 等)存在两个被忽视的关键瓶颈:

  • 技能语义的非平稳性(Semantic Drift):off-policy 设置下,replay buffer 中存储的 对是固定的,但表征函数 在训练中持续演化。同一个 在不同训练阶段可能对应截然不同的轨迹,导致 与轨迹之间出现"一对多"映射,使表示学习被陈旧标签污染,限制数据效率。
  • 技能策略的脆弱泛化:多数方法直接将完整状态 (包含全局坐标、背景等)作为策略输入,导致技能策略过拟合到全局上下文。在下游任务初始条件或环境背景发生偏移时,相同 难以复现一致行为。

这两个瓶颈使 URL 难以同时实现 数据高效预训练鲁棒的下游迁移,从而无法满足构建可扩展基础策略的需求。


2. 方法论:GenDa 框架

论文提出 GenDa(Generalizable Data-efficient Agent),建立在 METRA 的度量感知(metric-aware)目标之上,由两个核心模块组成。

2.1 预备与基线目标

在无奖励 MDP 上,引入潜变量映射 ,最大化如下度量感知互信息目标:

2.2 技能重标注(Skill Relabeling)

针对语义漂移,提出 Relabel-and-Optimize 迭代过程:

  • -step(重标注):不再使用陈旧的 ,而基于当前表征 重新计算整段轨迹的方向:

在实现中使用 的 EMA 目标网络以稳定训练。

  • -step(优化):固定 (stop-gradient),更新 使其对齐当前重新解释的潜变量方向。
  • 均匀性正则化(Uniformity Regularizer):重标注后 不再保证服从先验 ,易导致表示坍缩。引入对比式均匀项以最大化

最终表示损失为:

2.3 策略侧重标注

对 SAC 训练的内在奖励 ,同样进行重标注:采样未来 步方向

并与 按比例混合(Mix 策略),用基于计数估计的 EMA 概率决定是否保留 ,以丰富 off-policy 的奖励信号。

2.4 互补信息瓶颈(Complementary Information Bottleneck, CIB)

为削弱策略对全局上下文的依赖,引入变分信息瓶颈式编码器 ,与解码器 联合训练:

直观含义:解码器已能通过 重建 已捕获的信息,因此 被迫保留 互补 的信息(即 不擅长的本体感知等局部特征)。

最终策略输入被替换为:

CIB 在数据收集、训练、下游部署中一致使用,是即插即用模块。

2.5 算法流程(Algorithm 1)

主循环:对每个回合采样 并收集轨迹存入 ;对每个梯度步,从 采样批次,对 分别进行 重标注;用 更新 与拉格朗日乘子 ;用混合批次通过 SAC 更新 ;更新 CIB 以最大化 ;最后执行 EMA 目标网络更新。

2.6 理论分析

  • 附录 A:在表格化设置下证明 -step 的可行域非空、有界、紧,目标是线性(凹)且约束凸,故每步存在全局最优解,整个 Relabel-and-Optimize 流程是 well-posed 的。
  • 附录 B:把语义漂移建模为标签噪声,证明重标注可消除条件标签噪声方差 ,但会引入偏差;总效果体现为 偏差-方差权衡,当标签噪声占主导时可显著稳定训练。

3. 实验设计

  • 环境与 Benchmark
  • 数值状态环境(DeepMind Control Suite):Humanoid-Numeric、Quadruped-Numeric、Dog-Numeric(226 维状态、38 维动作)、Fish-Numeric
  • 像素环境:Humanoid-Pixels、Quadruped-Pixels、Kitchen-Pixels(MuJoCo 机械臂操作)
  • 下游任务:含 、MazeEasy、MazeHard 四类,组合成 6 个域共 15 个任务
  • 基线方法:METRA(Park et al., 2024)、CSF(Zheng et al., 2025)、DIAYN(Eysenbach et al., 2019)、CIC(Laskin et al., 2022)
  • 评估指标
  • 预训练阶段:48 条随机采样技能轨迹的 状态/任务覆盖率(按 x、y 坐标分箱计数)
  • 下游阶段:分层控制器冻结预训练 ,高层 SAC 训练后报告 任务成功率

4. 资源与算力

论文正文中未明确报告所使用的 GPU 型号、数量、训练时长或总体算力消耗。实现层面仅说明基于 JAX 进行开发以加速训练,并复用各基线官方代码与超参。隐含地看,预训练涉及 7 个环境、每环境 4 个随机种子、 步交互,下游任务另含 步训练,估计需要中等规模的 GPU 集群(如多张 A100 级别),但论文未给出具体数字。


5. 实验数量与充分性

  • 主对比实验:图 3 给出 7 个环境的状态/任务覆盖率曲线 × 5 个方法 × 4 个种子。
  • 下游任务:表 1 覆盖 4 个域 × 多达 4 种任务 × 4 种子;表 2 对比 2M 与 10M 步预训练策略性能(数据效率验证)。
  • 消融研究:图 5 给出 Quadruped-Numeric 上的 w/o Relabw/o CIB 消融;表 3 对 做超参敏感性扫描;图 6 在 UTD 下验证;表 4 在 Quadruped-Pixels 上做 未见过背景(Unicolor、Gradation)鲁棒性测试。
  • 定性分析:图 1 展示语义漂移现象;图 2、图 7 对比偏移初始位置下的轨迹一致性;图 8 通过重建可视化验证 CIB 与 的互补性;图 9、图 10 展示均匀项与策略重标注策略对比;表 5 比较策略重标注不同混合比例与阈值。

整体实验覆盖了预训练效率、下游泛化、组件贡献、超参鲁棒性、UTD 鲁棒性、视觉鲁棒性等多个维度,实验量较为充分且对照清晰;多数关键结论有 4 个种子的均值与标准差,统计意义上较为客观。公平性方面,作者声明所有方法共享相同超参(仅高层控制器与任务相关超参不同),并对 CIB 训练中未使用任何图像增强以保持与基线的公平比较。


6. 主要结论与发现

1. 数据效率显著提升:GenDa 在所有 7 个环境中均取得最高的预训练覆盖率,且在 Humanoid、Quadruped 等环境下以约 更少交互即可达到基线的渐近性能(表 2)。

2. 在高维空间中可扩展:在 226 维 Dog-Numeric、Fish-Numeric 等基线完全失败的环境上,GenDa 仍能学到有意义的技能(图 3)。

3. 下游泛化大幅提升:在 、MazeEasy、MazeHard 等分布偏移任务中,GenDa 相对 METRA、CSF 提升数倍至数十个百分点(表 1)。

4. 缓解语义漂移:高 UTD 比率下基线出现明显不稳定,而 GenDa 仍能稳定提升覆盖率(图 6),验证了重标注机制的有效性。

5. CIB 真正实现 -互补:可视化(图 8)显示 主要保留背景颜色信息,而 CIB 编码 主要保留本体感知信息,二者形成结构性互补。

6. 两个模块各司其职且互补:消融(图 5)证明 Relabeling 解决数据效率,CIB 解决下游泛化,缺一不可。


7. 优点

  • 问题诊断深入:将"语义漂移"与"全局上下文过拟合"形式化为两个独立但互补的瓶颈,给出理论与可视化双重证据。
  • 方法简单有效:技能重标注仅用 的一次端点差即可重新解释潜变量,几乎无额外开销;CIB 是 drop-in 模块,可与现有 off-policy URL 框架无缝组合。
  • 理论保证:附录 A 给出 Relabel-and-Optimize 每步的 well-posedness 与凸优化保证;附录 B 给出偏差-方差分析,为经验现象提供解释。
  • 实验覆盖广:跨 7 个环境(含像素与机械臂)、4 个基线、多类下游任务、多个消融与超参扫描;种子数与误差棒充分。
  • 工程细节扎实:附录 D 给出全部环境参数与超参表,便于复现。
  • 明确的延伸方向:论文坦诚指出当前一技能-一-回合假设的局限、 依赖性、细粒度操作困难等,为后续工作留出接口(如 PSD)。

8. 不足与局限

  • 算力信息缺失:未报告 GPU 型号、数量与训练时长,不利于评估方法的实际计算成本。
  • 依赖性:CIB 依赖 metric-aware 提供互补目标,迁移到非度量感知算法时可能受限。
  • 一技能-一-回合假设:重标注基于完整轨迹端点差,对单一回合内包含异质行为(如探索-执行混合)的情形处理不足;论文承认需扩展到时变技能标签。
  • 视觉鲁棒性仍有限:表 4 显示 CIB 在未见背景(Unicolor 81%、Gradation 62%)下相对原始 100% 仍有退化,作者明确承认未使用图像增强以保公平,提示结合视觉增强(如 DrQ)是未来方向。
  • 下游任务偏短视域:多数下游 episode 时长仅 200–500 步,且任务以导航-到达类为主,对长视野、稀疏奖励、精确操作等场景覆盖不足。
  • 缺乏失败案例分析:附录中虽报告了部分超参扫描,但未系统讨论何种环境/任务下方法仍会失效或退化。
  • 基线选择偏向:未与最新 PSIM、PSD、OPAL 等更近期 URL 方法对比;DIAYN、CIC 的设置可能未完全对齐其原作者的官方最优配置。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记