面向视觉强化学习泛化的任务相关表示解耦
Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization
📝 TLDR
提出T2RD自监督算法,解耦任务相关特征以提升视觉RL泛化能力。
🧭 速览
面向视觉强化学习泛化的自监督任务相关表征解耦。
方法与实现细节请参考摘要与正文。
结果与对比结论请参考摘要与正文。
总体而言,该工作在所述任务上展示了有效性,并提供了可复用的思路或工具。
📊 论文图表(共 13 张)
展开查看 13 张图
TL;DR
本文提出 T2RD(Task-Relevant Representation Decoupling)算法,通过将高维图像观测解耦为任务相关表示与任务无关表示,使强化学习智能体仅依赖任务相关特征做决策,从而在视觉环境变化时保持泛化能力。T2RD 在 DeepMind Control Suite 和仿真机器人任务上取得了当前最优的泛化性能与样本效率,在大多数测试场景中显著领先已有方法。
研究背景与动机
视觉强化学习(VRL)在视频游戏、机器人操控等控制任务上已经取得了令人瞩目的成就,但一个根本性的瓶颈始终困扰着这个领域:当训练环境和测试环境在视觉外观上存在差异时——比如背景颜色改变、光照条件变化、物体纹理替换——智能体的性能往往会急剧下降。这种现象的根源在于,高维像素观测中天然包含了大量与任务目标无关的冗余信息,智能体在训练过程中很容易将这些任务无关的特征也一并编码到策略中,造成对训练环境的过拟合。
面对这一挑战,现有方法大致可以分为两条路线。一类是数据增强方法,如 RAD、DrQ、TLDA 等,它们试图在训练阶段人为引入各种视觉变换,使得智能体能够“见多识广”,从而在测试时更好地应对未曾见过的视觉变化。另一类是自监督辅助任务方法,如 CURL、SODA、BiT 等,它们通过对比学习、重建任务或一致性正则等手段,赋予表示某种结构化的性质。然而,这两类方法都有一个共同的缺陷:它们并未显式地将任务相关的信息从观测中分离出来。换句话说,习得的表示仍然可能包含大量干扰特征,策略在做出决策时仍然会受到这些无关信息的潜在影响。
本文的核心切入点是:与其让智能体自己去“忽略”无关信息,不如显式地告诉它哪些是任务相关的、哪些是任务无关的。具体而言,作者引入了一个概念框架——将观测解耦为“任务相关表示”与“任务无关表示”两路,只用任务相关表示驱动策略学习。这一思路借鉴了计算机视觉中内容-风格分离的经典思想,但针对强化学习的特性做了专门的适配:仅仅分离出“内容”和“风格”还不够,内容表示必须真正与任务目标相关。
方法
T2RD 采用了一个精巧的三组件自监督学习框架,整体上借鉴了 BYOL 的双分支架构,但加入了针对任务相关解耦的专门设计。
整个系统的输入是一系列图像观测序列 。编码器 (在线分支)和 (目标分支)将像素映射到隐表示空间,然后通过一个双头投影结构将隐表示分解为任务相关的“内容” 和任务无关的“风格” 。目标分支通过指数移动平均(EMA)的方式缓慢更新在线分支的参数,这种设计在 BYOL 类方法中已被证明能有效避免表示坍缩。
第一个组件是任务相关表示一致性。直观的想法是:同一物理状态在不同视觉域下应该对应相同的内容表示。例如,Walker 机器人在蓝色背景和红色背景下的“站立”状态,本质上应该是同一个内容。因此,T2RD 对同一状态的两个增强视图(通过 Random Overlay 或 Random Convolution 生成)施加一致性损失:
这个损失强制同一状态在不同外观变换下保持内容一致,从而将表示推向“风格不变”的方向。
第二个组件是跨重建。如果仅有第一个组件,内容表示可能只是学到了某种不变性,但不一定保留了决策所需的所有信息。跨重建的设计非常巧妙:它用增强视图的内容 和原始视图的风格 来重建原始的隐表示 。具体地,重建表示为 ,损失为:
$
这种“跨域”重建的妙处在于:如果 中残留了风格信息,那么它与 组合时就会产生冲突,导致重建失败。换言之,跨重建约束迫使内容表示进一步“纯净化”,将风格干扰彻底驱逐出去。
前两个组件已经实现了内容与风格的分离,但作者敏锐地指出:这样得到的内容表示仍然未必是任务相关的。举例来说,两种不同颜色的桌子在视觉上显然属于不同的“内容”,但如果任务只关心机器人能否抓取物体而非桌子的颜色,那么这些与颜色相关的变化也应该被归入“任务无关”的范畴。因此,第三个组件——跨动态预测——被设计出来解决这一难题:
这个组件用增强视图的内容表示和当前动作来预测下一时刻原始视图的任务相关表示。动态预测的约束有两层含义:首先,它进一步要求内容表示与视觉外观无关——因为增强视图的表示必须能够正确预测未来状态;其次,它要求内容表示必须包含能够预测状态转移的动态信息,而这恰恰是任务相关的核心特征。
三个组件的总体目标函数为:
T2RD 与 SAC 强化学习算法以交替优化的方式联合训练:每 步先优化 T2RD 的自监督损失,再优化 SAC 的策略与价值函数损失。策略网络仅以 作为输入,从而确保决策完全基于任务相关表示。
在理论层面,作者将 T2RD 与双模拟度量(bisimulation metric)建立了联系。双模拟度量是衡量状态等价性的经典工具,它同时考虑奖励差异和状态转移分布的差异,被证明与最优动作价值函数的误差存在上界关系。具体而言,作者论证了: 对应状态不变性, 保证信息充分性并构成信息瓶颈, 是 Wasserstein 距离项的实用近似, 则隐式建模奖励项。基于这些对应关系,论文推导出了动作价值函数的误差上界:
这个上界揭示了一个关键洞察:表示学习的误差和策略学习的误差会以 的系数共同影响最终的性能,而 T2RD 通过三个自监督组件同时压制了表示学习的误差来源。
实验与结果
实验在两个基准上进行:DeepMind Control Suite 泛化基准(DMControl-GB)包含 5 个经典控制任务和 3 种测试设置(颜色变化、视频背景、困难视频背景),机器人操作任务则包含 Reach 和 Peg-in-box 两个任务各 4 个测试环境。对比基线覆盖了 9 种当前最优方法,包括 DrQ、SODA、SVEA、TLDA、PIE-G、SGQN、BiT、TRP 和 ViSaRL。
在 DMControl-GB 的 15 个任务设置中,T2RD 在 9 个上取得了最优性能。特别值得注意的是 Cartpole Swingup Video Hard 场景,T2RD 比次优方法提升了约 33%。在机器人操作任务上,T2RD 的优势更为明显:8 个测试环境中取得 7 个最优,Peg-in-box 平均相对提升 57.1%,Reach 任务平均提升 40.1%。这些数字背后反映的是,在高度视觉多样化的测试环境中,T2RD 能够始终保持稳定的任务性能,而其他方法要么性能下降明显,要么在不同测试环境间波动较大。
样本效率方面的结果同样令人鼓舞。训练曲线显示,T2RD 在大多数任务上不仅收敛更快,而且最终收敛的渐近性能也更高。关键是,这种样本效率优势同样迁移到了未曾见过的测试环境中——这说明 T2RD 学到的任务相关表示确实具有更好的泛化特性,而不是在训练环境上的简单过拟合。
消融实验验证了三个组件各自的贡献。移除 (跨动态预测)后性能下降最为显著,这有力地证明了动态预测在将“内容”细化为“任务相关”过程中的关键作用。相比之下,仅有前两个组件时,内容表示虽然具有风格不变性,但不足以支撑高质量的策略泛化。此外,变体实验还发现跨重建分支的设计优于像素级重建或同域重建,进一步确认了“跨域”约束在解耦中的核心地位。
可视化分析提供了对解耦效果的直观验证。t-SNE 可视化显示,随着训练的进行,同一状态的特征表示在嵌入空间中逐渐聚集,而任务相关与任务无关特征逐渐分离。注意力热力图则揭示,T2RD 在面对背景干扰时能够准确聚焦于任务相关区域。跨重建图像更是直观地展示了 组合能够忠实还原原始图像的能力。
讨论与可借鉴点
T2RD 最重要的贡献在于提出了“任务相关 vs. 任务无关”这一解耦目标,并设计了跨重建与跨动态预测两个巧妙的约束来逼近这一目标。这一思路为视觉强化学习的泛化研究提供了新的视角:与其被动地让智能体学会“忽略”无关信息,不如主动地引导它分离并丢弃这些信息。
然而,方法也存在值得关注的局限。首先是可解耦假设的边界问题:T2RD 假设观测可以清晰分为“内容”和“风格”,但在某些任务中,视觉外观本身可能就是任务的组成部分——比如依赖地形纹理进行导航的场景,此时将纹理信息判定为“任务无关”反而会损害策略性能。其次,实验目前仅覆盖仿真环境,仿真到真实(sim-to-real)的迁移能力尚未验证,而光照变化、物体外观变化在真实场景中比仿真环境更为复杂和不可控。
从方法论的角度,T2RD 有几点值得借鉴的设计哲学。一是“跨域”约束的运用:无论是跨重建还是跨动态预测,都利用了“跨越不同视觉域”的约束来驱动表示纯净化,这种思想可以推广到其他需要特征解耦的场景。二是理论与实践的结合:将三个损失项对应到双模拟度量的不同成分,并推导出 Q 函数误差上界,这种做法为自监督目标的设计提供了理论锚点,有助于理解为什么某些约束是必要的。三是组合数据增强的发现:论文揭示了单一增强在不同测试场景下各有优劣的现象,并提出组合增强来缓解这种“泛化偏差”,这一观察对整个视觉强化学习领域都具有参考价值。
展望未来,一个有潜力的方向是将 T2RD 的解耦思想与多任务强化学习结合:如果能够显式地建模不同任务各自的任务相关表示,或许可以实现更高效的任务迁移。另一个方向是探索更弱的解耦假设——比如假设任务相关信息嵌入在风格表示中而非独立于风格表示之外,这将大大拓展方法的应用范围。
摘要
视觉强化学习(VRL)在求解控制任务方面取得了显著成功。然而,将习得策略泛化到新环境仍然是一个重大挑战,因为智能体往往会过拟合于训练环境中的任务无关特征。为解决这一问题,我们引入了将观测解耦为任务相关表示与任务无关表示的概念。基于这一思想,我们提出了一种用于 VRL 的自监督任务相关表示解耦(T2RD)算法。该算法包含三个组件:任务相关表示一致性、跨重建以及跨动态预测。前两个组件实现了内容与风格特征的解耦,但所得的内容表示未必是任务相关的。为进一步从内容表示中提炼出任务相关特征,我们设计了引入动态预测的第三个组件。T2RD 在 DeepMind Control Suite 和机器人操作任务上取得了当前最优(SOTA)的泛化性能与样本效率。
Abstract
Visual Reinforcement Learning (VRL) has achieved considerable success in solving control tasks. However, generalizing learned policies to new environments remains a major challenge, as agents often overfit to task-irrelevant features in the training environment. To solve this problem, we introduce the concept of decoupling observations into task-relevant and task-irrelevant representations. Building on this idea, we propose a self-supervised Task-Relevant Representation Decoupling (T2RD) algorithm for VRL. This algorithm consists of three components: task-relevant representation consistency, cross-reconstruction, and cross-dynamic prediction. The first two components achieve the decoupling of content and style features, but the resulting content representations are not necessarily task-relevant. To further refine task-relevant features from content representations, we design the third component that introduces dynamic prediction. T2RD achieves State-Of-The-Art (SOTA) generalization performance and sample efficiency in the DeepMind Control Suite and Robotic Manipulation tasks.
论文详细总结(自动生成)
论文总结:面向视觉强化学习泛化的任务相关表示解耦(T2RD)
1. 核心问题与整体含义(研究动机与背景)
视觉强化学习(VRL)在视频游戏、机器人操控、自动导航等控制任务上取得了显著成功。然而,高维图像观测中天然包含大量与任务无关的冗余细节,导致智能体在训练过程中容易过拟合到这些任务无关特征,从而在面对新环境中视觉外观变化时泛化能力急剧下降。
现有提升 VRL 泛化能力的方法大致可归为两类:
- 数据增强(RAD、DrQ、SODA、TLDA 等):试图在训练阶段覆盖测试环境的视觉变化;
- 自监督辅助任务(CURL、CURL、SODA、BiT、VAI、SGQN 等):通过对比学习、一致性正则等手段赋予表示某些性质,但并未显式剥离任务无关信息,因此习得表示仍可能编码干扰特征,导致策略过拟合。
本文的核心观点是:应将观测显式解耦为"任务相关"与"任务无关"两路表示,仅用任务相关表示驱动策略学习。这一思路借鉴了视觉领域中内容—风格分离的思想,但本文特别强调面向 VRL 的自监督任务相关特征解耦。
2. 方法论
2.1 整体框架
T2RD 采用 BYOL 风格的双分支架构(在线分支 + 目标分支):
- 编码器 (在线)/ (目标):从像素提取隐表示;
- 双头投影 / :将隐表示解耦为任务相关"内容" 与任务无关"风格" ;
- 预测器 (仅在线分支):促使在线分支预测目标分支表示以避免坍缩;
- 目标分支通过 EMA 更新:;
- 跨重建器 与跨动态预测器 为辅助模块;
- 策略学习器采用 SAC,仅以 作为输入。
数据增强方面提出组合数据增强:以等概率从 Random Overlay(来自 Places 数据集)与 Random Convolution 中采样变换。
2.2 三个核心自监督目标
(1) 任务相关表示一致性(同一状态在不同域下内容应一致):
(2) 跨重建(用增强视图的内容 与原始视图的风格 跨域重建原始潜表示 ):
跨域设计迫使内容表示"纯净化"——若 中残留风格信息,会与 冲突导致重建失败。
(3) 跨动态预测(用增强内容 与动作 预测下一原始任务相关表示 ):
动态预测约束保证内容表示不仅与视觉外观无关,还必须能预测未来状态,从而真正"任务相关"。
总体目标函数:
训练时, 与 SAC 的 以 步交替优化,共同更新 。
2.3 理论分析
论文将 T2RD 目标与 bisimulation metric(双模拟度量)建立联系。bisimulation metric 定义为 Bellman-like 算子的不动点:
其中 为 1-Wasserstein 距离。Ferns 等人证明 。
论文论证: 强制状态不变性; 保证信息充分性并构成信息瓶颈; 是 Wasserstein 项的实用代理; 隐式建模奖励项。最终推导出动作价值函数误差上界:
3. 实验设计
3.1 评测基准
- DeepMind Control Suite Generalization Benchmark (DMControl-GB):5 个任务(Walker Walk、Walker Stand、Ball-in-cup Catch、Finger Spin、Cartpole Swingup)× 3 个测试设置(Color Hard、Video Easy、Video Hard);
- Robotic Manipulation:Reach 与 Peg-in-box 两个任务,每个任务 4 个测试环境(Test1–Test4)。
3.2 对比基线
9 种 SOTA 方法:DrQ、SODA、SVEA、TLDA、PIE-G、SGQN、BiT、TRP、ViSaRL(机器人任务中还包括纯 SAC)。
3.3 训练设置
DMControl-GB:训练 500k 步,每 10k 步评估(30 episodes 取均值),帧堆叠 3 帧后随机裁剪为 。
Robotic Manipulation:训练 500k 步,观测 ,50 步一回合。
4. 资源与算力
论文未明确披露所用 GPU 型号、数量、训练时长或算力开销。这部分信息的缺失对完整复现和成本评估构成一定限制。
5. 实验数量与充分性
论文实验较为充分,主要包括:
- 主结果表(DMControl-GB):5 任务 × 3 设置 × 10 算法 = 150 个数据点,每个结果基于 5 个不同种子,给出均值与标准差;
- 主结果表(Robotic Manipulation):2 任务 × 4 测试环境 × 7 算法 = 56 个数据点;
- 样本效率曲线:与 SGQN、BiT、TRP 在 5 个任务上对比;
- 消融实验:在 DMControl-GB 上分别移除 、、 三个模块;在 Robotic Manipulation 上进行三模块两两组合消融;
- 变体实验:替代重建分支、双重建分支、像素级重建、同域重建、同域预测、去除 EMA 等 6 类结构变体;
- 数据增强分析:单增强 vs. 组合增强的对比,以及组合增强在 6 个基线上的通用适用性验证;
- 采样概率 敏感性分析:;
- 可视化分析:t-SNE 聚类、跨重建可视化、注意力热力图。
整体来看,实验在多任务、多设置、多基线、多种子下进行,并辅以消融、变体与可视化分析,充分性与公平性较好。但 DMControl-GB "Visarl" 列存在较多缺测值("-"),影响横向比较。
6. 主要结论与发现
- 泛化性能 SOTA:在 DMControl-GB 15 个任务设置中取得 9 个最优,Cartpole Swingup Video Hard 比次优算法提升约 33%;Robotic Manipulation 8 个测试环境中取得 7 个最优,Peg-in-box 平均相对提升 57.1%,Reach 任务平均提升 40.1%;
- 样本效率最高:训练曲线在多数任务上收敛更快、渐近性能更高,且在未见测试环境同样保持;
- 解耦有效:t-SNE 显示同一状态的特征随训练逐步聚集、任务相关与任务无关特征逐渐分离;跨重建可视化表明可用 + 成功重建原始图像;
- 注意力聚焦准确:在多种背景干扰下,T2RD 都能准确聚焦任务相关区域;
- 动态预测是任务相关性的关键:移除 后性能下降最显著,凸显其将"内容"细化为"任务相关"的作用;
- 组合数据增强缓解泛化偏差:单一增强在 Color-Hard 与 Video 设置上各有强弱,组合增强在所有基线(含 T2RD)上带来更均衡的提升。
7. 优点
- 明确提出"任务相关 vs. 任务无关"解耦概念,区别于已有仅做内容—风格分离或前景—背景分割的方法,更契合 VRL 泛化需求;
- 完全自监督,无需配对数据集或人工标注(与多数 CV 解耦方法不同);
- 跨域重建 + 跨域动态预测设计巧妙,通过"交叉"约束迫使表示真正纯净化并任务相关;
- 理论联系清晰:将三个损失项对应到 bisimulation metric 的不变性、充分性、动力学成分,并给出 Q 函数误差上界;
- 与策略学习解耦:T2RD 作为表示学习模块可与任意 RL 算法结合(本文即与 SAC 结合);
- 组合数据增强简单有效,且分析深入(揭示了"泛化偏差"现象);
- 可视化充分:t-SNE、注意力图、跨重建图像共同验证解耦效果;
- 实验充分:多任务、多设置、多基线、多种子、多角度消融。
8. 不足与局限
- 可解耦假设的适用边界:方法假设观测可清晰分为"内容"与"风格",在任务相关线索与外观强耦合(如依赖地形纹理导航)的场景中可能将关键信息误判为无关;
- 算力信息缺失:未报告 GPU 型号、数量、训练时长等,限制了复现成本估算;
- Visarl 对比数据缺失:DMControl-GB 主表中 Visarl 多个任务结果为空("-"),削弱了与人类显著性引导方法的横向对比;
- 实证聚焦仿真:仅在 DMControl-GB 与仿真机器人任务上验证,未触及真实机器人,仿真—真实差距(光照、纹理、物体外观)是重要风险点;
- 基线依赖问题:尽管 T2RD 在多数任务领先,但在 Walker Stand Video Easy 等设置上并非全面最佳(如 PIE-G、SGQN 在某些项目更高),说明对预训练表征的依赖仍可能存在互补空间;
- SGQN 在引入组合增强后反而在 Video Hard 下降,提示对依赖显著性线索的方法而言,增加增强多样性可能引入干扰,这本身是值得关注的负面信号,但论文未对此深入讨论;
- 可解释性依赖可视化:任务相关/无关的判定最终通过 t-SNE 与注意力图定性验证,缺乏严格的量化指标。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。












