arXiv 2607.00483v2 · 发布 2026-07-01

VLM-AR3L:强化学习中用于绝对奖励与相对奖励的视觉-语言模型

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

AUTHORS Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu
EVIDENCE 利用视觉语言模型为强化学习设计奖励学习框架
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 02:31:23 UTC

📝 TLDR

强化学习中设计有效的奖励函数一直是核心难题,尤其在开放环境中任务目标抽象且难以量化。本文提出VLM-AR3L框架,利用视觉-语言模型同时提供绝对奖励与相对奖励信号。绝对奖励对单帧状态打分评估,相对奖励通过比较连续观测判断任务进展或退步。两者融合兼具状态评估的稳定性与对比监督的鲁棒性。在经典控制、操控及Minecraft等长视距具身任务中,该方法持续优于现有VLM奖励学习方法。

🧭 速览

动机

开放环境下RL任务目标抽象,手工奖励难以量化,亟需稳定鲁棒的自动奖励信号。

方法

利用VLM同时学习绝对奖励(单状态打分)与相对奖励(连续帧对比),融合两类监督。

结果

在经典控制、操控与Minecraft长视距具身任务上均优于现有VLM奖励学习方法。

结论

绝对与相对奖励的融合为开放环境强化学习提供了更稳定鲁棒的奖励建模方案。

📊 论文图表(共 12 张)

展开查看 12 张图

TL;DR

VLM-AR3L 框架通过同时学习绝对奖励与相对奖励信号来解决强化学习中奖励函数设计的难题。绝对奖励对单个状态打分评估,相对奖励通过比较连续观测判断任务进展,两者的融合兼具状态评估的稳定性与对比监督的鲁棒性。在涵盖经典控制、操控及 Minecraft 等长视距具身任务的评估中,该方法持续优于现有基于 VLM 的奖励学习方法,同时将 VLM 查询次数减少约 20 倍。

研究背景与动机

强化学习在奖励函数设计上长期面临瓶颈,尤其在开放式、视觉复杂的环境中。当任务目标以高层自然语言描述(如“建造庇护所”或“收集羊毛”),而非可量化的数值指标给出时,设计有效的奖励信号变得极为困难。传统方法各有局限:手工奖励依赖特权状态信息,难以扩展到真实场景;CLIP 类相似度奖励粒度粗糙且对提示词敏感,需要任务专属微调。

现有基于偏好学习的 VLM 奖励方法(如 RL-VLM-F)仅采用绝对奖励,存在两大固有缺陷。首先是训练不稳定问题:随着策略学习推进,智能体不断探索新状态,绝对奖励的全局标量值会发生剧烈漂移,导致策略无法收敛到预期行为。其次是全局序数失效问题:在具有循环结构或状态序数模糊的任务中(如 Minecraft 中可以反复探索不同区域),绝对奖励无法定义什么是“进步”。论文专门设计了 RingWorld 实验来验证这一点——在这个循环环境中,绝对奖励方法完全无法学习有效策略。

这些局限性促使作者思考:能否用对比的视角重新定义奖励信号,从而规避绝对评估的固有问题?

方法

VLM-AR3L 的核心思想是将绝对奖励与相对奖励相结合。绝对奖励模型对单个状态预测标量评估,提供稳定的全局参考;相对奖励模型比较连续观察来推断进展或倒退,具备更强的对比鲁棒性。两者共用同一个 VLM 查询流水线,仅需一次偏好标注即可训练两个模型。

在偏好建模层面,论文基于 Bradley-Terry 模型将偏好学习形式化。对于观测对 ,偏好概率表示为:

奖励模型通过最小化交叉熵损失训练,使预测的偏好概率与 VLM 生成的标签对齐。

绝对奖励模型的结构相对直接:,直接为每个状态输出一个标量值。

相对奖励模型采用孪生网络架构,学习比较函数 。为避免连续帧差异过小,论文引入时间偏移 ,比较 而非 。更重要的是,设计了对称置信校验机制来过滤 VLM 误判:

其中 为置信阈值。只有当双向预测一致且置信度均超过阈值时,才输出确定的奖励值,否则返回中性奖励。这种设计显著降低了错误偏好的影响。

最终,双奖励通过加权融合形成统一信号:

论文发现方法对超参数不敏感,在 多档取值下性能稳定,统一使用

实验与结果

实验在 4 个环境、10 个任务上进行,涵盖经典控制(Gym CartPole)、操控任务(SoftGym、MetaWorld)以及开放世界具身任务(MineDojo)。论文尤其关注 Minecraft 环境,因其视觉复杂性和长视野决策要求对方法构成严峻考验。

主实验对比了 7 种方法:VLM-AR3L(双奖励融合)、仅绝对奖励变体、仅相对奖励变体、RL-VLM-F(当前最先进的绝对偏好方法)、CLIP、MineCLIP,以及两个 Oracle(GT Dense 和 GT Sparse)。结果显示,VLM-AR3L 在所有任务上均达到最佳或接近最佳性能。值得注意的是,在 Milk Cow、Shear Sheep、Hunt Cow 等任务中,VLM-AR3L 显著超越了 GT Sparse Oracle 的表现,甚至接近 GT Dense Oracle。

消融实验揭示了几个关键发现。双奖励融合的优势在于绝对与相对奖励的互补性:绝对奖励在状态序数明确的任务中提供稳定的全局评估,相对奖励在循环结构或长视距任务中展现鲁棒性。RingWorld 实验中,仅相对奖励方法成功学习,而绝对奖励方法完全失败。孪生网络架构相比直接 VLM 查询不仅节省了约 20 倍的 VLM 调用次数,还学到了更鲁棒的比较函数。

VLM 选择对性能影响显著。Gemini-2.0-Flash 在所有任务上标注准确率均超过 70%,是最稳定的选择;Phi-3.5、MiniCPM-o 2.6 等开源 VLM 在特定任务上表现优异,但在其他任务上波动较大。

讨论与可借鉴点

VLM-AR3L 首次明确指出了绝对奖励在循环和长视距任务中的固有缺陷,并提出相对奖励作为系统性解决方案。这一思想对强化学习领域具有启发意义:在无法定义全局序数的任务中,比较监督比绝对评估更为可靠。

然而,该方法对 VLM 标注质量的强依赖仍是主要局限。若 VLM 偏好预测持续错误,奖励信号会被错误传播。论文虽然评测了多种 VLM,但仅 Gemini-2.0-Flash 整体表现稳定,开源 VLM 在多数任务上仍有较大波动。此外,单帧偏好(H=1)的设计可能损失时序信息,论文坦承多图或视频级 VLM 推理在复杂视觉环境中尚不可靠。

从实践角度看,该方法具有较强的可复现性:单卡 RTX 3090 即可运行,单 seed 实验在 24 小时内完成,共用超参数无需任务专属调优。孪生网络设计避免了 rollout 时反复调用 VLM,使计算成本大幅降低。

未来方向可聚焦于:提升开源 VLM 的标注质量以实现更公平的基线对比;探索多帧输入的相对奖励建模以捕获更丰富的时序信息;以及设计偏见检测机制以应对 VLM 标注偏见传导至 RL 智能体的风险。

摘要

设计有效的奖励函数仍然是强化学习(RL)中的一项重大挑战,尤其是在任务目标抽象且难以量化的开放式环境中。在本文中,我们提出了 VLM-AR3L,一个利用视觉-语言模型(VLM)为强化学习同时提供绝对奖励和相对奖励的框架。VLM-AR3L 在自然语言任务目标的语境下解释智能体的视觉观察,并从 VLM 生成的偏好标签中学习绝对奖励和相对奖励。绝对奖励模型对单个状态预测标量评估,而相对奖励模型则比较连续观察以推断相对于任务目标的进展或倒退。二者的融合将基于状态评估的稳定性与比较监督的鲁棒性相结合。我们在涵盖经典控制、操控任务以及开放世界具身任务的基准上对 VLM-AR3L 进行了评估,并鉴于其视觉复杂性和长视野决策要求,特别聚焦于 Minecraft。实验结果表明,VLM-AR3L 持续优于以往的基于 VLM 的奖励学习方法。

Abstract

Designing effective reward functions remains a major challenge in reinforcement learning (RL), particularly in open-ended environments where task goals are abstract and difficult to quantify. In this work, we present VLM-AR3L, a framework that leverages Vision-Language Models (VLMs) to provide both absolute and relative rewards for RL. VLM-AR3L interprets an agent's visual observations in the context of a natural language task goal, and learns both absolute and relative rewards from VLM-generated preference labels. The absolute reward model predicts scalar evaluations for individual states, while the relative reward model compares consecutive observations to infer progress or regression toward the task goal. Their integration combines the stability of state-based evaluation with the robustness of comparative supervision. We evaluate VLM-AR3L across benchmarks spanning classic control, manipulation, and open-world embodied tasks, with a particular focus on Minecraft given its visual complexity and long-horizon decision-making requirements. Experimental results show that VLM-AR3L consistently outperforms prior VLM-based reward learning methods.


论文详细总结(自动生成)

VLM-AR3L 论文总结

1. 核心问题与研究动机

强化学习(RL)在奖励函数设计上长期面临瓶颈,尤其在开放式、视觉复杂的环境中(如 Minecraft),任务目标通常以高层自然语言描述(例如"建一个庇护所"),难以手工量化奖励信号。传统做法存在以下问题:

  • 手工奖励依赖特权状态信息,难以扩展;
  • LLM 奖励多用于文本/编程式环境,在高维视觉域中受限;
  • CLIP 类相似度奖励粒度粗糙、对提示词敏感,需要任务专属微调;
  • 现有偏好奖励方法(如 RL-VLM-F)仅采用绝对奖励(absolute reward),存在两大固有缺陷:

1. 训练不稳定:随着训练进行,新状态不断出现,全局标量值会剧烈漂移(见论文 Fig.1);

2. 全局序数失效:在循环结构或状态序数模糊的任务中(如 RingWorld),绝对奖励无法定义全局进度(见论文 Fig.2)。

因此,本文核心问题是:如何利用 VLM 在不依赖特权信息、无需手工奖励的前提下,为开放环境 RL 提供稳定、鲁棒且可扩展的奖励信号?


2. 方法论

2.1 整体框架

VLM-AR3L(见论文 Fig.3)包含两条交织的训练流程:

  • 奖励模型训练(蓝色路径):从经验回放池采样观测对 与语言目标 ,送入冻结的 VLM 生成偏好标签 ,分别用于监督绝对奖励模型相对奖励模型
  • 策略学习(紫色路径):绝对模型对当前观测打分,相对模型对比当前与过去观测 ,共同为策略提供稠密奖励。

2.2 偏好建模基础

将偏好学习形式化为 POMDP 中的偏好强化学习(pbRL)。设段长度 (单帧),基于 Bradley-Terry 模型给出偏好概率:

奖励模型通过最小化交叉熵损失训练:

2.3 绝对奖励模型(Absolute Reward)

直接为单个状态分配标量值:

2.4 相对奖励模型(Relative Reward)

采用孪生网络(Siamese Network)学习比较函数 。为避免连续帧差异过小,引入时间偏移 ,比较 。并设计对称置信校验

其中 为置信阈值。

2.5 双奖励融合

将两类奖励加权融合:

其中 为绝对奖励权重系数。两者共用同一个 VLM 查询流水线,仅需一次偏好标注即可训练两个模型。


3. 实验设计

3.1 环境与任务

4 个环境、10 个任务上进行评估,覆盖结构化控制到开放世界具身任务(论文 Fig.4):

环境任务
GymCartPole
SoftGymStraighten Rope, Pass Water
MetaWorldSoccer, Sweep Into, Drawer Open
MineDojoCombat Spider, Milk Cow, Shear Sheep, Hunt Cow

策略优化算法:Gym/SoftGym/MetaWorld 使用 SAC;MineDojo 使用 PPO。

3.2 对比基线

  • RL-VLM-F:当前最先进的偏好奖励方法(绝对奖励);
  • CLIP(ViT-L/14@336px):基于余弦相似度;
  • MineCLIP(Attn):在 Minecraft 视频上微调的 CLIP 变体;
  • GT Dense(Oracle):人工设计的稠密奖励;
  • GT Sparse(Oracle):仅终止时的成功/失败信号。

3.3 评测维度

  • VLM 标签准确率(Table 1):对比 Gemini-2.0-Flash、GPT-4.1-nano、Phi-3.5、DeepSeek-VL2、Qwen2.5-VL、InternVL2.5、Gemma-3、MiniCPM-o-2.6、CLIP、MineCLIP 等;
  • 任务成功率(Table 2):3 个随机种子、每 checkpoint 评测 5 episode;
  • 学习曲线(Fig.5);
  • 消融实验:VLM 选择、相对奖励架构、双奖励融合、超参数()。

4. 资源与算力

  • GPU 型号:主要使用 NVIDIA L40(48GB),并验证可在 RTX 3090(24GB) 上复现;
  • VLM 推理硬件(Table 4):RTX 3090,float16,batch=1;如 Gemini-2.0-Flash 通过 API 调用(不占本地算力);
  • 训练时长:单 seed 实验可在 24 小时内完成;
  • 算力节省:相对奖励通过训练孪生网络实现,相比 rollout 时直接调用 VLM(VLM-Direct),VLM 查询次数减少约 20×

注意:论文未明确说明总实验量及总体 GPU 小时数,仅给出单实验时间预算。


5. 实验数量与充分性

论文实验规模较大,覆盖较广:

  • 10 个任务 × 7 种方法(含 Oracle)的主对比(Table 2);
  • 10 种 VLM × 10 任务的标注准确率评测(Table 1);
  • 5 种 prompt 设计(S1, S2, S2+CoT, S1_2, S2_2)的对比(Table 3);
  • 3 种 VLM(Gemini-2.0, Phi-3.5, MiniCPM-o 2.6)的端到端 RL 性能消融(Fig.6, Fig.11, Table 15);
  • 3 种相对奖励架构的消融:Siamese、VLM-Direct、Abs-Diff、Siamese w/o Sym(Fig.7);
  • 3 种奖励变体的消融:绝对、相对、双奖励(Fig.8, Fig.12);
  • 超参数扫描(0–1)、(多种偏移)、(Fig.9, Fig.10);
  • 论文统一使用一组超参数(),不进行任务专属调优。

总体而言,实验在任务多样性、VLM 多样性、消融维度三方面均较为充分,且采用了多随机种子以减小方差,结果较为客观。但仍存在以下公平性考量:VLM 选用对结果影响显著,论文主要用 Gemini-2.0(商用 API),可能与开源 VLM 基线的对比存在标注质量优势。


6. 主要结论与发现

1. 双奖励的互补性:绝对奖励擅长全局序数明确的任务,相对奖励擅长循环/长视距/模糊序数任务,二者融合在所有任务上均达到最佳或接近最佳。

2. 相对奖励的稳定性:相对奖励在训练中具有时间一致性(Fig.1),绝对奖励随训练漂移严重。

3. RingWorld 实验:在循环任务中,绝对奖励完全失败,相对奖励成功学习(Fig.2)。

4. Siamese 相对模型优于直接 VLM 查询:避免了 rollout 时反复 VLM 推理,同时学到了更鲁棒的比较函数。

5. VLM 选择的关键性:Gemini-2.0-Flash 在所有任务上标注准确率均 >70%;Phi-3.5、MiniCPM-o 2.6 等开源 VLM 在特定任务上表现优异。

6. 超越手工奖励:在 Milk Cow、Shear Sheep、Hunt Cow 等任务上,VLM-AR3L 显著超过 GT Sparse Oracle,甚至接近或匹配 GT Dense Oracle。

7. 方法对超参数不敏感:在 多档取值下性能稳定。


7. 优点与亮点

  • 方法创新:首次明确指出绝对奖励在循环/长视距任务中的固有缺陷,并提出相对奖励作为系统性解决方案;
  • 对称置信校验:通过双向偏好过滤,显著降低了 VLM 误判带来的噪声奖励;
  • 计算高效:训练一次孪生网络即可在 rollout 时避免重复 VLM 查询(节省约 20× 调用);
  • 广泛基准覆盖:涵盖结构化控制、操控、开放世界具身任务,统一框架普适性强;
  • 公平对比:所有基线均在相同的观测模态、prompt 工程、训练协议下评测;
  • 细致的消融研究:从 VLM 选择、网络架构、双奖励融合到超参数进行了多维分析;
  • 可复现性强:单卡 RTX 3090 即可运行,单 seed 24h 内完成,提供了详细的网络结构(Table 5, 9, 10)与训练配置;
  • 社会影响讨论(Appendix F):明确指出偏见传播、潜在滥用等风险并给出缓解建议。

8. 不足与局限

  • 对 VLM 标注质量的强依赖:若 VLM 偏好预测错误,奖励信号会被错误传播;尽管论文评测了多 VLM,但仅 Gemini-2.0-Flash 整体最稳定,开源 VLM 在多数任务上仍有较大波动;
  • 单帧偏好()的局限:作者明确指出多图/视频级 VLM 推理在复杂视觉环境中尚不可靠,因此只能做单帧比较,可能损失时序信息;
  • 特权信息的隐含依赖:VLM 在标注时仍可能受到视觉遮挡、小目标识别等限制,与真实"无特权"场景仍有差距;
  • 任务集合偏向 MineDojo:10 个任务中有 4 个来自 Minecraft,且其中部分(如 Combat Spider, Hunt Cow)实际可能需要组合技能,论文未讨论这些任务中 VLM 标注的真实可靠性(如战斗过程是否被正确识别);
  • 商业 VLM 的公平性问题:主实验选用 Gemini-2.0-Flash(商用强 VLM),与开源 VLM 基线(如 CLIP、MineCLIP)相比存在能力差距,可能放大本文方法相对优势;
  • Oracle 设计的局限性:GT Dense Oracle 本身可能不是最优奖励,因此"超越 Oracle"的结论需谨慎解读;
  • 稀疏奖励任务的稀疏性:在 Milk Cow 等任务中 GT Sparse 失败主要因奖励过于稀疏,但 VLM-AR3L 的成功是否真正依赖了 VLM 的世界知识而非偏好判断,未做更深入分析;
  • 未提供理论保证:缺乏对双奖励收敛性、最优策略性质的正式分析;
  • 偏见与安全风险(Appendix F 自陈):VLM 的标注偏见可能传导至 RL 智能体,论文未提出具体的偏见检测或对齐机制;
  • 未报告总体算力消耗:如总 GPU 小时数、API 调用成本等,影响可复现性评估。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记