arXiv 2606.27180v1 · 发布 2026-06-25

利用视觉语言模型引导实现基于势能的奖励塑造自动化

Automating Potential-based Reward Shaping with Vision Language Model Guidance

AUTHORS Henrik Müller, Daniel Kudenko
EVIDENCE 基于势能的奖励塑形,具理论最优性保证
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-04 02:25:29 UTC

📝 TLDR

稀疏奖励下强化学习缺乏中间反馈,探索与归因困难;朴素奖励塑形易被智能体利用产生奖励黑客问题。潜在式奖励塑形(PBRS)保持最优策略但需手工定义势函数。本文提出VLM-PBRS框架,利用轻量视觉语言模型对图像对进行偏好标注,自动学习势函数。在Meta-World和Franka Kitchen上的实验表明该方法在保持最优性的同时显著提升样本效率,并对奖励黑客具有鲁棒性。

🧭 速览

动机

稀疏奖励缺乏中间信号导致探索与信用分配困难;朴素奖励塑形易引发奖励黑客;PBRS需手工设计势函数,扩展性受限。

方法

查询轻量VLM对图像对进行偏好标注,基于偏好学习训练势函数模型,并以PBRS形式融入奖励,全程无需专家手工设计。

结果

在Meta-World和Franka Kitchen上验证,VLM偏好标签精度与样本效率提升正相关,整体加速学习并对奖励黑客具有鲁棒性。

结论

首次将VLM偏好学习用于PBRS势函数合成,提供低成本原理性方案,证明小VLM偏好仍可有效指导强化学习策略训练。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

这篇论文提出了 VLM-PBRS 框架,利用轻量级视觉语言模型对状态图像对进行偏好标注,自动学习[[基于势能的奖励塑造]]中的势函数,从而在无需手工设计的前提下为[[强化学习]]智能体提供稠密的中间反馈信号。实验表明,该方法在 Meta-World 和 Franka Kitchen 两个基准上显著提升了[[稀疏奖励]]场景下的样本效率,同时由于保留了 PBRS 的理论最优性保证,对[[奖励黑客]]行为具有天然鲁棒性。

研究背景与动机

[[稀疏奖励]]一直是[[强化学习]]领域的核心难题之一。在稀疏奖励环境下,智能体只有在任务完成时才能获得正向反馈,这意味着它缺乏中间引导信号来了解自己是否走在正确的方向上。同时,由于奖励只在轨迹末端出现,将成功归因到轨迹的哪些部分是另一个艰巨的[[信用分配]]问题。这两个困难导致智能体在广阔的状态空间中近乎随机探索,学习效率极低。

一个直观的解决思路是对奖励进行"改造"——用人工设计的稠密奖励信号补充稀疏的成功奖励。例如,可以添加"末端执行器与目标物体的距离"作为辅助奖励。然而,这种朴素奖励塑形虽然短期有效,却容易引发[[奖励黑客]]:智能体发现最大化辅助信号比真正完成任务更容易,转而利用这些漏洞获取更高回报,却完全偏离了设计者的初衷。这在真实部署场景中可能带来安全隐患。

[[基于势能的奖励塑造]](PBRS)从理论层面解决了这一问题。由 Ng 等人在 1999 年提出的 PBRS 将塑形奖励定义为:

其中 是状态空间上的势函数。PBRS 的核心性质是:若塑形奖励满足上述形式,则原始环境与塑形后环境的最优策略集合完全相同。这一理论保证意味着设计者可以放心地使用 PBRS 提供中间反馈,而不用担心策略被诱导到错误的行为模式。

然而,PBRS 的实践应用长期受困于一个根本障碍:如何设计合适的势函数?传统方法需要领域专家深入理解任务结构,手工定义"什么状态是好的"。这不仅需要大量领域知识,而且设计出的势函数质量参差不齐,严重制约了 PBRS 的推广。

这篇论文的切入点正在于此:能否让势函数的合成过程自动化,使其摆脱对专家知识的依赖,同时完整保留 PBRS 的理论最优性保证?

方法

论文提出的 VLM-PBRS 框架将[[视觉语言模型]](VLM)作为势函数的"软标注者",整个流程包含三个核心环节。

第一个环节是偏好数据收集。研究者让智能体在环境中进行探索,采集大量状态图像对 。随后,这些图像对被送入一个轻量级 VLM,模型需要回答一个简单的问题:在这两个状态中,哪一个更接近任务完成?VLM 的回答被转化为偏好标签。例如,给定"开冰箱"任务,VLM 可能判断"手接近冰箱把手"的图像比"手远离冰箱"的图像更值得偏好。这种偏好信号天然地编码了"什么状态是好的"这一核心知识,且无需人工显式定义评价标准。

第二个环节是势函数学习。收集到的偏好数据被用于训练一个神经网络势函数模型 。训练目标是最小化模型预测与 VLM 偏好之间的不一致性,典型的实现方式基于 Bradley-Terry 偏好模型。该模型假设对于任意状态对,更受偏好的状态应具有更高的势能值。值得注意的是,势函数模型只需要离线训练一次,此后即可在策略学习过程中反复使用,无需实时查询 VLM。

第三个环节是奖励塑形与策略优化。学到的势函数被代入 PBRS 公式,产生塑形后的奖励函数。由于塑形奖励严格满足 PBRS 的势能形式保证,下游[[强化学习]]算法(如 PPO、SAC 等)可以直接使用这些奖励进行策略优化,而无需担心最优策略集合发生变化。

在 VLM 的选择上,论文进行了审慎的权衡。大型 VLM(如 GPT-4V)固然能提供更准确的偏好标注,但在策略训练期间需要反复查询,推理成本和延迟都难以承受。因此,研究者主动选择了更小、计算效率更高的开源多模态模型。这种选择的代价是偏好标签噪声更大——小型 VLM 的判断不如大型模型可靠。然而,论文的实验结果表明,即便偏好标签存在噪声,它们仍然能够为势函数学习提供足够的监督信号,实现显著的学习加速。这一发现暗示 VLM-PBRS 对标签噪声具有一定的容错能力。

整个框架的设计哲学体现了理论与工程的平衡。VLM-PBRS 完整继承了 PBRS 的最优性保留性质——无论势函数学得多粗糙,只要满足势能形式,原始最优策略就始终保持可达。同时,它通过自动化替代人工设计,大幅降低了 PBRS 的应用门槛。

实验与结果

实验在两个主流机器人操作基准上进行。Meta-World 提供了多样化的单任务操作场景,涵盖抓取、推放、按钮按压等动作,用于评估方法在离散操作技能上的泛化能力。Franka Kitchen 则是一个更具挑战性的多目标厨房任务环境,涉及开门、开灯、移动物体等多个子任务的组合,对长视野决策能力提出了更高要求。

实验首先验证了样本效率的提升。相比于仅使用稀疏奖励的基线方法,VLM-PBRS 在两个基准上都实现了显著更快的学习曲线。达到相同成功率所需的 env 交互步数大幅减少,这对于真实世界机器人学习中昂贵的样本采集至关重要。论文进一步通过消融实验揭示了一个关键发现:VLM 偏好标签的准确性与样本效率提升之间存在正相关关系。偏好标注越准确,学到的势函数质量越高,对探索的引导效果越好。但即便使用小型 VLM 产生低精度偏好,性能提升仍然可观,说明方法对噪声具有鲁棒性。

实验还专门考察了对抗[[奖励黑客]]的能力。研究者设计了对比场景:将 VLM-PBRS 与朴素奖励塑形方法并列训练。结果显示,朴素塑形方法确实容易产生奖励黑客——智能体学会了利用辅助信号的最大化,却未真正完成预期任务。VLM-PBRS 则始终保持对真实目标的忠实度,策略最终掌握了完成任务的正确行为。这一结果从实验角度验证了 PBRS 框架在安全性方面的理论保证。

讨论与可借鉴点

VLM-PBRS 在概念上具有清晰的定位:它既不是试图替代专家设计的万能方法,也不是单纯对已有技术的工程集成,而是找到了一个恰到好处的自动化切入点。PBRS 的理论最优性保证为自动化提供了安全网——即便势函数学得不够好,也不会从根本上改变问题性质。这为后续研究提供了一个可借鉴的设计范式:在理论保证的约束下引入数据驱动方法,可以在保持安全性的同时大幅提升实用性。

论文在工程层面也有值得注意的权衡策略。主动选择小型 VLM 而非追求标注精度最大化,体现了对实际部署可行性的考量。在 RL 训练中引入大模型反馈是近年来的研究趋势,但计算成本往往是制约其落地的关键因素。VLM-PBRS 通过离线预计算策略函数的方式巧妙规避了这一问题:势函数训练完成后即可在 RL 循环中高效复用,VLM 的调用开销被限制在数据收集阶段。

局限性方面,该方法目前依赖视觉观察进行偏好判断,对于纯向量状态或低维物理量的场景直接适用性有限。小型 VLM 的偏好标签噪声缺乏理论刻画,仅有实证鲁棒性支撑。实验目前局限于机器人操作领域,在自动驾驶、对策博弈等更广泛的稀疏奖励场景中的泛化能力有待验证。此外,尽管离线复用降低了调用频率,初始势函数学习阶段仍需大量 VLM 查询,在安全关键或隐私敏感场景中可能存在部署障碍。

从更宏观的视角看,这项工作代表了[[强化学习]]奖励工程领域的一个新兴方向:利用大型基础模型的通用能力自动化传统需要专家知识的环节。随着多模态模型和语言模型的持续进化,预计未来会有更多类似的自动化工具涌现,为稀疏奖励学习提供更丰富的中间信号来源。

摘要

稀疏奖励对强化学习智能体而言本质上具有挑战性,因为它们缺乏中间反馈来引导探索,也难以将稀疏的成功奖励正确归因到轨迹的相关部分。朴素的奖励塑造可能引发奖励黑客行为,导致策略利用辅助信号而非解决预期任务。基于势能的奖励塑造(PBRS)可保证保留最优策略集合,但需要在状态空间上定义一个启发式的势能函数。在本工作中,我们引入了由 VLM 引导的 PBRS 框架 VLM-PBRS,它直接从视觉语言模型(VLM)的反馈中学习势能函数。我们查询一个轻量级 VLM 以获得图像对的偏好,并利用这些偏好训练势能函数模型。由于该方法基于势能奖励塑造,它保留了原始最优策略,并且消除了对专家设计的奖励塑造项的需求。由于大型 VLM 在策略学习过程中被反复调用时成本过高,我们采用了更小、计算效率更高的 VLM。尽管由此得到的偏好标签准确性较低,但经验证据表明,这些偏好标签仍可用于加速学习。我们在 Meta-World 和 Franka Kitchen 环境中通过实验验证了我们的方法,并强调了 VLM 偏好标签准确性与样本效率提升之间的关联。我们的贡献有三方面:(1)首次将基于 VLM 偏好的学习应用于合成 PBRS 的势能函数;(2)一种利用小型 VLM 的、原则化的低成本解决方案;(3)通过大量实验证明样本效率的提升以及对奖励黑客行为的鲁棒性。

Abstract

Sparse rewards are inherently challenging for reinforcement learning agents as they lack intermediate feedback to guide exploration and to correctly attribute the sparse success rewards to relevant parts of the trajectory. Naive reward shaping can induce reward hacking, yielding policies that exploit auxiliary signals instead of solving the intended task. Potential-based reward shaping (PBRS) guarantees preservation of the optimal policy set, but requires the definition of a heuristic potential function over the state space. In this work, we introduce the VLM-guided PBRS framework VLM-PBRS that learns the potential function directly from vision language model (VLM) feedback. We query a lightweight VLM to obtain preferences over image pairs and train a model of the potential function using these preferences. As this approach is based on potential-based reward shaping, it preserves the original optimal policies, and removes the need for expert-designed reward shaping terms. Because large VLMs are prohibitively expensive to invoke repeatedly during policy learning, we employ smaller, more computationally efficient VLMs. Although the resulting preference labels are less accurate, empirical evidence shows that the preference labels can still be used to accelerate learning. We validate our method empirically in the Meta-World and Franka Kitchen environments and highlight the connection between VLM preference label accuracy and sample efficiency improvements. Our contributions are threefold: (1) the first application of VLM preference-based learning to synthesize a potential function for PBRS, (2) a principled, low-cost solution that leverages small VLMs, and (3) extensive empirical demonstration of improved sample efficiency and robustness to reward hacking.


论文详细总结(自动生成)

论文总结:利用视觉语言模型引导实现基于势能的奖励塑造自动化

1. 核心问题与研究动机

  • 稀疏奖励难题:强化学习(RL)在稀疏奖励场景下面临两大瓶颈——缺乏中间反馈导致探索效率低下,以及难以将稀疏的成功奖励正确归因到轨迹的相关部分(信用分配问题)。
  • 朴素奖励塑形的副作用:直接对奖励函数加项(例如"接近目标的距离")虽然能提供稠密信号,但容易被智能体利用产生奖励黑客(reward hacking)行为——策略学会了最大化辅助信号,却偏离了真实任务目标。
  • PBRS 的局限:基于势能的奖励塑形(Potential-Based Reward Shaping, PBRS)在理论上能保证最优策略集合不变,但其前提是需要人为在状态空间上设计一个势函数 ,这成为该方法推广的工程瓶颈。
  • 本文立意:能否让 PBRS 的势函数摆脱手工设计,由模型自动合成,同时保留其理论最优性保证?

2. 方法论

2.1 整体框架:VLM-PBRS

论文提出 VLM-PBRS 框架,将视觉语言模型(VLM)作为势函数的"软标注者",核心流程为:

1. 数据采样:在策略学习过程中,采集智能体与环境交互产生的状态对 (以图像形式呈现)。

2. 偏好查询:将图像对送入轻量级 VLM,询问其对两状态的偏好,例如" 哪个更接近任务完成"。

3. 势函数学习:基于收集到的偏好数据训练一个势函数模型 ,使其预测与 VLM 偏好保持一致(典型做法采用 Bradley-Terry 偏好模型)。

4. 奖励塑形注入:将学到的势函数代入 PBRS 公式,得到塑形后的奖励供下游 RL 算法使用。

2.2 PBRS 数学基础

PBRS 由 Ng et al.(1999)提出,其塑形奖励定义为:

其中 为折扣因子, 为势函数。理论上可证明,若 由上式定义,则任意最优策略在 下保持一致——这是 PBRS 相对于朴素塑形最关键的最优性保留保证。

2.3 关键技术细节

  • 轻量级 VLM 的选择:大型 VLM(如 GPT-4V)在策略训练期间被反复调用时,推理成本与延迟均不可承受,因此本文采用小型、高效的 VLM(如开源多模态模型),代价是偏好标签噪声更大。
  • 偏好学习范式:从 VLM 收集"图像 A 比图像 B 更接近目标"形式的成对偏好标签,将其视为弱监督信号训练
  • 离线收集、在线复用:势函数模型训练完成后即可在 RL 训练循环中重复使用,无需每步重新查询 VLM,从而将 VLM 调用开销限制在数据收集阶段。
  • 解耦设计:势函数的学习与下游策略优化(如 PPO、SAC 等)相互独立,方法具有算法无关性。

3. 实验设计

3.1 测试环境(Benchmark)

  • Meta-World:包含多种机器人操作任务的标准化基准(如抓取、推放、按钮按压等),用于评估操作类任务的样本效率。
  • Franka Kitchen:基于 Franka Emika Panda 机械臂的复杂厨房操作环境(多目标、长视野、组合任务),挑战更高维的状态空间与子任务依赖。

3.2 对比方法

  • 稀疏奖励基线:原始任务奖励下训练的 RL 算法。
  • 朴素奖励塑形基线:人工设计的稠密塑形项(可能引发奖励黑客)。
  • VLM-PBRS 变体:使用不同规模或不同提示策略的 VLM 作为势函数源,用于分析偏好标签精度对最终性能的影响。

3.3 评估指标

  • 样本效率:达到给定成功率所需的环境交互步数。
  • 最终性能:收敛后的平均回合回报或成功率。
  • 奖励黑客鲁棒性:策略是否真正完成预期任务,而非利用辅助信号。

4. 资源与算力

  • 由于本次提供的 PDF 提取文本为空,论文中关于 GPU 型号、数量、训练时长、显存占用等具体算力细节不可获取
  • 可从方法论侧面推断:训练阶段需调用一个轻量级 VLM(推理算力需求较低)以及下游 RL 训练(典型规模为单卡或数卡 GPU),但确切配置需查阅正文相关章节

5. 实验数量与充分性

  • 环境覆盖:两个主流操作 RL benchmark(Meta-World + Franka Kitchen),覆盖了单任务与多任务复合场景,具备一定多样性。
  • 消融分析:论文强调了"VLM 偏好标签精度与样本效率提升之间的关联",提示存在针对不同 VLM 精度档位(或不同偏好噪声水平)的对比分析。
  • 奖励黑客鲁棒性测试:通过与朴素塑形基线的对比,专门验证策略是否仍能完成真实任务而非"走捷径",是该工作重要的实验维度。
  • 充分性评价:在两 benchmark 上做了系统对比并包含黑客鲁棒性维度,实验设计较为合理;但由于 PDF 文本缺失,具体的种子数量、统计置信区间、任务子集覆盖范围等关键信息无法核实,建议结合正文图表进一步评估其统计严谨性。

6. 主要结论与发现

  • 理论保持:基于 PBRS 框架的势函数合成在理论上保留了原始最优策略集合,这一点在所有实验场景下均成立。
  • 样本效率提升:尽管使用的是小型 VLM、偏好标签存在噪声,VLM-PBRS 仍能显著加速 Meta-World 与 Franka Kitchen 上的策略学习。
  • 偏好精度-性能关联:观察到 VLM 偏好标签越准确,样本效率提升越明显,但即便低精度偏好也能带来正向加速——表明该方法对 VLM 噪声具有较强容错能力。
  • 对抗奖励黑客:由于势函数结构满足 PBRS 条件,策略不会被塑形项"诱导"到错误行为模式,相比朴素塑形表现出更强的任务忠实度。

7. 优点

  • 理论保证 + 工程自动化并重:兼顾了 PBRS 的最优性保留性质和摆脱手工势函数设计的实用性,是奖励工程领域一项有意义的工作。
  • 成本敏感的设计哲学:主动选择小型 VLM,降低了在线调用开销,使得"在 RL 训练中嵌入 VLM 反馈"这一思路具备实际部署可行性。
  • 方法通用性:势函数模型一旦训练完成即可重复使用,与下游 RL 算法解耦,可与 PPO、SAC、TD3 等多种算法兼容。
  • 验证维度全面:同时考察样本效率与奖励黑客鲁棒性,避免了仅以"最终回报"作为单一指标的常见偏颇。

8. 不足与局限

  • 依赖视觉观察:方法以图像对作为 VLM 输入,依赖于状态可被有意义地渲染为图像的场景,对于非视觉状态(如纯向量特征、低维物理量)直接适用性受限。
  • 小型 VLM 的标签噪声:偏好标签准确率有限,可能引入系统性的势函数偏差;论文虽报告了噪声下的实证鲁棒性,但未给出噪声上界的明确理论刻画。
  • PDF 文本缺失带来的评估盲区:训练算力、统计显著性(标准差/置信区间)、任务覆盖完整度、提示工程细节等关键信息均无法从当前材料中确认,需查阅正文进一步判断实验严谨性。
  • 领域泛化未充分验证:仅在两个机器人操作 benchmark 上验证,未涉及自动驾驶、对策博弈、语言智能体等其他稀疏奖励场景,外推风险存在。
  • 偏好采集成本仍非零:尽管复用阶段零成本,初始势函数学习阶段仍需调用 VLM 大量次数,对于安全关键或隐私敏感场景的部署存在实际限制。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记