CoRe:结合视觉-语言模型反馈的组合奖励用于偏好对齐的强化学习
CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning
📝 TLDR
强化学习中手工奖励难以精确刻画、基于偏好的奖励学习效率低且训练不稳定。本文受认知科学双通道学习启发,将奖励拆解为基于任务知识的形式化奖励与从观测中学习的残差奖励,提出CoRe框架。该框架结合形式化奖励模块与残差奖励模块,借助视觉语言模型反馈自动构建可靠奖励,无需人类参与。在10个仿真机械臂操作任务与5个真实任务上,CoRe在策略学习效果与效率上均优于现有方法。
🧭 速览
手工奖励难以精确设计,基于偏好的奖励学习效率低且训练不稳定,亟需兼顾任务知识与隐式偏好的奖励方案。
将奖励分解为基于任务知识的Formal Reward和基于VLM视频偏好学习的Residual Reward,由FRM与RRM协同自动迭代构建奖励。
在10个仿真机械臂操作任务和5个真实任务上,CoRe在策略学习效果与效率上均优于现有方法。
CoRe通过形式化与残差奖励的协同及VLM反馈,实现了无人类参与下高效且对齐人类偏好的奖励自动构建。
📊 论文图表(共 80 张)
展开查看 80 张图
TL;DR
强化学习中奖励函数设计是核心瓶颈:人工指定奖励难以精确刻画任务,容易导致奖励黑客;基于偏好的奖励学习方法则需要大量人类标注、训练不稳定。本文提出 CoRe 框架,将奖励解耦为基于任务知识的形式奖励与从观测中学习的残差奖励两部分,并借助视觉-语言模型自动生成偏好标签与重要性权重,实现无需人类参与的自动化奖励构建。在 10 个仿真机械臂操作任务和 5 个真实机器人任务上,CoRe 达到了 99.0% 的平均成功率,显著优于现有方法,同时将偏好标注成本降低了 3 到 40 倍。
研究背景与动机
强化学习在游戏 AI、自动驾驶、机器人操作等领域已取得令人瞩目的进展,然而一个根本性的难题始终横亘在研究与落地之间——奖励函数的设计。理想情况下,奖励函数应当精确反映任务目标,引导智能体习得期望的行为策略。但在实践中,这一目标往往难以达成。
手工设计奖励是最直观的方案:领域专家根据任务特点编写奖励规则,例如机械臂抓取任务中“夹爪与物体距离缩短则给予正向奖励”。然而这种方法面临多重困境。首先,专家知识难以覆盖任务的全部细节,奖励信号往往只能捕捉粗粒度的任务进度,无法表达细粒度的操作偏好——是轻柔放置还是快速释放?用锤柄击打还是锤头击打?其次,当奖励函数与真实目标存在偏差时,智能体可能找到“钻空子”的策略,即所谓[[奖励黑客]]现象:夹爪从未真正抓取物体,只是持续靠近并获得距离奖励;锤头任务中策略被引导至挥舞锤柄而非正确使用锤头。这些现象表明,手工奖励的表达力与真实意图之间存在难以弥合的鸿沟。
为了避免手工设计奖励的主观性与不完整性,研究者转向从人类反馈中学习奖励的范式,即[[基于偏好的强化学习]](Preference-based RL, PbRL)。这类方法让人类直接比较轨迹片段的优劣,从偏好数据中推断奖励函数,从而实现与人类意图的对齐。但PbRL同样存在显著缺陷:收集偏好标注需要大量人力成本,反馈效率低下;奖励学习与策略优化的耦合使得训练过程不稳定;更为关键的是,如何将视频级、片段级的偏好信号分配到具体状态-动作对上,是一个尚未良好解决的信用分配难题。
近年来,大语言模型与视觉-语言模型的发展为自动奖励构建提供了新的可能性。研究者尝试让 LLM 直接生成代码形式的奖励函数,或让 VLM 对轨迹图像进行评分。然而这些端到端方案往往缺乏对任务结构的显式建模,生成的奖励信号粗糙且噪声大,难以在复杂的机器人操作任务中提供稳定可靠的指导。
本文的切入点源于对人类学习机制的认知科学洞察。认知科学的研究表明,人类学习同时依赖两种机制:一是通过先验知识进行快速的模式识别与决策,二是通过与环境的交互反馈持续修正和完善认知。类比到强化学习的奖励设计,这意味着一个有效的奖励函数可能需要同时包含两种成分:基于任务知识的显式结构与从交互中学习的隐式偏好。受此启发,CoRe 将奖励分解为形式奖励与残差奖励两个互补组成部分,并通过 VLM 反馈实现二者的协同优化与自动构建。
方法
CoRe 的核心设计围绕奖励的分解与协同展开。论文将总奖励定义为形式奖励与残差奖励的线性组合:
这种加性分解看似简单,却蕴含着重要的设计考量:形式奖励提供结构化、可解释的奖励信号,负责稳定训练过程并引导探索方向;残差奖励则捕捉形式奖励难以表达的隐式偏好,补充细粒度的任务信息。两个模块各司其职、互为补充。
形式奖励模块(Formal Reward Module, FRM)的设计目标是利用任务知识自动构建可靠的奖励函数。直觉上,可以让 LLM 直接根据任务描述生成奖励代码,但这种方法面临一个关键问题:生成的奖励函数是否真正对齐任务目标?传统评估方式需要实际运行奖励函数并观察策略表现,但这一过程计算代价高昂,且如果奖励本身存在问题,策略训练本身可能已经误入歧途。
CoRe 提出了基于[[Reward-Preference Alignment]]的迭代优化策略。在每一轮迭代中,给定任务描述、状态定义、上一轮最佳奖励以及策略反馈,LLM 生成 K 个候选奖励函数。随后,不再通过完整训练来评估每个候选,而是直接在已有的偏好数据集上检验奖励与偏好的对齐程度。具体地,对于每个候选奖励,计算其在偏好数据上的预测准确率——即奖励累积值能否正确区分被偏好的轨迹与被拒绝的轨迹。选择预测准确率最高的候选作为本轮最佳奖励,进入下一轮迭代。这一机制的核心洞察在于:当奖励与人类偏好保持一致时,基于该奖励优化的策略更可能产生符合人类意图的行为,即便奖励本身并非任务的完美代理。
形式奖励的迭代优化过程可以形式化为:
其中 衡量候选奖励 在偏好数据集 上的对齐分数。通过多轮迭代,形式奖励模块能够逐步修正初始设计的偏差,在偏好反馈的引导下持续改进。
残差奖励模块(Residual Reward Module, RRM)的设计则聚焦于解决[[基于偏好的强化学习]]中反馈效率低与信用分配困难的问题。传统 PbRL 方法通常需要大量图像级或语言级的偏好标注,且难以将片段级偏好精确分配到具体的时间步。CoRe 采用了视频级偏好与帧级重要性权重相结合的学习策略。
具体而言,RRM 将轨迹视频片段与任务描述、起始图像、目标图像一同输入 VLM,由 VLM 判断哪段轨迹更符合任务要求并给出每帧的任务完成度评分。视频级偏好相比图像级偏好蕴含了更丰富的时序动态信息,能够帮助奖励模型理解动作之间的因果关系。VLM 输出的一维完成度分数经线性插值与 softmax 归一化后,得到帧级重要性权重 ,表示各帧对任务完成的重要程度。
残差奖励的学习采用[[对比学习]]框架,从偏好数据中推断隐式奖励函数。值得注意的是,CoRe 额外引入了基于重要性权重的 KL 散度约束:
这一 KL 散度项强制模型的帧级奖励预测与 VLM 给出的重要性先验保持一致。重要性先验作为辅助约束,实质上为奖励学习提供了额外的监督信号,使得信用分配更加稳定,加速了奖励模型的收敛。
FRM 与 RRM 的协同机制体现了设计的精巧之处。形式奖励模块生成的代码奖励具有明确的物理含义与时序结构,能够稳定指导探索并防止策略走向极端;残差奖励模块则负责捕捉形式奖励的表达盲区——例如可变形物体的形变程度、机械臂与物体的交互力度等难以用规则描述的细粒度特征。二者的结合使得整体奖励既具有可解释性,又具备对齐人类偏好的表达能力。
实验与结果
CoRe 的实验覆盖了仿真与真实机器人两个层面,试图全面验证框架的有效性与实用性。
在仿真环境方面,论文选取了 MetaWorld 中的 7 个任务(涵盖刚体操作与铰接对象操作)和 SoftGym 中的 3 个任务(可变形对象操作),每个任务使用 3 个随机种子进行评估。对比方法涵盖了多种主流自动奖励构建策略:基于 CLIP 的相似度打分方法 CodeScore、利用 LLM 生成奖励代码的 Eureka 和 Text2Reward、基于 VLM 评分的 RL-VLM-F、以及结合偏好学习的 PrefVLM 和 ERL-VLM。此外,论文还报告了环境稀疏奖励与稠密奖励作为性能参考基线。
实验结果揭示了显著的性能差距。在 MetaWorld 的 7 个任务上,CoRe 达到了 99.0% 的平均成功率,几乎追平人工设计的稠密奖励(99.3%),而其他自动方法的表现则参差不齐:CLIP Score 仅 4.8%、Eureka 75.5%、Text2Reward 74.2%、RL-VLM-F 56.8%、PrefVLM 18.6%、ERL-VLM 37.0%。这一结果表明,尽管 LLM/VLM 在辅助奖励设计方面展现出潜力,但端到端的单模块方案仍难以达到可靠的应用水平。CoRe 通过形式奖励与残差奖励的协同,成功跨越了这一性能鸿沟。
消融实验进一步揭示了两个模块各自的擅长领域与互补效应。形式奖励模块在刚体操作任务上表现优异,这得益于代码形式的奖励能够清晰表达位置关系、接触状态等结构化信息。残差奖励模块则在可变形对象任务上展现出优势,例如折叠布料、拉直绳子等需要细致视觉感知的任务。在单独使用时,FRM 在刚体任务上领先 RRM 约 20 个百分点,而在可变形任务上 RRM 反超 FRM 约 15 个百分点。二者结合后,两类任务均达到最优,验证了设计的互补性假设。
论文特别关注了奖励质量本身,而不仅仅关注最终策略性能。研究者计算了学习到的奖励与任务进度之间的 Spearman 相关系数——这是衡量奖励信号与真实目标对齐程度的重要指标。CoRe 学习的奖励在 10 个任务上平均达到 0.88 的相关系数,显著优于 ERL-VLM(0.48)、RL-VLM-F(0.44)和 PrefVLM(0.09)。这一结果解释了 CoRe 能够习得高质量策略的原因:高质量的奖励信号是策略学习成功的根本保障。
在偏好标注效率方面,CoRe 仅需 0.15K 到 0.5K 的偏好标签,相比基线方法的 0.5K 到 21K 减少了 3 到 40 倍。这一效率提升对于实际应用意义重大,因为它意味着人类标注负担的大幅减轻以及反馈成本的显著降低。
视频级偏好与图像级偏好的对比实验进一步支持了 CoRe 的设计选择。视频级偏好的正确标注率为 51.5%,高于图像级偏好的 41.6%;同时,视频级偏好中“无法比较”的比例为 26.2%,低于图像级的 33.5%。这表明视频上下文提供了更充分的决策依据,减少了 VLM 产生歧义判断的情况。
真实机器人部署是验证 sim-to-real 迁移能力的关键环节。论文在 UR5 机械臂上直接部署了仿真环境训练的策略,无需任何域适应或微调。在 5 个真实任务(每个任务重复 20 次)上,CoRe 全面优于所有对比方法。这一成功很大程度上归功于高质量的奖励函数:当奖励信号与任务目标紧密对齐时,在仿真环境习得的策略能够更好地泛化到真实物理世界,因为策略所学到的行为模式本身就是正确的。
讨论与可借鉴点
CoRe 的设计为自动奖励构建提供了一条有前景的路径,其核心启示在于将复杂问题分解为可解释的子模块并利用大模型能力进行协同优化。然而,这项工作同样存在一些局限与值得深入探索的问题。
VLM 幻觉与标注噪声是框架面临的主要风险之一。尽管论文通过调整相机视角、设置透明机械臂等措施缓解了视觉歧义,但实验数据显示 VLM 的标注仍存在约 15% 的错误率以及 33.5% 的“无偏好”比例。这些噪声可能通过奖励学习传播至策略,影响最终行为的安全性。在医疗、自动化驾驶等安全敏感领域,这一风险不容忽视。如何在奖励学习阶段显式建模和处理标注不确定性,是一个值得研究的方向。
对强 VLM 的依赖是另一个潜在瓶颈。论文的消融实验表明,开源 VLM(如 Qwen3-VL-8B)相比商业模型存在明显性能下降,而 Video-LLaVA-7B 几乎无法使用。这暗示 CoRe 的性能天花板在一定程度上受限于当前 VLM 的视觉理解与推理能力。随着 VLM 技术的持续进步,框架的性能上限有望进一步提升。
从方法论层面看,CoRe 的奖励分解思路值得借鉴。将奖励解耦为结构化知识与隐式偏好的做法,实际上反映了一种更广泛的[[表示学习]]思想:显式建模的部分负责提供可靠的先验与可解释性,从数据中学习的部分负责补充表达能力不足。这种思路同样可以应用于其他强化学习子问题,例如价值函数的分解、策略的层次化表示等。
Reward-Preference Alignment 的设计同样具有启发意义。将奖励选择的目标从“最大化任务完成度”转换为“最大化偏好一致性”,本质上是在优化一个更鲁棒的代理指标。这一思想可以推广至其他需要自动评估的场景:与其直接优化难以精确指定的目标,不如优化一个与目标对齐的度量。例如,在机器人教学中,可以训练奖励预测器来评估轨迹的“教学友好性”而非单纯的任务成功率。
在工程实践层面,CoRe 的成本效益分析颇具参考价值。相比 RL-VLM-F(0.55),CoRe 的 API 成本仅为 $0.37,同时训练时间(2.15 小时)也显著低于 RL-VLM-F(6.72 小时)和 ERL-VLM(5.80 小时)。这种效率优势使得框架更具实际部署的可行性。
展望未来,CoRe 的框架可以沿着多个方向扩展。首先,当前方法聚焦于单任务学习,如何将其拓展至多任务、持续学习场景需要进一步探索。其次,框架目前仅使用了 VLM 的视觉理解能力,未来可以结合 LLM 的推理能力来实现更复杂的任务理解与奖励设计。第三,在真实世界部署中,如何处理非结构化环境、动态目标、多智能体协作等更复杂的场景,仍有待研究与验证。
摘要
奖励设计仍然是强化学习(RL)中的一项核心挑战。人工指定的奖励往往难以精确给出,并可能导致次优策略;而从偏好中学习得到的奖励则存在效率低下和训练不稳定的问题。受认知科学所揭示的人类学习双重特性的启发,我们将奖励分解为两个互补的组成部分:形式奖励(FR),基于任务知识显式设计;残差奖励(RR),从观察中学习以捕捉隐含且细致的偏好。基于这种分解,我们提出了CoRe——一个将FR、RR与视觉-语言模型(VLM)反馈相结合的混合框架,可在无人类参与的情况下实现偏好对齐的策略。我们的贡献主要包含两个方面:(1)我们提出了形式奖励模块(FRM),利用VLM基于任务知识和偏好反馈迭代地设计与优化FR,从而在训练过程中持续改进策略;(2)我们引入了残差奖励模块(RRM),通过使用VLM生成偏好标签,从视频级偏好中学习RR,捕捉作为FR补充的细致奖励,确保与人类意图对齐。通过FRM与RRM的协同作用,CoRe能够自动构建高效且与偏好对齐的可靠奖励。大量实验表明,CoRe在仿真环境中的十个机器人操作任务和五个真实世界任务上,在策略学习的有效性与效率方面均优于现有方法。视频可在我们的项目网站查看:https://core-2026.github.io/
Abstract
Reward design remains a central challenge in reinforcement learning (RL). Hand-crafted rewards are often difficult to specify and may lead to suboptimal policies, while learned rewards from preferences can suffer from inefficiency and unstable training. Inspired by the dual nature of human learning explored in cognitive science, we decompose rewards into two complementary components: Formal Rewards (FR), explicitly designed based on task knowledge, and Residual Rewards (RR), learned from observations to capture implicit and nuanced preferences. Based on this decomposition, we propose CoRe, a hybrid framework that integrates FR and RR with vision-language models (VLMs) feedback to achieve preference-aligned policies without human involvement. Our contributions are twofold: (1) We propose a Formal Reward Module (FRM) that leverages VLMs to iteratively design and optimize FR based on task knowledge and preference feedback, enabling the continual improvement of policy during training; (2) We introduce a Residual Reward Module (RRM) that learns RR from video-level preference by employing VLMs to generate preference labels and capturing nuanced rewards that complement FR, ensuring alignment with human intent. Through the synergy of FRM and RRM, CoRe enables the automatic construction of reliable rewards that are efficient and preference-aligned. Extensive experiments demonstrate that CoRe outperforms existing approaches in terms of policy learning effectiveness and efficiency on ten robotic manipulation tasks in simulation and five real-worlds. Videos can be found on our project website: https://core-2026.github.io/
论文详细总结(自动生成)
CoRe 论文总结
1. 核心问题与研究动机
强化学习(RL)在游戏 AI、自动驾驶和机器人操作等任务中已取得显著进展,但奖励函数设计仍是核心瓶颈:
- 手工设计奖励:依赖领域专家经验,难以精确刻画,且容易引发奖励黑客(reward hacking) 问题,导致次优甚至不安全策略。
- 基于偏好的强化学习(PbRL):避免手工奖励,但通常需要大量人类偏好标签,反馈效率低,且训练不稳定、泛化能力差。
- LLM/VLM 生成奖励:可直接生成代码奖励或对状态打分,但往往粗糙、噪声大,难以捕捉复杂操作任务中的细粒度结构。
受认知科学中人类学习双重性(先验知识辅助编码与理解 + 交互迭代精修)的启发,本文将奖励拆解为两个互补组成部分:形式奖励(FR) 与 残差奖励(RR),以同时兼顾任务显式知识和人类隐式偏好。
2. 方法论
2.1 整体框架
CoRe 框架包含两个核心模块:
- 形式奖励模块(FRM):LLM 自动设计代码形式的 FR,并通过偏好引导进行迭代优化。
- 残差奖励模块(RRM):利用 VLM 生成的视频级偏好标签与帧级重要性权重学习 RR,捕捉 FR 难以表达的隐式偏好。
二者协同工作:FRM 提供结构化、可解释的奖励信号指导 RRM 探索并稳定训练;RRM 补充 FR 的表达力不足,使整体奖励对齐人类意图。总奖励为:
2.2 FRM:形式奖励模块
在第 轮迭代中,给定任务描述 、状态定义 、上一轮最佳奖励 与策略反馈 ,LLM 生成 个候选奖励 。
Reward-Preference Alignment:用偏好预测准确率代替任务完成度来选择最佳奖励候选:
其中 。该方法避免了从头训练评估候选奖励带来的计算开销,并能防止因过度优化任务完成度而产生的奖励黑客问题(如图 2 中锤头任务"用锤柄击打"的现象)。
2.3 RRM:残差奖励模块
针对传统 PbRL 反馈效率低、状态-步信用分配困难的问题,RRM 采用:
视频级偏好标注:将轨迹片段与任务描述 、起始图像 、目标图像 一同输入 VLM:
VLM 同时输出每帧的任务完成度评分,经线性插值与 softmax 归一化得到帧级重要性权重 。
带重要性先验的奖励学习:除偏好交叉熵损失 外,引入 KL 散度约束使预测的逐帧奖励分布与 VLM 给出的重要性先验一致:
其中 , 为权重系数。重要性先验作为辅助约束可显著加速奖励学习并提高稳定性。
2.4 算法流程
策略学习与奖励学习同步进行(见 Algorithm 1):
- 策略使用 SAC 算法以状态观测进行学习;
- 每 步更新一次 FRM 形式奖励;
- 每 步查询一次 VLM 收集偏好并更新 RRM;
- 每次奖励更新后对回放缓冲区进行重新打标。
3. 实验设计
3.1 任务场景
仿真任务(10 个):
- MetaWorld(7 个,刚体/铰接对象):Soccer、Sweep Into、Drawer Open、Button Press、Dial Turn、Hammer、Peg Insert。
- SoftGym(3 个,可形变对象):Fold Cloth、Straighten Rope、Pass Water。
真实任务(5 个):在 UR5 机械臂上部署 Drawer Open、Dial Turn、Hammer、Fold Cloth、Straighten Rope,无需微调直接 sim-to-real 迁移,每个任务重复 20 次。
3.2 对比方法
涵盖三类主流自动奖励构造方法:
- 相似度打分:CLIP Score。
- 代码生成:Eureka、Text2Reward。
- 偏好/评分学习:RL-VLM-F、PrefVLM、ERL-VLM。
- 此外还报告 Env Sparse(环境稀疏奖励)和 Env Dense(环境稠密奖励)作为参考基准。
3.3 实现细节
- 策略学习算法:SAC(Haarnoja et al., 2018),状态输入。
- FRM、Eureka、Text2Reward 使用 GPT-4.1 mini,每次 4 候选、共 5 轮搜索。
- RRM、RL-VLM-F、ERL-VLM 使用 Gemini 2.0 Flash 提供偏好标签。
- 图像奖励模型在 MetaWorld 用 4 层 CNN,在 SoftGym 用 ResNet-18,3 模型集成,tanh 输出。
- 为减少 VLM 幻觉,将机械臂/picker 设为透明,并调整相机视角聚焦目标对象。
4. 资源与算力
文中未明确提及具体 GPU 型号或数量,但报告了 API 成本与时间统计(表 4):
| 方法 | Token (M) | API 成本 (USD) | 时间 (h) |
|---|---|---|---|
| SAC | — | — | 0.97 |
| CLIP Score | — | — | 2.58 |
| Eureka | 0.03 | 0.03 | 1.87 |
| Text2Reward | 0.03 | 0.02 | 5.73 |
| RL-VLM-F | 5.50 | 0.79 | 6.72 |
| PrefVLM | — | — | 1.82 |
| ERL-VLM | 3.19 | 0.55 | 5.80 |
| CoRe | 2.00 | 0.37 | 2.15 |
CoRe 在性能/成本/时间三方面取得了较好的折中。计算开销主要来自 LLM/VLM 迭代查询。
5. 实验数量与充分性
实验体系较为完善,包含以下几类:
1. 主结果对比(表 1、图 3):在 10 个仿真任务上对比 9 种方法,每个任务 3 个随机种子,绘制学习曲线与最终性能。
2. 消融实验(表 2):
- FRM 迭代次数(FRM 0/2/4)对性能的影响;
- RRM 单独使用、RRM 去掉重要性先验(w/o imp);
- FRM 与 RRM 单独使用的性能对比及其互补性。
3. VLM 标注分析(图 4):比较图像级与视频级偏好标注的正确率、错误率与"无法比较"比例。
4. 奖励质量分析(图 5、图 6):从时序(与任务进度的 Spearman 相关性)和空间(热力图)两个角度评估学习到的奖励质量。
5. 泛化性分析(附录 D):
- 强模型实验(表 9):GPT-5.4、Gemini 3 Flash 对单模块的提升有限。
- 开源 VLM 替换(表 10):Qwen3-VL-8B 仍能取得良好性能。
- 视觉干扰鲁棒性(表 11):在随机移动红方块干扰下性能仅轻微下降。
6. 真实机器人部署(表 5):5 个任务的 sim-to-real 迁移结果。
客观性评价:3 个随机种子 + 20 次真实部署重复,所有方法使用相同超参与策略学习算法,公平性较好;唯一差异在奖励构造方式,对比设置合理。
6. 主要结论与发现
- 性能领先:在 7 个 MetaWorld 任务上平均成功率 99.0%,接近人工设计奖励(99.3%),显著优于所有基线(CLIP Score 4.8%、Eureka 75.5%、Text2Reward 74.2%、RL-VLM-F 56.8%、PrefVLM 18.6%、ERL-VLM 37.0%)。在 SoftGym 三个可形变任务上亦取得最佳表现。
- 反馈效率高:仅使用 0.15K–0.5K 偏好标签,相比基线(0.5K–21K)减少 3–40 倍。
- 奖励质量最优:学习到的奖励与任务进度的 Spearman 相关系数在 10 个任务上平均达 0.88(RRM 0.77,ERL-VLM 0.48,RL-VLM-F 0.44,PrefVLM 0.09),且空间分布最平滑。
- 视频级偏好优于图像级:平均正确标注率 51.5% vs 41.6%。
- 模块互补:FRM 擅长刚体操作(结构化代码),RRM 擅长可形变对象(视觉表达),二者结合后两类任务均表现优异。
- 真实迁移有效:5 个真实 UR5 任务上 CoRe 全面领先,验证了高奖励质量对 sim-to-real 鲁棒性的促进。
7. 优点与亮点
- 认知科学启发的奖励分解:将形式化知识与隐式偏好显式解耦,既保证可解释性又提高表达力。
- Reward-Preference Alignment:用偏好一致性替代任务完成度来选择 FR 候选,避免了"为提高完成度而奖励黑客"的问题,且无需重训策略即可验证候选。
- 视频级偏好 + 帧级重要性先验:相比图像级/语言级偏好,承载更丰富的任务动态信息;KL 散度辅助约束使信用分配更稳定。
- 无需环境代码与人类参与:FRM 仅需状态/动作定义,RRM 自动生成偏好,完全自动化且比 LLM/VLM 单模块方案更高效。
- 实验体系完善:涵盖消融、对比、鲁棒性、模型规模、开源 VLM 替换、真实部署等多个维度。
- API 成本友好:平均 0.79)与 ERL-VLM($0.55)。
8. 不足与局限
- 依赖 LLM/VLM 的固有限制:偏好与重要性权重由 VLM 生成,存在标注噪声与偏差(如图 4 中 15% 的错误标注、33.5% 的"无偏好"比例),可能传播至奖励与策略。
- API 成本与延迟:尽管已大幅降低,迭代查询仍带来额外开销与时间成本(2.15 h/任务),对完全离线或实时性要求高的场景构成障碍。
- 强模型提升有限:附录实验显示仅靠扩大模型规模(如 GPT-5.4、Gemini 3 Flash)难以弥补单模块表达力不足,反而成本成倍增加。
- 任务覆盖有限:10 个仿真任务与 5 个真实任务仍集中在桌面级操作,缺少移动操作、长期规划、非结构化环境等更复杂场景的验证。
- 视频理解模型依赖:实验表明性能随 VLM 能力变化显著(Video-LLaVA-7B 几乎不可用,Qwen3-VL-8B 性能下降明显),框架在弱 VLM 上效果有限。
- 奖励黑客风险未根除:Reward-Preference Alignment 仍依赖偏好标签的准确性,VLM 偏好错误时 FRM 优化方向可能偏移。
- 缺乏对安全与泛化的深入分析:未讨论对抗扰动、域外分布、新物体泛化等现实部署中的关键问题。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。















































































