arXiv 2607.04713v1 · 发布 2026-07-06

RSPO:面向多轮 LLM 智能体的奖励交换策略优化

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

AUTHORS Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun
EVIDENCE 多轮LLM智能体的策略优化
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-12 21:21:19 UTC

📝 TLDR

多轮LLM智能体训练面临结果奖励稀疏导致收敛慢、难以学习未采样轨迹的困境,而密集过程奖励又可能与真实结果奖励不一致从而误导优化。RSPO提出奖励交换机制,在利用过程奖励丰富信息的同时保持与结果奖励的目标一致性。在WebShop和ALFWorld基准上对GRPO、PPO、GiGPO均实现稳定性能提升。

🧭 速览

动机

多轮长程交互任务中结果奖励信号稀疏导致收敛慢且难以泛化至未采样成功轨迹;密集过程奖励虽加速训练,却与真实结果奖励存在不一致风险,误导优化方向。

方法

RSPO采用奖励交换机制,将密集过程奖励的信息融入策略优化过程,同时严格保证优化目标与真实结果奖励的一致性,并维持采样轨迹的多样性。

结果

在WebShop和ALFWorld两个智能体基准上,将RSPO应用于GRPO、PPO、GiGPO等不同RL算法,均取得一致且显著的性能提升。

结论

RSPO有效兼顾过程奖励的信号丰富性与结果奖励的目标一致性,提升多轮LLM智能体强化学习的性能上限与训练效率。

📊 论文图表(共 3 张)

展开查看 3 张图

TL;DR

RSPO 针对多轮 LLM 智能体训练中「结果奖励稀疏」与「过程奖励偏差」之间的两难困境,提出了奖励交换机制。系统同时维护两个智能体——一个始终基于结果奖励优化以保证目标一致性,另一个利用过程奖励探索多样化轨迹,随后将成功经验共享给前者。在 WebShop 和 ALFWorld 两大基准上,RSPO 能够稳定提升 GRPO、PPO、GiGPO 等主流强化学习算法的性能,最高可达 12% 的相对增益。

研究背景与动机

训练大语言模型处理多轮交互任务(如网页购物、家务规划)是当前 [[强化学习]] 在 LLM 领域的重要应用场景之一。然而,这类任务的奖励设计面临一个根本性矛盾:真实任务目标只在乎最终结果(商品是否买对、房间是否打扫干净),但训练信号只在回合结束时出现一次。

这种「[[结果奖励]] 稀疏」的特性带来了双重困扰。首先是 [[信用分配]] 的困难——当模型在第 15 步做对了某件事,但奖励要等到第 30 步才出现,模型很难弄清楚是哪一步真正有价值,导致收敛极其缓慢。其次,模型只能从训练期间实际采样到的轨迹中学习,如果某种成功策略从未被采样到,模型就永远学不到它。

学术界已经意识到这个问题,并发展出「[[过程奖励]]」的思路:为每个中间步骤提供密集的即时反馈,让模型能够「每走一步就知道自己走得怎么样」。这确实能加速训练,但引入了新的风险——这些人为设计的中间奖励毕竟是真实目标的代理指标,两者之间难免存在偏差。如果偏差过大,模型可能会「走捷径」去优化代理指标而不是真正完成任务的策略,这种现象在强化学习文献中被称为 [[Reward Hacking]]。

论文的核心问题因此变成:能否既利用过程奖励的丰富信息来扩展探索边界,又保证最终的优化目标与真实结果奖励严格一致?

方法

RSPO 的设计灵感来自人类学习的两个阶段:建立即时的直觉反馈,然后复盘成功的经验。具体实现为一套双智能体循环架构。

系统维护两个策略模型。Agent A(记作 )是最终交付的智能体,整个训练过程始终使用 [[结果奖励]] 进行优化,这从根本上保证了目标一致性。Agent B(记作 )是临时探索者,先用密集过程奖励训练若干步,随后与环境交互收集大量轨迹。关键是,这些轨迹的奖励会被「交换」——即重新标注为真实的结果奖励后存入回放缓冲区 。这样 Agent B 探索到的多样化行为空间就能被 Agent A 利用,而不会因为过程奖励的偏差而误导最终模型。

在目标函数层面,Agent A 的优化同时利用两类数据:自身在线采样的轨迹,以及从缓冲区 采样的离线轨迹。形式化为:

其中离线数据的比例 控制着探索经验利用的程度。论文默认取 ,即每 8 条训练样本中有 1 条来自 Agent B 的探索经验。

由于离线数据由不同策略生成,直接复用标准策略梯度算法会导致分布偏移问题。RSPO 对此的解决方案是「广义裁剪」:将传统 PPO/GRPO 中以 1 为中心的裁剪区间,改为以 为中心。这相当于承认离线数据的采样策略与当前策略之间存在差异,并相应调整约束范围。

整个训练循环以「轮次」为单位运行:先用过程奖励训练 Agent B 探索 k 步,将其轨迹交换奖励后存入缓冲区,再用混合数据训练 Agent A k 步,然后清空缓冲区进入下一轮。论文默认 k=3,总计 150 个训练轮次。

实验与结果

实验在两个经典的多轮智能体基准上进行。ALFWorld 模拟文本世界的家务任务(如拿起物品、加热食物),WebShop 则是网页购物环境,两者都以最终成功率作为核心指标。

主实验覆盖了三种主流的近端策略梯度算法——GRPO、PPO 和 GiGPO——分别测试它们在加上 RSPO 前后的性能变化。结果显示了一致的提升模式:在 1.5B 规模的 Qwen2.5 模型上,ALFWorld 任务的提升幅度从 1.6% 到 8.6% 不等,WebShop 任务的提升则在 5.5% 到 12% 之间。值得注意的是,PPO 算法通常被认为对超参敏感,但在 RSPO 框架下反而获得了最大的相对增益(12%),说明奖励交换机制有效缓解了 PPO 在稀疏奖励环境下的训练不稳定性。

消融实验揭示了几个有价值的发现。基于奖励的采样策略(优先选择高结果奖励的轨迹)显著优于随机采样和基于方差的采样,这印证了「从成功经验中学习」的直觉。另外,当过程奖励被注入不同程度的高斯噪声时,RSPO 依然能保持稳定表现,说明其对过程奖励的质量要求并不严苛。但过犹不及——当 Agent B 的训练步数 k 超过 5 时,性能反而会回落,这可能是因为 Agent B 开始过拟合过程奖励而非真正扩展探索空间。

讨论与可借鉴点

RSPO 最有启发性的设计在于它将「探索」与「优化」解耦。传统方法试图用一个模型同时解决「去哪里」和「怎么走」,不可避免地在探索激进度和利用稳定性之间妥协。RSPO 通过双智能体架构让过程奖励「只负责探索」,结果奖励「只负责优化」,各司其职。

然而这一方案也存在明显的工程代价:需要额外训练一个过程奖励模型(论文用 3B 规模的 Llama),并且回放缓冲区与在线数据之间的比例需要仔细调参。此外,论文仅在 Qwen2.5 系列上验证了效果,不同模型家族对离线数据的利用效率可能存在差异,这有待后续研究探索。

从更宏观的角度看,RSPO 为 [[强化学习]] 在 LLM 应用中「奖励设计」这一核心难题提供了一条务实的路径:不必追求完美的过程奖励,而是接受其不完美,并通过机制设计让它在可控范围内发挥作用。

摘要

强化学习在训练大语言模型(LLM)处理多轮交互任务方面具有重要潜力。然而,在具有稀疏结果奖励的长视野、多轮任务中,由于信号稀疏且缺乏细粒度反馈,直接使用结果奖励进行训练往往导致收敛速度缓慢。此外,模型可能无法学习到训练期间未采样的成功轨迹,从而限制其性能。反之,虽然采用定制的密集过程奖励能提供更丰富的信号并加速收敛,但这些替代奖励可能与真实的结果奖励存在潜在的偏差。这种不一致性可能使训练方向产生偏差,最终降低模型的最终性能。在本文中,我们提出了奖励交换策略优化(Reward-Swap Policy Optimization,RSPO),这是一种旨在利用密集过程奖励的丰富信息来辅助基于结果奖励训练的方法。通过采用奖励交换机制,RSPO 在保证优化目标与真实结果奖励一致的同时,确保了采样轨迹的多样性,从而提升了模型的性能上限。我们在两个具有挑战性的智能体基准 WebShop 和 ALFWorld 上进行了大量实验。通过将我们的方法应用于多种强化学习算法(包括 GRPO、PPO 和 GiGPO),我们证明 RSPO 在不同基线和基准上均能取得持续的性能提升。

Abstract

Reinforcement learning holds significant potential for training large language models (LLMs) to handle multi-turn interactive tasks. However, in long-horizon, multi-turn tasks characterized by sparse outcome rewards, directly training with outcome rewards often results in slow convergence due to the sparsity of signals and the lack of fine-grained feedback. Furthermore, the model may fail to learn successful trajectories that are not sampled during training, thereby limiting its performance. Conversely, while employing customized dense process rewards provides richer signals and accelerates convergence, these surrogate rewards may exhibit potential misalignment with the ground-truth outcome rewards. This inconsistency can bias the training direction and ultimately degrade the model's final performance. In this work, we propose Reward-Swap Policy Optimization (RSPO), a method designed to leverage the rich information from dense process rewards to facilitate training with outcome rewards. By utilizing a reward-swap mechanism, RSPO ensures the diversity of sampled trajectories while guaranteeing consistency between the optimization objective and the true outcome rewards, thereby elevating the performance ceiling of the model. We conduct extensive experiments on two challenging agent benchmarks, WebShop and ALFWorld. By applying our method to various reinforcement learning algorithms, including GRPO, PPO, and GiGPO, we demonstrate that RSPO achieves consistent performance improvements across different baselines and benchmarks.


论文详细总结(自动生成)

RSPO 论文总结:面向多轮 LLM 智能体的奖励交换策略优化

1. 核心问题与研究动机

在多轮交互式 LLM 智能体任务(如 WebShop、ALFWorld)中,强化学习训练面临两难困境:

  • 结果奖励(Outcome Reward)稀疏:长视野任务仅在回合结束时给出标量奖励,导致(a)信用分配困难、收敛缓慢;(b)训练中未采样到的成功轨迹无法被学习,性能上限受限(特别是 GRPO 类基于分组采样的方法)。
  • 密集过程奖励(Process Reward)丰富但不可靠:StepAgent、PRIME、SPA-RL、RLVMR 等方法通过手工或模型生成的方式为每一步提供中间奖励,能加速训练;但过程奖励与真实结果奖励之间存在潜在不一致(misalignment),可能导致 "Reward Hacking",使模型偏向优化代理指标而非真实任务目标。

论文核心目标:设计一种框架,同时利用过程奖励的丰富信息进行探索,又保证最终优化目标与真实结果奖励严格一致

2. 方法论

2.1 核心思想:双智能体奖励交换循环

RSPO 维护两个智能体:

  • Agent A(:最终交付的模型,始终使用结果奖励进行训练。
  • Agent B(:临时中间模型,先用密集过程奖励训练 步获得,随后与环境交互收集多样化轨迹,存入回放缓冲区 (轨迹奖励被恢复为真实结果奖励)。

然后 Agent A 从 中按奖励高低采样"成功轨迹"作为离线数据,结合自身在线数据继续训练。循环往复,Agent B 因过程奖励的引导能探索到结果奖励难以触发的行为空间,从而扩展 Agent A 的探索边界。

2.2 总目标函数

其中 为离线数据比例(论文取 ), 分别基于自生成在线数据和从 采样的离线数据。

2.3 离线更新的广义裁剪机制

由于 与生成离线数据的策略 之间存在分布差异,标准裁剪区间 不再适用。论文引入广义裁剪:

即将裁剪中心从 1 平移到 ,使约束更加合理。

2.4 离线目标展开

其中重要性采样比为 。在线项 与标准 GRPO/PPO 形式一致。

2.5 采样策略

采用基于奖励的采样:优先从 中抽取高奖励(成功)轨迹,契合"复盘成功经验"的人类学习直觉。GRPO 用分组优势估计、PPO 用 GAE。

2.6 密集过程奖励模型(参考 SPA-RL)

在预训练 LLM 最终隐藏层后接 MLP + tanh,将每步奖励约束在

轨迹总奖励 ,通过最小化 MSE 损失训练:

> 注:密集过程奖励的获取方式不局限于此,论文强调"采用了众多可能方法之一"。

2.7 算法流程(伪代码要点)

每个 RSPO loop:

1. 令 ,用密集奖励训练 步;

2. 与环境交互生成轨迹,重新标注为结果奖励并存入

3. 用混合数据(在线 + 离线 )以结果奖励训练 步;

4. 清空 ,进入下一循环。

论文默认 、总训练步数 150。

3. 实验设计

3.1 基准环境

基准类型任务数/类别
ALFWorld具身家庭任务(文本世界)6 类:Pick、Look、Clean、Heat、Cool、Pick2
WebShop网页搜索/购物交互单一商品购买任务

3.2 基础模型

  • 策略模型:Qwen2.5-1.5B-InstructQwen2.5-7B-Instruct
  • 过程奖励模型:Llama-3.2-3B-Instruct(加 MLP 头)

3.3 对比方法

  • 基础 RL 算法:GRPOPPOGiGPO(含 w/ std 与 w/o std 两个变体)
  • 强基线:SPEAR+GRPOSPEAR+GiGPO(在相同超参下复现,注明原论文使用更大数据量与 epoch)
  • 报告指标:ALFWorld 的 Success Rate(分 6 类),WebShop 的 Score 与 SR

3.4 关键超参

  • 训练 batch size = 16;rollout 组大小
  • RSPO 数据组成:14 在线 + 2 离线(总 batch:PPO=128、RSPO-PPO=112)
  • 每 loop ,总步数 150,随机种子

3.5 消融实验

  • 采样策略:随机 vs. 方差 vs. 奖励(基于 WebShop + RSPO+GRPO)
  • 数据来源:Agent A 自历史轨迹()、用结果奖励替代过程奖励()、默认 RSPO
  • 超参敏感性
  • 噪声鲁棒性:向过程奖励加入高斯噪声
  • 探索能力分析:统计固定窗口内重复访问相同状态的次数

4. 资源与算力

论文在附录 A.2 中给出:

  • 工作站配置:380 CPU 核心、2.2 TB 内存
  • GPU:8 块 96GB 显存的单机(ALFWorld 1.5B 用 8 卡;WebShop 1.5B 用 2 卡、PPO 用 4 卡;7B 在 WebShop 用 8 卡)
  • ALFWorld 7B 模型训练扩展到 2 台工作站共 16 块 GPU

论文未明确报告训练时长(小时/天数)

5. 实验数量与充分性

  • 主实验:2 基准 × 2 模型规模 × 4 RL 算法(3 基线 + 1 RSPO)× 3 种子 ≈ 数十组结果
  • 消融:6+ 组(采样策略 3 组、数据来源 3 组、超参 4 组、超参 4 组、噪声 3 组、探索分析 1 组)
  • 附录:还提供了不同 下的对比表以及对探索多样性的定性分析

充分性评价

  • 优点:覆盖两个公认的多轮智能体 benchmark,对比了多种主流 RL 算法,并做了较系统的消融;
  • 不足:仅在 Qwen2.5 系列上验证,缺乏跨模型家族(如 LLaMA、DeepSeek)的泛化检验;未测试超过 7B 的模型;SPEAR 基线因超参对齐后表现较弱,可能不完全公平。

6. 主要结论

1. RSPO 在所有测试 RL 算法与基准上均带来稳定提升(以 1.5B 为例,ALFWorld 上 GRPO +5.7%、GiGPO +1.6%、PPO +8.6%;WebShop 上 GRPO +5.5%、GiGPO +7.9%、PPO +12%)。

2. 过程奖励确实带来探索多样性:附录 E 显示 RSPO 在训练后期重复访问相同状态的次数从 1167 降至 623,表明 Agent B 有效扩展了行为空间。

3. 过程奖励与结果奖励的不一致会引发 Reward Hacking:图 3 显示,仅用过程奖励训练时,密集奖励持续上升但任务成功率反而下降,验证了 RSPO 维持结果奖励优化的必要性。

4. 基于奖励的采样策略显著优于随机和方差采样,印证了"从成功轨迹中学习"的直觉。

5. RSPO 对过程奖励噪声具有鲁棒性 时性能仅小幅下降, 时仍优于多数基线。

6. 小模型收益更显著:7B 模型因自身已具备较强探索能力,RSPO 增益(约 2–4%)小于 1.5B 模型(最高 12%)。

7. 优点

  • 即插即用:RSPO 是一个"训练范式"而非新算法,可与 PPO/GRPO/GiGPO 等任意近端策略梯度方法无缝结合。
  • 创新性机制:奖励交换 + 广义裁剪中心平移 设计巧妙地缓解了离策略分布偏移问题。
  • 目标一致性保障:最终模型 始终以结果奖励优化,从根本上规避了"Reward Hacking"。
  • 实验较系统:覆盖多基准、多算法、多模型规模,并辅以消融、超参扫描与噪声鲁棒性测试。
  • 动机直观:借鉴人类"先建立即时信号、后复盘成功经验"的学习过程,易于理解。

8. 不足与局限

  • 模型规模受限:受算力约束,仅验证至 7B,更大规模(如 70B)效果未知。
  • 模型家族单一:仅使用 Qwen2.5 系列,未在 LLaMA、DeepSeek-Math 等其他家族上验证泛化性。
  • 离线比例固定 在训练全程保持 常量,未探索自适应衰减策略(作者在 Limitation 中明确指出)。
  • SPEAR 对比可能不完全公平:因 SPEAR 原论文使用更大 batch(32)和更多 epoch(350),论文中复现的 SPEAR 性能显著下降,对比说服力受限。
  • 过程奖励依赖外部模型:需额外训练一个 3B 的过程奖励模型,增加了工程开销与失败面。
  • 回放缓冲区的覆盖偏差:当 Agent B 训练步数 过大时可能出现过程奖励过拟合( 时性能回落至基线水平),需仔细调参。
  • 缺乏失败案例与错误分析:未深入讨论何种类型的任务上 RSPO 可能失效。
  • 未报告训练时长:资源描述只给出硬件配置,缺少 wall-clock 时间,难以评估实际工程成本。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记