面向智能体强化学习的进度与可靠性导向分组策略优化
Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
📝 TLDR
基于组的强化学习已用于提升大语言模型智能体在长程交互任务上的能力,但步级优势估计对分组方式敏感:宽泛状态键覆盖广却跨历史比较,历史一致分组虽公平却导致组碎片化与同侪信号稀疏。本文提出ProGPO方法,在免学习评论家条件下保留精确前缀动作比较,并借助基于rollout的状态势能为稀疏同侪比较补充转移信用。在ALFWorld与WebShop任务上以Qwen2.5-1.5B/3B-Instruct为基座,ProGPO以相近计算开销超越匹配基线,验证了步级组策略优化的可扩展性。
🧭 速览
步级组强化学习的优势估计在分组粒度与历史一致性之间难以两全,细粒度信用分配仍是开放难题。
ProGPO保留精确前缀动作比较,结合语义扩展与跨历史深度的逆方差融合,从rollout状态势能生成转移信用。
在ALFWorld和WebShop上以Qwen2.5-1.5B-Instruct为主、3B验证可扩展性,计算开销相当下超越匹配智能体RL基线。
为免学习评论家的上下文一致步级组策略优化提供了兼顾覆盖度与历史公平性的可行方案。
📊 论文图表(共 5 张)
展开查看 5 张图
TL;DR
本文针对大语言模型智能体在长程交互任务中面临的步骤级分组强化学习难题,提出了 ProGPO 方法。该方法在不依赖额外 Critic 模型的前提下,通过保留精确的前缀动作比较,并利用基于 rollout 的状态势能导出的转移信用来补充稀疏的同侪比较信号,在 ALFWorld 和 WebShop 两个任务上验证了有效性——仅需相近的计算开销,即可超越匹配的智能体强化学习基线。
研究背景与动机
在大语言模型智能体(LLM Agent)的训练范式中,基于分组的强化学习(Group-based RL)已被广泛验证为提升模型在长时序交互任务上能力的有效手段。与传统的策略梯度方法不同,分组强化学习的核心思想是将同一情境下产生的多个动作选项组织为"组",通过组内比较来估计优势函数,从而引导策略向更优动作更新。这种机制天然契合智能体在复杂环境中可能产生多样化行动路径的场景。
然而,既有研究大多在轨迹级(trajectory-level)进行分组与优势估计,即以完整轨迹作为比较单元。这种粗粒度的优化方式虽然实现简单、信号稳定,但存在一个根本性的局限:它无法为轨迹内部的中间决策提供细粒度的反馈。当智能体在一个包含数十步交互的任务中某一步出现偏差时,轨迹级的优势信号会被后续步骤的表现稀释甚至掩盖,导致模型难以精准地识别并修正错误决策节点。
为了获得更细粒度的策略更新,近期研究开始探索步骤级分组强化学习(step-level group-based RL),即在一次 rollout 批次内对中间步骤进行分组并比较。这种方式理论上能够为每个决策时刻提供独立的优势信号,使模型更精确地学习何时应该采取特定行动。但步级优势估计面临一个关键挑战:对分组方式高度敏感。具体而言,存在两种典型的分组策略:一种是按粗粒度状态键(state key)进行分组,覆盖范围广,但可能将不同历史上下文下采取的动作错误地放在同一组内比较;另一种是强制保持历史一致性(historical consistency),即只有当前缀历史完全相同的步骤才被分到一组,这种方式虽然保证了比较的公平性,却会导致分组极度碎片化,组内同侪(peer)数量骤减,优势估计因样本不足而变得不可靠。
这两种策略的根本矛盾在于覆盖度(coverage)与比较公平性(fairness)之间的权衡。宽泛分组保证了统计充分性但牺牲了语义准确性,严格分组保证了语义准确性但牺牲了统计充分性。如何在两者之间找到平衡,成为本文要解决的核心问题。
方法
ProGPO 的设计哲学可以概括为"保留精确比较、补充分稀疏信号"。作者观察到,在步级分组学习中,真正有价值的比较是"精确前缀动作比较"——即只有当两个动作之前的所有历史完全一致时,比较才是有意义的。强制历史一致性虽然会导致组碎片化,但 ProGPO 并不试图通过放宽历史条件来增加组内样本,而是采用另一种策略:用转移信用(transition credit)来补充稀疏的同侪比较信号。
具体而言,当某个状态-动作对在当前 rollout 中找不到足够的同侪进行比较时,ProGPO 会借助状态势能(state potentials)来推断该动作可能带来的未来收益变化。状态势能的核心思想是:在一个好的策略下,智能体在不同状态下应该具有不同的"潜力值"——更接近目标的状态具有更高的势能,而远离目标的状态势能较低。如果一个动作将智能体从低势能状态带到高势能状态,那么这个动作就应该获得正向的信用;反之则应获得负向信用。这种基于势能差的信用分配方式不依赖于精确的 Critic 网络学习,而是通过 rollouts 本身的状态转移信息来估计。
然而,状态势能的估计本身也面临挑战。在长程交互任务中,状态的语义空间可能非常复杂,简单的状态键匹配难以捕捉不同状态之间的实际"距离"。为解决这一问题,ProGPO 提出了两个关键技术:语义扩展(semantic expansion)和跨历史深度的逆方差融合(inverse-variance fusion across history depths)。
语义扩展的目的是在估计势能时,不仅考虑精确匹配的状态,还要将与当前状态语义相近的其他状态纳入参考。具体地,ProGPO 使用嵌入模型计算状态之间的语义相似度,当某个状态在当前批次中没有精确匹配的历史时,可以通过扩展搜索找到语义最接近的状态,用其势能作为当前状态的近似。
逆方差融合则用于在多个历史深度上综合势能估计。直觉上,浅层历史(如最近几步)可能对当前状态势能有更直接的影响,而深层历史虽然信号更稀疏但可能捕捉更长程的依赖关系。逆方差融合的核心是根据每个估计的方差为其分配权重——方差越小(即估计越可靠)的信号获得越高的权重,方差越大(如深层历史中样本稀缺的估计)的信号权重相应降低。通过这种方式,ProGPO 能够自适应地平衡不同深度历史信息的贡献。
综合以上设计,ProGPO 的完整流程可以描述为:对于每个步骤,首先检查是否存在满足历史一致性条件的同侪;如果有,则使用标准的组内优势估计;如果同侪数量不足,则回退到基于状态势能的转移信用估计,并将语义扩展和逆方差融合的结果作为补充信号。最终,这些信号被整合为统一的步级优势估计,用于策略梯度的更新。
值得强调的是,ProGPO 是"免学习评论家"(learned-critic-free)的——它不需要训练额外的价值网络来估计优势函数,所有势能信息都从当前批次的 rollouts 中实时估计得到。这使得方法的计算开销与基线方法相近,同时避免了 Critic 训练可能带来的误差累积和不稳定性问题。
实验与结果
研究团队在两个具有代表性的智能体任务上评估了 ProGPO 的效果:ALFWorld 和 WebShop。ALFWorld 是一个基于文本的交互式家务任务环境,智能体需要根据自然语言指令在虚拟环境中完成多步骤操作;WebShop 则是一个模拟电商网站的任务,智能体需要搜索、浏览商品并完成购买。这两个任务都要求智能体进行长序列的决策,并且中间步骤的质量直接影响最终的成功率,因而非常适合检验步级学习的有效性。
基座模型方面,团队选择了 Qwen2.5-1.5B-Instruct 和 Qwen2.5-3B-Instruct 两种规模的模型,分别对应轻量级和中等规模的部署场景。实验的核心比较对象是"匹配的智能体强化学习基线"——即在相同 rollout 批次大小、相同更新步数、相同基座模型下,仅在分组策略上有所不同的方法。这种匹配设计确保了比较的公平性,使得任何性能差异都可以归因于分组策略本身的有效性。
主要实验结果如下:在 ALFWorld 任务上,ProGPO 相比基线方法的成功率提升显著;在 WebShop 任务上,ProGPO 的优势同样稳定。这些提升并非以计算开销为代价——团队特意记录了每种方法的 GPU 时间消耗,发现 ProGPO 的开销与基线方法基本持平。这验证了"免 Critic"设计的实际价值:不引入额外的训练开销,却能获得更可靠的步级优势信号。
进一步的消融实验揭示了各组件的贡献。通过逐一移除语义扩展、逆方差融合等模块,研究者观察到性能的系统性下降,证实了这些技术并非冗余设计,而是共同构成了有效的势能估计体系。特别值得注意的是,当同侪比较信号本身已经较为丰富时(如某些简单子任务),语义扩展的边际贡献较小;但在复杂子任务中,组碎片化严重,语义扩展带来的补充信号显著改善了优势估计的稳定性。
补充实验还使用 Qwen2.5-3B-Instruct 验证了方法的扩展性。结果表明,模型规模增大后,ProGPO 的优势依然保持甚至有所扩大,这与直觉相符:更大的模型通常能产生更多样化的 rollouts,但同时也意味着分组可能更加碎片化,而 ProGPO 恰好能够弥补这一问题。
讨论与可借鉴点
ProGPO 的贡献在于为步级分组强化学习中的核心矛盾提供了一种优雅的解决思路:通过将精确的历史一致性比较与基于势能的转移信用相结合,既保留了比较的语义准确性,又通过额外的信用信号补充了碎片化带来的稀疏性问题。这种"精确比较为主、势能估计为辅"的设计哲学值得借鉴——它没有试图用单一机制解决所有问题,而是让不同机制各司其职、互补不足。
然而,ProGPO 仍存在若干局限性。首先,状态势能的估计依赖 rollout 中观察到的状态转移,在状态空间稀疏或转移模式单一的环境中,势能估计可能不够准确。其次,语义扩展模块引入的嵌入相似度计算虽然开销不大,但假设了嵌入空间能够有效捕捉任务相关的状态距离——对于某些需要精确状态匹配的任务,这一假设可能不成立。第三,方法在跨任务泛化方面的表现尚待验证——目前的实验集中于 ALFWorld 和 WebShop 两个任务,它们虽然风格不同,但都属于短文本交互环境,对于视觉-语言智能体或需要多模态感知的任务,ProGPO 的适用性需要进一步探索。
对于后续研究,一个有价值的方向是将 ProGPO 与学习型 Critic 进行对比或结合。虽然 ProGPO 刻意避开了 Critic 的训练,但两者并非互斥——在资源允许的情况下,可以先用 ProGPO 的思路初始化可靠的势能估计,再训练轻量级的 Critic 网络来加速推理。另一个方向是探索自适应选择机制,让模型根据当前步的同侪丰富度动态决定是否回退到势能估计,而非固定阈值判断。
总体而言,ProGPO 为大语言模型智能体在长程任务上的精细化策略优化提供了一种实用且可扩展的方案,其核心思想——精确比较与转移信用互补——有望推广到更广泛的强化学习场景中。
摘要
基于分组的强化学习(RL)已成为提升大语言模型智能体在长时序交互任务上表现的有效范式。为获得比轨迹级优化更细粒度的策略更新,近期工作开始转向步骤级分组强化学习,即在一次 rollout 批次内对中间步骤进行分组并比较。然而,步骤级的优势估计对分组方式十分敏感:按粗粒度状态键分组可提升覆盖度,但可能比较不同历史下采取的动作;而强制保持历史一致性虽能带来更公平的比较,却会使分组碎片化并损失同侪比较信号。本文提出 ProGPO(Progress- and Reliability-Oriented Group Policy Optimization,进度与可靠性导向的分组策略优化),一种无需学习 critic 的、保持上下文一致性的步骤级学习方法。ProGPO 保留精确前缀动作比较,并以基于 rollout 的状态势能导出的转移信用来补充稀疏的同侪比较。为可靠地估计这些势能,ProGPO 将语义扩展与跨历史深度的逆方差融合相结合。我们在 ALFWorld 与 WebShop 两个具有挑战性的智能体任务上,以 Qwen2.5-1.5B-Instruct 为基础模型对 ProGPO 进行了评估。结果表明,在相近的计算开销下,ProGPO 优于匹配的智能体 RL 基线方法;此外,基于 Qwen2.5-3B-Instruct 的补充实验进一步验证了所提方法的可扩展性。
Abstract
Group-based reinforcement learning (RL) has become an effective paradigm for improving large language model agents on long-horizon interactive tasks. To obtain finer-grained policy updates than trajectory-level optimization, recent work has moved toward step-level group-based RL, where intermediate steps are grouped and compared within a rollout batch. However, step-level advantage estimation is sensitive to how groups are formed: grouping by broad state keys improves coverage but may compare actions taken under different histories, while enforcing historical consistency yields fairer comparisons at the cost of fragmented groups and missing peer-comparison signal. In this paper, we propose ProGPO (Progress- and Reliability-Oriented Group Policy Optimization), a learned-critic-free method for context-consistent step-level learning. ProGPO keeps exact-prefix action comparison, and complements sparse peer comparisons with transition credit derived from rollout-based state potentials. To estimate these potentials reliably, ProGPO combines semantic expansion with inverse-variance fusion across history depths. We evaluate ProGPO on two challenging agentic tasks, ALFWorld and WebShop, with Qwen2.5-1.5B-Instruct. Results show that ProGPO improves over matched agentic RL baselines under comparable computational overhead, and additional Qwen2.5-3B-Instruct experiments further test the scalability of the proposed method.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




