分支策略优化:沙箱原生语言智能体强化学习
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning
📝 TLDR
提出分支策略优化方法,在沙箱环境中原生支持语言智能体的强化学习以提升复杂任务能力。
🧭 速览
现有LLM智能体RL算法沿用RLHF的N条独立轨迹结构,未利用沙箱确定、可快照、可恢复的特性,导致共享前缀的方差被浪费。
提出BPO算法,在高熵决策点快照沙箱,分叉K条替代动作至终止,以兄弟回报计算逐步优势而非按prompt分组基线。
在WebShop、ALFWorld和SWE-bench Verified上以Qwen2.5-7B与Llama-3.1-8B为骨干,BPO在相同算力下较GRPO和RLOO成功率提升3.6至6.1个百分点。
证明该估计无偏且方差严格低于轨迹级基线,缩减量等于前缀可解释的回报方差占比。
📊 论文图表(共 3 张)
展开查看 3 张图
TL;DR
这篇论文针对大语言模型智能体在沙箱环境中的强化学习训练提出了分支策略优化方法,通过利用沙箱可快照、可恢复的独特性质重构 rollout 拓扑,让兄弟分支共享前缀轨迹从而压缩方差。实验表明,该方法在 WebShop、ALFWorld 和 SWE-bench Verified 三个基准上将成功率绝对提升 3.6–6.1 个百分点,同时将梯度方差减半,并以减少 38% 的策略更新次数达到与最佳基线相当的效果。
研究背景与动机
训练能够与 [[沙箱]] 环境交互的 [[大语言模型]] 智能体,已成为当前 AI 研究的核心课题之一。这类智能体需要在真实或准真实的执行环境中做出一系列决策,并通过反馈信号不断改进自身行为,[[强化学习]] 是实现这一目标的主流范式。
在现有的 RL 算法家族中,PPO、RLOO 和 GRPO 都遵循一种经典的设计模式:对于每个输入提示,从初始状态出发独立采样 条轨迹(称为 rollout),然后通过减去一个组基线(group baseline)来计算 [[优势函数]]。这种 rollout 拓扑直接继承了 RLHF 的设计理念——每棵轨迹树都从根节点独立生长,兄弟轨迹之间没有任何共享结构。
研究者指出了一个长期被忽视的事实:智能体的沙箱环境具有三个独特的性质——确定性、可快照化和可恢复性。这意味着我们不需要每次都从零开始探索,而是可以保存某个中间状态,然后从那里派生出多条不同的行动路径。这一特性在传统 RLHF 场景中并不存在(因为人类反馈无法被快照和复用),但在沙箱交互任务中却是天然可用的。
正是这一特性启发了根本不同的 rollout 拓扑设计:与其构造 棵深度为 的独立树,不如构建一棵统一的树,让兄弟节点共享前缀轨迹。这样做的好处是,前缀部分的探索不确定性只需要计算一次,而不是被重复 次,从而实现 [[方差缩减]]。
方法
BPO 的核心思想可以概括为三个步骤:自适应快照、分支 rollout 和 兄弟优势估计。
首先是快照策略的选择。如果在每个决策点都进行快照,会产生大量冗余开销;而如果快照点太少,又无法充分利用沙箱的可恢复性。BPO 采用自适应策略:在沿着主干轨迹(backbone trajectory)行进时,通过监测每个决策点的熵来判断其重要性——熵越高意味着决策越不确定,分支探索的潜在收益越大。具体地,研究者设定了一个熵阈值,当某一步的策略分布熵超过该阈值时,就在该状态处保存沙箱快照。
快照完成后,算法在每个分支点派生 个替代动作,然后将每个动作继续 rollout 至任务终止。值得注意的是,这 条分支共享从起点到快照点之间的全部前缀轨迹。从统计角度看,前缀部分的结果方差只需要被计算一次,而不是被 倍放大。
最关键的部分在于优势函数的计算方式。在传统 GRPO 中,每条轨迹的优势是通过该轨迹的回报与同批次所有轨迹回报均值的差值来估计的。在 BPO 中,研究者提出了一种基于兄弟节点回报的估计量:对于分支点 处的第 个动作,其优势定义为
其中 是第 条分支的累积回报, 是分支数。直观地说,这个估计量衡量的是当前动作相对于同分支点其他替代方案的相对优劣。
论文给出了严格的理论证明:BPO 的优势估计量是无偏的,即其期望值等于真实优势;更重要的是,它的方差严格小于轨迹级基线的方差,而方差缩减量恰好等于由共享前缀所解释的回报方差部分。这一结论说明,前缀共享不仅仅是一种工程上的优化,而是从信息论角度看确实降低了估计的不确定性。
实验与结果
实验在三个标准基准上进行:WebShop(网页购物任务)、ALFWorld(家庭助理任务)和 [[SWE-bench]] Verified(真实软件工程任务)。基座模型选用 Qwen2.5-7B 和 Llama-3.1-8B,以确保实验覆盖不同规模的模型。
为了保证公平比较,所有基线方法在计算量上保持一致。具体而言,GRPO 和 RLOO 使用 条独立轨迹,而 BPO 使用 1 条主干轨迹加上 个分支点(在总步数相等的约束下进行换算)。
实验结果呈现出清晰的一致性:在三个基准上,BPO 相比 GRPO 和 RLOO 取得了 3.6–6.1 个百分点的绝对成功率提升。这一幅度看起来不大,但在 SWE-bench Verified 这种高难度任务上,绝对准确率每提升一个百分点都意味着显著的能力进步。
除了点估计的改进,方差指标同样令人瞩目。BPO 将梯度范数的方差降低了一半,这意味着每次策略更新更加稳定,训练曲线更不容易出现剧烈震荡。更大的效率红利在于,BPO 仅需基线方法 62% 的策略更新次数(即减少 38%)就能达到相近的最终性能。这对于训练成本敏感的场景具有直接的实际价值。
研究者还进行了消融实验来验证各组件的贡献。结果表明,自适应快照策略比固定间隔快照效果更好,这印证了"在高熵点分支"的直觉;兄弟优势估计相比轨迹级基线确实能稳定地降低方差; 值的选择也存在收益递减现象,过大的分支数会带来额外的估计偏差。
讨论与可借鉴点
BPO 的成功揭示了一个更普遍的原则:在设计 RL 算法时,应当充分利用环境特性的先验知识。沙箱的可恢复性一直存在于这类任务中,但现有算法选择性地忽略它,转而套用为人类反馈设计的 rollout 拓扑。BPO 的贡献在于正视这一特性,并将其转化为数学上可证的效率优势。
从更宽的视角看,这一思路可以推广到其他具有类似特性的场景。例如,如果某个环境具有确定性的状态转移函数,或者可以低成本地克隆状态,都可能借鉴"共享前缀"的思想来压缩方差、提升采样效率。
当然,BPO 也有其局限。首先,它依赖于沙箱环境支持快照和恢复操作,这对环境本身提出了额外要求。其次,理论保证建立在兄弟节点回报条件独立的假设上,在某些任务中这个假设可能不完全成立。第三,自适应快照的熵阈值需要手动设定,如何让算法自动学习最优的快照策略仍是一个开放问题。
对于从业者而言,BPO 的启发在于:当你的训练算法在某个领域表现不佳时,不妨回到该领域环境的基本假设去审视——那些被当作"通用设定"的设计,可能恰恰遗漏了本领域独有的优化空间。
摘要
强化学习已成为训练与可执行沙箱交互的大语言模型(LLM)智能体的主流范式。诸如 PPO、RLOO 和 GRPO 等最先进算法沿袭了 RLHF 的 rollout 拓扑结构:针对每个提示,从初始状态独立采样 N 条轨迹,并通过减去一个组基线来计算优势函数。该设计忽略了一个决定智能体沙箱性质的关键特性——它们是确定性的、可快照化的,并且可以从任意中间状态恢复。我们认为这一特性支持一种根本不同的 rollout 拓扑:与其构造 N 棵深度为 T 的独立树,不如构建一棵具有 N 个叶子节点的单一树,使兄弟节点共享前缀,从而共享方差。我们将这一思想实例化为分支策略优化(BPO),这是一种沙箱原生强化学习算法,其工作流程包括:(i)沿着主干轨迹在高熵决策点自适应地对沙箱进行快照;(ii)在每个分支点派生 K 个替代动作,并将每个动作 rollout 至终止;(iii)依据兄弟节点的回报而非独立提示来计算每一步的优势函数。我们证明该估计量是无偏的,且其方差严格低于轨迹级基线,方差缩减量恰好等于由前缀所解释的回报方差部分。在以 Qwen2.5-7B 和 Llama-3.1-8B 为基座模型的 WebShop、ALFWorld 和 SWE-bench Verified 上,在计算量匹配的条件下,BPO 相较 GRPO 和 RLOO 将成功率绝对提升了 3.6–6.1 个百分点,将梯度范数方差减半,并以减少 38% 的策略更新次数达到与最佳基线相当的效果。
Abstract
Reinforcement learning has emerged as the dominant paradigm for training large language model (LLM) agents that interact with executable sandboxes. State-of-the-art algorithms such as PPO, RLOO, and GRPO inherit their rollout topology from RLHF: for each prompt, N independent trajectories are sampled from the initial state, and an advantage is computed by subtracting a group baseline. This design ignores a defining property of agent sandboxes. They are deterministic, snapshottable, and resumable from any intermediate state. We argue that this property enables a fundamentally different rollout topology: rather than N independent trees of depth T, one can construct a single tree of N leaves whose siblings share prefixes, and therefore share variance. We instantiate this idea as Branching Policy Optimization (BPO), a sandbox-native RL algorithm that (i) adaptively snapshots the sandbox at high-entropy decision points along a backbone trajectory, (ii) forks K alternative actions per branch point and rolls out each to termination, and (iii) computes per-step advantages from sibling returns rather than from independent prompts. We prove this estimator is unbiased and has strictly lower variance than the trajectory-level baseline, with the reduction equal to the prefix-explained portion of return variance. On WebShop, ALFWorld, and SWE-bench Verified with Qwen2.5-7B and Llama-3.1-8B backbones, BPO improves success by 3.6–6.1 absolute points over GRPO and RLOO at matched compute, halves gradient-norm variance, and matches the best baseline using 38% fewer policy updates.
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。


