面向智能体强化学习的单次采样异步优化
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
📝 TLDR
大语言模型后训练的强化学习管道多为同步批量式,对长时序智能体任务效率低下。SAO提出以单rollout采样替代GRPO的组采样,并引入严格双侧token级clipping以提升异步训练的稳定性与off-policy性能。该方法在SWE-Bench Verified等基准上稳定训练超千步并超越GRPO及变体,已成功部署于GLM-5.2开源模型的智能体训练管线。
🧭 速览
现有同步批量RL管道对长时序智能体任务效率低,异步RL虽提升吞吐但稳定性不足,且GRPO组采样与异步训练不兼容。
提出SAO,以单rollout替代组采样,结合实用价值模型训练设计,并引入严格双侧token级clipping策略。
在SWE-Bench Verified、BeyondAIME、IMOAnswerBench上稳定训练超千步,超越GRPO及其变体。
单rollout异步RL在模拟在线学习场景下尤为有效,已成功应用于GLM-5.2(750B-A40B)智能体训练管线。
📊 论文图表(共 11 张)
展开查看 11 张图
TL;DR
SAO 提出以单次采样替代 GRPO 的组采样策略,并配合直接双侧重要性采样与严格 token 级裁剪,解决了异步强化学习在长程智能体任务中的稳定性与 off-policy 偏差问题。该方法在数学推理与代码智能体基准上稳定训练超过千步,性能显著超越 GRPO 及其变体,已部署于 GLM-5.2(750B-A40B)的开源智能体训练管线。
研究背景与动机
大语言模型的后训练正在经历一场从监督微调向强化学习范式的深刻转变。然而,现有 LLM 的 RL 流水线大多采用同步批量式架构:先由模型生成一批完整轨迹,再进行多轮策略优化。这种设计在短回复任务(如简单问答)上尚可运行,但面对长程智能体任务时暴露出严重的效率瓶颈——不同轨迹的长度差异巨大,短轨迹快速完成而长轨迹成为"掉队者",整个 GPU 集群在等待中陷入空闲。此外,GRPO 等主流方法依赖按组采样,即每个提示词生成多个 rollout 并等待组内所有轨迹完成才能进入训练,这一机制与异步执行的自然流程形成了根本性的冲突。
更深层的挑战在于离策略偏差。当采样与训练解耦后,轨迹可能由多个版本的旧策略生成,策略 lag 随异步程度加剧,导致传统 [[重要性采样]] 的重要性权重严重偏离真实分布,策略更新方向失准。现有异步 RL 系统虽然在系统吞吐量上做了大量优化,但对训练稳定性与任务有效性的算法层面关注明显不足。
SAO 的核心动机正是填补这一空白:设计一种既能与异步执行天然契合、又能保持训练稳定性和任务有效性的 RL 算法。具体而言,研究者从三个层面入手——用单次采样替代组采样以消除等待屏障、设计直接双侧重要性采样以降低 off-policy 效应、以及针对智能体轨迹结构定制优势估计方法。
方法
SAO 的方法论围绕三条主线展开,每一条都针对异步 RL 的特定痛点。
直接双侧重要性采样(DIS) 是整个框架的基石。传统 PPO 需要维护三类策略——当前策略、旧策略和 roll-out 策略,在异步场景下精确追踪旧策略几乎不可行。SAO 选择了一个激进的简化:直接丢弃旧策略代理,使用 roll-out 阶段的 log-prob 作为行为概率。优势比的计算变为当前策略概率与 roll-out 概率的比值:
这看似冒险,但配合严格的裁剪策略后反而获得了意外的稳定性收益。SAO 引入了严格的双侧 token 级裁剪,将信任区间限制在 ,区间外的 token 直接从梯度计算中屏蔽:
最终优化目标整合为:
这种设计的直觉在于:传统 PPO 仅对部分 off-policy token 裁剪,而 SAO 将裁剪推广到所有 token,只有落在严格区间内的概率比才参与梯度更新,从根本上抑制了极端 off-policy 样本的破坏性影响。
单次采样替代组采样 是 SAO 与异步执行天然契合的关键。GRPO 的组采样要求同一提示词的所有 rollout 完成后才能计算优势估计,这在同步场景下尚可接受,但与"来一条轨迹就更新一次"的异步逻辑完全不兼容。SAO 将每条轨迹视为独立的优化单元:每个提示词仅使用一条采样轨迹,轨迹生成完毕立即送入训练,无需等待任何"同伴"。代价是梯度估计的方差显著上升——这本质上回到了 [[REINFORCE]] 的方差水平。研究者通过一系列价值模型训练设计来补偿:
首先是 TTUR(Time-scale Update Rule)策略,即策略网络每更新一次,价值网络更新 次。直觉是 critic 需要更快地适应新策略才能为策略更新提供可靠的基线。其次是冻结注意力参数的 value 模型训练。研究者观察到 critic 的不稳定主要来自 attention 层梯度远大于 policy 层,而 MoE(Mixture of Experts)层相对稳定。因此 SAO 在价值模型训练时冻结 attention 参数,仅优化 MoE 投影矩阵,使 critic 的更新更加平滑。最后是大规模 value 预训练,通过在大量轨迹数据上预训练价值函数来缓解冷启动问题。
针对智能体轨迹的 Skip-Observation GAE 解决了标准 [[广义优势估计]](GAE)在多轮交互任务中的适用性问题。智能体轨迹遵循交替的动作-观察结构 ,其中观察 是环境反馈而非模型生成。标准 GAE 在相邻 token 间计算时差时,跨越动作-观察边界会引入噪声——因为模型并未生成 ,却要为其计算优势估计。Skip-Observation GAE 的设计跳过观察 token,将优势估计直接连接相邻动作:
其中 ,通过跳过 间的 Bellman 递推,使优势估计更贴合模型实际决策点。此外,SAO 还设计了长度自适应的 GAE 系数 ,让短轨迹享有高 (低方差长视野估计)而长轨迹享有低 (高方差短视野估计),动态平衡偏差-方差权衡。
实验与结果
研究者在多个具有挑战性的基准上验证了 SAO 的有效性。在数学推理任务上使用了 AIME2025、BeyondAIME、HMMT Nov 2025 和 IMOAnswerBench,均配备 Python 工具调用能力;在代码智能体任务上使用了 SWE-Bench Verified,以 OpenHands 作为脚手架,允许最多 300 轮交互和 128k token 上下文。基模型为 Qwen3-30B-A3B-Thinking,数学任务还经过了 GPT-OSS-120B 生成的 TIR(Tool-Integrated Reasoning)数据的 SFT 热启动。
主实验结果显示,SAO 在所有五个基准上一致超越 GRPO 及其变体。AIME2025 上 SAO 达到 97.3 分,而 Vanilla GRPO 仅为 84.2;SWE-Bench Verified 上 SAO 为 29.8,GRPO 为 27.0。值得注意的是,Vanilla GRPO 在约 160 步后出现性能崩塌,加入 DIS 后虽可稳定训练但性能仍逊于 SAO。SAO 与 GRPO(加 DIS)在前 400 步性能接近,400 步后开始分化,说明单次采样的优势在中长程训练中更为显著。
消融实验揭示了各组件的贡献。Frozen-Attention + TTUR 组合显著提升了 explained variance 并降低了 critic 梯度范数,是稳定异步 RL 的关键。单次采样的价值在在线学习模拟中得到进一步验证——在风格偏好动态切换的写作任务中,SAO 的 value-based critic 能快速追踪奖励分布变化,而 Running-Mean baseline 存在明显适应滞后。此外,token-level GAE 明显优于 step-level(Average/Last-Token),AIME2025 准确率分别为 89.8 vs 85.8/87.3。
讨论与可借鉴点
SAO 最具启发性的贡献在于揭示了异步 RL 中"简单即稳健"的设计哲学。传统观点认为精确的重要性采样校正是必要的,为此需要维护复杂的策略版本链。但 SAO 用激进的简化(丢弃旧策略代理)与严格的裁剪配合,反而获得了更好的稳定性。这种"做减法"的思路值得借鉴:当系统复杂性成为瓶颈时,与其修补边缘情况,不如重新审视核心假设是否必要。
研究者在附录中也坦诚承认了若干局限。首先,算力信息的缺失使得实际效率收益难以评估——论文展示了训练稳定性与任务有效性,但未给出异步相比同步的训练-生成吞吐量提升或 wall-clock 加速比。其次,所有主实验均在 Qwen3-30B-A3B 这一个模型上完成,对不同规模或架构模型的迁移性未充分验证。价值模型的强依赖也是一个隐患:单次采样降低方差的关键在于 critic 质量,这要求专门的价值预训练,对基础设施提出较高要求。
从更宏观的视角看,SAO 的成功暗示了 [[Actor-Critic]] 架构在异步 LLM 训练中的潜力。传统 GRPO 之所以流行,部分原因是它避免了对 value model 的依赖,但在需要高样本效率或适应动态环境的场景下,value-based baseline 的价值不可替代。SAO 通过 Frozen-Attention 和 TTUR 等工程技巧使 critic 训练更加稳定,为这一方向提供了可操作的路径。
摘要
强化学习(RL)正日益重要地被用于大语言模型(LLMs)的后训练。此前针对 LLM 的 RL 流水线大多是同步且批量交叉的,这对于长程智能体任务而言效率较低。近年来,异步 RL 作为一种更高效的替代方案崭露头角,它能够在采样轨迹到达时即更新模型。然而,现有的异步 RL 系统往往侧重于吞吐量,而对训练稳定性与任务有效性的探索仍明显不足。例如,一个关键挑战在于,广泛使用的 GRPO 框架中按组采样的方式并不能自然地适配异步智能体训练。在本文中,我们提出单次采样异步优化(SAO),以应对异步 RL 中的稳定性与离策略(off-policy)挑战。为了降低离策略效应并提升泛化能力,我们以单次采样(即每个提示词仅使用一条采样轨迹)替代按组采样。我们还通过若干实用的价值模型训练设计进一步改进了这一单次采样策略。为了提升优化稳定性,我们引入了一种严格的双侧 token 级裁剪策略。SAO 能够稳定训练一千步,并在智能体编码与推理基准(如 SWE-Bench Verified、BeyondAIME 和 IMOAnswerBench)上持续优于 GRPO 及其变体。我们还证明,单次采样 RL 在模拟在线学习场景中尤为有效,在该场景下模型必须适应不断演变的环境。为此,SAO 已被成功部署于训练开源 GLM-5.2 模型(750B-A40B)的智能体 RL 流水线中。
Abstract
Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).
论文详细总结(自动生成)
SAO:面向智能体强化学习的单次采样异步优化 — 论文总结
一、核心问题与研究动机
随着 LLM 后训练阶段从监督预训练转向强化学习(RL),现有 LLM RL 流水线多为同步、批量交叉(batch-interleaved)的模式:先收集一批完整 rollout,再进行多轮优化。这种模式在长程智能体任务中存在显著瓶颈:
- 掉队者问题(straggler problem):智能体轨迹长度高度可变,短轨迹快速完成,长轨迹成为掉队者,GPU 集群在等待中大量空闲。
- 同步屏障:GRPO 等组采样方法必须等待同组所有轨迹完成才能进入训练,与异步执行天然不兼容。
- 离策略偏差加剧:异步场景下,单条轨迹可能由多个版本的旧策略生成,policy lag 导致更严重的 off-policy 问题。
现有异步 RL 系统(如 AReaL、ROLL Flash)主要关注吞吐量和系统效率,对训练稳定性和任务有效性的算法层面改进仍探索不足。SAO 正是填补这一空白:设计一种既稳定又高效的异步 RL 算法。
二、方法论
SAO 的核心思想围绕三条主线:直接双侧重要性采样(DIS)、单次采样替代组采样、以及针对智能体轨迹的 token 级 GAE 改造。
2.1 直接双侧重要性采样(DIS)
传统 PPO/GRPO 需要维护三类策略:当前策略 、旧策略 、rollout 策略 。在异步场景下,一条轨迹生成过程中 可能经历多次更新,精确追踪 计算开销极大甚至不可行。
SAO 的简化策略:
- 直接使用 rollout 阶段的 log-prob 作为行为概率代理,丢弃 ,即:
- 双侧校准的 token 级裁剪掩码:不同于标准 PPO 仅对部分 off-policy token 裁剪,SAO 将信任区间严格限制在 ,区间外的 token 直接从梯度计算中掩码掉:
最终优化目标为:
2.2 单次采样替代组采样
将 GRPO 的组采样(每 prompt 多个 rollout)替换为单次采样:每条轨迹生成完毕立即送入训练,无需等待同组其他轨迹。这天然适配异步执行,且避免了"组不平衡生成"偏差。
单次采样的代价是高方差梯度估计(类似 REINFORCE),因此 SAO 设计了配套的价值模型训练策略:
1. 价值模型更新频率高于策略模型(TTUR):每次策略更新时,价值网络更新 次,加速 critic 对当前策略的适应。
2. 冻结注意力参数的 value 模型训练(Frozen-Attention):观察发现 critic 的不稳定主要来自 attention 层梯度远大于 policy,MoE 层相对稳定;冻结 attention 参数,仅优化 MoE 投影,使 critic 训练更稳定。
3. 大规模 value 预训练:通过显著扩大 value pretraining 语料缓解冷启动问题。
2.3 智能体轨迹的 Skip-Observation Token 级 GAE
智能体轨迹结构为 ,其中 为模型动作、 为环境反馈。标准 GAE 在相邻 token 间计算时差,但跨越动作-观察边界(模型未生成 )会引入噪声。
SAO 提出 Skip-Observation GAE,将优势估计跳过观察 token,直接连接相邻动作:
其中 ,跳过 间的 Bellman 递推。
三、实验设计
3.1 数据集与基准
- 数学推理基准(带 Python 工具):AIME2025、BeyondAIME、HMMT Nov 2025、IMOAnswerBench
- 代码智能体基准:SWE-Bench Verified(使用 OpenHands 作为脚手架,最多 300 轮交互,128k token 上下文)
3.2 训练设置
- 基模型:Qwen3-30B-A3B-Thinking-2507(数学任务先经 GPT-OSS-120B 生成的 TIR 数据 SFT 3 轮)
- RL 超参:batch=128,group=1,最大长度 128k;策略学习率 ,;价值学习率 ,,10 步 warm-up;TTUR 系数
- 长度自适应 GAE:,
- 编码任务:
- GRPO 对照:每 batch 16 个 prompt、每 prompt 8 个 rollout(等效 batch=128)
- 评估:top-p=1.0、温度 1.0、最大生成长度 128k;AIME2025/HMMT/IMOAnswerBench 取 16 次平均,BeyondAIME 取 4 次平均
3.3 对比方法
- Vanilla GRPO(clip-higher 实现)
- GRPO (w/ DIS):将 SAO 的 DIS 策略嫁接到 GRPO
- SAO (w/ DIS only):仅用 DIS 但保留组采样
- Vanilla VAPO(长度自适应 GAE + value-based baseline)
- Running-Mean Baseline(滑动窗口 8 / 128 个最近奖励的均值作为 baseline)
- Single-step-update SAO(critic 每次只更新 1 次)
- Full-Parameter Value Training(不冻结 attention)
- 外部参考:Claude-Sonnet-4.5、GPT-5 High、GLM-4.7
四、资源与算力
论文未明确给出具体的 GPU 数量、型号及训练时长。仅可推断:
- 使用 Qwen3-30B-A3B(30B 总参数 / 3B 激活)作为基模型,属于 MoE 架构
- 最大上下文长度 128k token,batch size 128,单次训练可稳定运行约 1000 步
- SAO 已被成功部署用于训练开源 GLM-5.2(750B-A40B) 模型的智能体 RL 流水线,但未披露具体训练硬件配置与 wall-clock 时间
由于缺乏算力细节,实验可复现性在硬件层面受限。
五、实验数量与充分性
- 主结果:5 个基准(4 数学 + 1 代码) × 多组方法对比
- 消融实验(Table 3 & 4):
- 是否更快更新 critic(K=1 vs K=2)
- 是否冻结 attention 参数(frozen vs full-parameter)
- Vanilla VAPO vs SAO
- Running-mean baseline vs SAO
- SAO (w/ DIS only) vs GRPO (+DIS)
- 训练动力学分析(Figure 4):
- Explained Variance 随 step 变化
- Critic 梯度范数对比
- Token-level clip ratio 监控
- 在线学习模拟(Figure 5):在风格偏好动态变化的写作任务上验证 SAO 与 Running-Mean 的适应速度
- 附录消融:step-level(Average / Last-Token)vs token-level GAE 对比
评估的充分性:覆盖了主结果、消融、训练动态、在线学习、step/token 粒度等多个维度,实验设计较为系统。但消融数量主要在 Qwen3-30B-A3B 一个模型上完成,对不同规模 / 不同架构模型的迁移性未充分验证。
六、主要结论与发现
1. SAO 在所有 5 个基准上一致超越 GRPO 及其变体(AIME2025: 97.3 vs 84.2;SWE-Bench Verified: 29.8 vs 27.0)。
2. Vanilla GRPO 在约 160 步后出现性能崩塌;加入 DIS 后可稳定训练,但性能仍逊于 SAO。
3. SAO 与 GRPO(w/ DIS) 在前 400 步性能接近,400 步后开始分化,说明单次采样的优势在长程训练中更显著。
4. 冻结 attention + TTUR 价值模型能显著提升 explained variance 并降低 critic 梯度范数,是稳定异步 RL 的关键。
5. 单次采样天然适配在线学习:在风格偏好动态切换的写作任务中,SAO 的 value-based critic 能快速追踪奖励分布变化,而 Running-Mean 存在明显适应滞后。
6. token-level GAE 优于 step-level:附录实验表明 step-level (Average / Last-Token) 的 AIME2025 准确率仅 85.8 / 87.3,远低于 token-level 的 89.8。
七、优点与亮点
1. 算法设计简洁且系统:DIS 丢弃旧策略直接利用 rollout log-prob,简化实现的同时不牺牲稳定性。
2. 首次系统性地将单次采样引入异步智能体 RL,绕开了 GRPO 组采样与异步执行的天然矛盾。
3. 针对智能体轨迹设计的 Skip-Observation GAE,贴合多轮交互的实际数据结构。
4. 实验覆盖广:包含主基准、消融、训练动力学分析、在线学习模拟四个层面。
5. 工程落地验证:已成功部署至 GLM-5.2(750B-A40B)的智能体 RL 流水线,体现工业级可用性。
6. 诊断性可视化(Figure 4)很好地解释了"为什么 SAO 更稳定",增强了论证力度。
八、不足与局限
1. 算力信息缺失:未给出 GPU 型号、数量、训练时长与 wall-clock 加速比,难以评估实际效率收益。
2. 基模型单一:所有主实验均在 Qwen3-30B-A3B 上完成,未在小模型、非 MoE 模型或非智能体任务上验证泛化性。
3. 价值模型依赖较强:单次采样降低方差的关键在于 critic 质量,需要专门的价值预训练,对基础设施要求高。
4. 在线学习实验仅是"模拟":写作风格的偏好切换由人工设定的 reward 函数控制,与真实用户场景仍有距离。
5. 代码任务仅 SWE-Bench Verified 一项,未覆盖更多代码智能体场景(如 HumanEval-Fix、RepoBench 等)。
6. 缺乏与同步 PPO/GRPO 的 head-to-head 效率对比:仅展示训练曲线,未给出训练-生成吞吐量、解码成本等系统级指标。
7. 附录中 step-level 实验表明 token-level GAE 更优,但作者未深入解释为何 step-level 失败的根因,分析略显不足。
8. 局限声明部分(Appendix B)作者也承认:结论可能不直接迁移到更小模型、非智能体 RLHF 设置或短 rollout 的稠密奖励环境。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。










