arXiv 2607.05378v1 · 发布 2026-07-06

CompactionRL:基于上下文压缩的强化学习用于长视野智能体

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

AUTHORS Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong
EVIDENCE 为长时域LLM智能体设计强化学习策略
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-08 21:40:41 UTC

📝 TLDR

长时程智能体LLM受限于有限上下文窗口,扩展交互轨迹常超出最大长度。本文提出CompactionRL强化学习策略,将上下文压缩机制融入训练流程,联合优化任务执行与摘要生成。该方法在agentic编程基准上一致提升性能,GLM-4.5-Air模型在SWE-bench Verified达66.8% Pass@1。CompactionRL已实际部署于GLM-5.2大模型的强化学习训练管线。

🧭 速览

动机

长时程agentic LLM在执行任务时交互轨迹易超出有限上下文窗口,导致任务未完成即被截断,限制了其处理长跨度任务的能力。

方法

CompactionRL通过token级损失归一化与跨轨迹广义优势估计,将上下文压缩融入强化学习,联合优化任务执行和摘要生成。

结果

GLM-4.5-Air在SWE-bench Verified达66.8%(+7.0)、Terminal-Bench 2.0达24.5%(+3.1);GLM-4.7-Flash分别达56.0%和20.2%,提升5.5与6.8点。

结论

CompactionRL将上下文压缩成功引入agentic强化学习训练,显著提升长时程任务表现,已成为GLM-5.2训练管线的关键组件。

📊 论文图表(共 9 张)

展开查看 9 张图

TL;DR

CompactionRL 将上下文压缩机制嵌入强化学习训练流程,使大语言模型智能体能够在压缩后的长视野轨迹上学习如何更好地完成任务和生成摘要。实验表明,该方法让开源的 GLM-4.5-Air 模型在 SWE-bench Verified 上达到 66.8% 的 Pass@1 分数,在 Terminal-Bench 2.0 上达到 24.5%,分别较基线提升 7.0 和 3.1 个百分点。目前该方法已被部署于 GLM-5.2 大模型的 RL 训练管线。

研究背景与动机

长时程智能体大语言模型正面临一个根本性的制约:有限的上下文窗口。这类模型在执行复杂任务时,需要通过多轮交互来收集信息、调用工具、观察环境反馈并做出下一步决策。随着交互次数增加,工具输出、中间推理过程、错误信息等会不断累积,使得对话历史迅速膨胀,最终可能超出模型能够处理的最大长度限制。

这一问题的紧迫性在于,随着模型能力提升和任务复杂度增加,交互轨迹只会越来越长。传统的解决思路是扩展上下文窗口尺寸,但这种方法成本高昂,且已有研究表明,即使拥有超长上下文,模型在"中间位置"的信息利用效率也会出现明显退化。如何在有限窗口内有效处理无限增长的交互历史,成为制约长视野智能体发展的关键瓶颈。

上下文压缩提供了一种自然且直接的解决路径——对先前的交互状态进行摘要,用简洁的压缩表示替代冗长的历史记录,然后在压缩后的上下文上继续执行后续操作。然而,既有研究大多将压缩视为推理时的启发式手段或外部记忆操作,尚未将其系统地融入强化学习训练流程。CompactionRL 正是看到了这一关键缺口:当摘要取代原始历史后,摘要质量本身就成为决定后续决策成败的核心因素,而非仅仅是预处理步骤。

方法

CompactionRL 的核心设计围绕一个朴素却关键的洞察:压缩后的摘要不是被动的信息压缩,而是主动参与决策的关键信息源。因此,摘要本身必须被纳入优化目标,与任务执行能力联合训练。

该方法基于 PPO 框架构建,将上下文压缩嵌入到 rollout 收集过程中。当智能体与环境交互时,系统会持续监测当前上下文长度与最大窗口之间的剩余空间。当剩余空间降至预设阈值 以下时,触发压缩机制:由同一个可训练的策略模型生成一段摘要,该摘要捕捉此前交互的核心信息。压缩完成后,上下文被重构为"摘要 + 最近若干步交互"的形式,智能体继续在压缩后的上下文上执行后续操作。

这一设计面临一个核心挑战:传统组式强化学习方法(如 GRPO)依赖固定大小的 rollout 组进行奖励归一化,而压缩机制使得单条轨迹会被切分为数量不定的段,导致组样本结构失衡。更重要的是,压缩边界的存在使得原有的优势估计方法失效——每个压缩段都共享最终的任务级奖励,但如果简单地对每个段独立应用广义优势估计(GAE),早期段获得的信用分配会比真实轨迹中更近,无法准确反映时间距离。

为解决这一问题,CompactionRL 提出了两项关键技术。首先是 token 级损失归一化。在优化过程中,传统的段平均加权方式会导致压缩次数较多的轨迹获得不成比例的影响权重。CompactionRL 转而对批内每个被优化的 token 位置赋予相等权重,使得优化信号不再受段数或段长差异的偏倚影响。

其次是跨轨迹广义优势估计。设某段包含 个优化 token,本地 GAE 计算该段内部的优势值。然而,如果直接将本地优势用于所有段,会忽略跨压缩边界的时间距离。跨轨迹 GAE 在本地优势基础上乘以位置折扣 ,其中 表示后续所有段包含的 token 总数。这使得位于较早压缩段的 token 获得更大的时间折扣,准确反映了它们到最终奖励的真实距离,从而实现更精确的信用分配。

整个训练流程可以概括为:策略模型在压缩与非压缩段交替执行,通过 token 级损失归一化平衡不同轨迹的优化权重,借助跨轨迹 GAE 准确分配跨压缩边界的信用,最终实现任务执行能力与摘要生成质量的联合优化。

实验与结果

实验在智能体编程场景下展开,主要评测基准包括 SWE-bench Verified 和 Terminal-Bench 2.0。前者从代码修复任务集合中采样评测,后者覆盖终端操作相关的复杂任务。评测采用固定采样 200 个任务的方式,在 Harbor 环境中使用 Terminus-KIRA 智能体脚手架执行。

研究团队在两种规模的 GLM 模型上验证了方法效果。GLM-4.7-Flash(30B-A3B MoE架构)配置 64k 上下文窗口,GLM-4.5-Air(106B-A30B)配置 80k 窗口。基线对比包括:无压缩的标准 PPO、仅在推理时使用压缩、以及训练时开启压缩但不对摘要损失进行优化的变体。

结果显示,CompactionRL 在两个基准上均取得一致提升。GLM-4.5-Air 在压缩 4 倍的评测条件下(SWE-bench Verified 80k×4、Terminal-Bench 2.0 80k×4)分别达到 66.8% 和 24.5% 的 Pass@1,相较基线提升 7.0 和 3.1 个百分点。GLM-4.7-Flash 则从基线的 50.5% 和 13.4% 提升至 56.0% 和 20.2%,分别增长 5.5 和 6.8 个百分点。值得注意的是,在禁用压缩的单窗口评测下,CompactionRL 与基线表现接近,说明性能收益完全来源于训练与评测条件的一致性——压缩作为一种可学习的技能,只有在训练阶段纳入优化目标才能真正发挥价值。

消融实验进一步揭示了各模块的贡献。移除摘要损失训练会显著损害压缩评测表现,证明摘要质量本身需要被显式优化。Token 级损失归一化对最终性能影响最大,去除后出现明显退化。跨轨迹 GAE 同样不可替代,它确保了跨压缩边界的信用分配准确性。

行为分析显示,经过训练的摘要能够有效提高压缩后的交互效率。CompactionRL 产生的压缩次数和工具调用次数均低于无摘要训练的对比方法,表明模型学会了生成信息密度更高的摘要,减少不必要的重复探索。

讨论与可借鉴点

CompactionRL 的核心贡献在于将上下文压缩从推理时的启发式技巧提升为可训练的强化学习技能。这一转变的关键在于认识到:压缩边界改变了信用分配的结构,简单的组式方法不再适用,必须引入 critic 机制和精确的优势估计来适应可变长的压缩轨迹。

从工程视角看,该方法已通过 GLM-5.2 的实际部署验证了可行性。Token 级损失归一化和跨轨迹 GAE 虽然增加了实现复杂度,但相对于扩展上下文窗口的计算成本,这些额外开销是可接受的。该框架具有良好的可扩展性——压缩触发条件、摘要提示设计、折扣因子等超参数可根据不同任务特点进行调整。

当前工作也存在一些局限。首先,论文未披露具体算力开销(GPU 型号、数量、训练时长),这对复现工作构成障碍。其次,评测仅在编程相关任务上验证,压缩策略在其他领域(如多模态交互、复杂推理)的泛化性尚待考察。此外,摘要质量对最终任务表现的敏感性意味着,压缩机制可能在某些需要保留细粒度历史信息的场景中受限。

对于后续研究而言,CompactionRL 提供了一个重要启示:上下文压缩不应被视为简单的预处理步骤,而应作为智能体能力的一部分纳入端到端训练。这一思路可以拓展到多模态场景中的视觉记忆压缩、跨会话的长期记忆整合等问题中。同时,跨轨迹优势估计中关于时间折扣的设计也值得在更一般的变长序列强化学习问题中借鉴。

摘要

长视野智能体大语言模型正日益受到有限上下文窗口的制约,因为扩展的交互轨迹可能在任务完成之前就超过最大上下文长度。上下文压缩提供了一种自然而直接的解决方案——对先前的交互状态进行摘要,并在压缩后的上下文下继续执行——但将压缩机制融入强化学习仍鲜有探索。我们提出 CompactionRL,一种结合上下文压缩来训练长视野智能体大语言模型的强化学习策略。该方法通过 token 级损失归一化和跨轨迹广义优势估计,联合优化任务执行与摘要生成。这一设计使得大语言模型智能体能够从压缩后的长视野轨迹中学习。我们在开源模型之上训练 CompactionRL,并在智能体编程任务上观察到稳定的性能提升。CompactionRL 使开源 GLM-4.5-Air 模型(106B-A30B)在 SWE-bench Verified 上达到 66.8% 的 Pass@1 分数,在 Terminal-Bench 2.0 上达到 24.5%,分别取得了 7.0 和 3.1 个百分点的绝对提升。在 GLM-4.7-Flash(30B-A3B)的基础上,CompactionRL 将 Pass@1 分别提升 5.5 和 6.8 个百分点,在 SWE-bench Verified 上达到 56.0%,在 Terminal-Bench 2.0 上达到 20.2%。因此,CompactionRL 已被部署于训练开源 GLM-5.2 模型(750B-A40B)的强化学习流程之中。

Abstract

Long-horizon agentic LLMs are increasingly limited by finite context windows, as extended interaction trajectories can exceed the maximum context length before a task is completed. Context compaction offers a natural solution by summarizing previous interaction states and continuing the rollout under a compressed context, but incorporating compaction into reinforcement learning remains underexplored. We propose CompactionRL, a reinforcement learning strategy to train long-horizon agentic LLMs with context compaction. Our approach jointly optimizes task execution and summary generation with token-level loss normalization and cross-trajectory generalized advantage estimation. This design enables the LLM agents to learn from compacted long-horizon trajectories. We train CompactionRL on top of open models and observe consistent performance gains on agentic coding tasks. CompactionRL enables the open GLM-4.5-Air model (106B-A30B) to achieve Pass@1 scores of 66.8% on SWE-bench Verified and 24.5% on Terminal-Bench 2.0, with absolute gains of 7.0 and 3.1 points, respectively. Built upon GLM-4.7-Flash (30B-A3B), CompactionRL improves Pass@1 by 5.5 and 6.8 points, reaching 56.0% on SWE-bench Verified and 20.2% on Terminal-Bench 2.0, respectively. CompactionRL is thus deployed in the RL pipeline for training the open GLM-5.2 model (750B-A40B).


论文详细总结(自动生成)

CompactionRL 论文总结

1. 核心问题与研究动机

长时程(long-horizon)智能体大语言模型(如 SWE-bench、Terminal-Bench 等场景中的 agentic LLM)通过反复推理、调用工具、观察环境反馈来完成任务,交互轨迹中的工具输出、中间推理、错误信息等会迅速累积至超长序列。然而,受限于模型的有限上下文窗口,交互历史可能尚未完成任务就已触顶,导致执行被迫截断。

  • 观察:单纯通过扩展上下文长度成本高昂,且已有研究表明 LLM 对超长上下文的有效利用存在退化("lost in the middle")。
  • 既有方案:上下文压缩(context compaction)在 MemGPT、Reflexion、Generative Agents、SUPO、ReSum、Context-Folding 等工作中以推理时启发式外部记忆操作的形式出现,未被纳入强化学习训练流程。
  • 关键缺口:当 compact 后的摘要取代原始历史后,摘要本身就成为后续决策的唯一信息来源——因此摘要质量变成性能关键因素,而非被动预处理。但现有 agentic RL 流水线(如 GRPO)建立在"完整 rollout + 组内归一化"的假设上,压缩使其崩坏:
  • 单条 rollout 会被切分为数量不定的段,使固定大小的组归一化不再适用;
  • 若把压缩段当作独立样本优化,会扭曲损失加权与时序信用分配。

2. 方法论

2.1 整体思路

CompactionRL 是一个基于 PPO 的强化学习框架,将 context compaction 嵌入到 rollout 收集过程中:在剩余上下文预算低于阈值 时,由同一可训练策略生成一段摘要,并以"摘要 + 最近 步交互"重构上下文继续执行。摘要段与执行段共享最终的任务级奖励 ,一并纳入 RL 目标。

2.2 压缩触发与上下文重构

设当前历史为

其中 为系统提示, 为用户指令, 为第 步的助手响应与环境观察。当

触发压缩:先追加摘要指令 ,从策略采样摘要

随后将上下文重构为

默认 ,并在必要时缩减以保证 适配上下文预算。整个 rollout 被切分为段序列

每段为"执行段"或"摘要段",所有段共享任务级奖励

2.3 组式方法为何失效

GRPO 等组式方法依赖固定大小的 rollout 组做组内奖励归一化。在压缩场景中,一条 rollout 对应 个段,组样本数变为 ,各 rollout 在组统计中的权重因压缩次数不同而失衡;同时组归一化无法给"段级别"提供独立优势。CompactionRL 因此选用了基于 critic 的 PPO 框架,借助 value function 支持可变长段与单样本情况。

2.4 Token 级损失

段数与段长差异巨大,若按"段平均"加权,压缩多的 rollout 会过度影响更新。CompactionRL 采用 token 级损失归一化

其中 为批内所有被优化的助手 token 位置集合。每个被优化 token 获得等权,显著降低段数/段长不均带来的偏差。

2.5 跨轨迹广义优势估计(Cross-Trajectory GAE)

段级独立优化会把最终任务奖励放在每段末尾,导致早期段的奖励看起来比真实轨迹更近,过早信用分配。设段 个优化 token,本地段 GAE 为

定义

跨轨迹 GAE 在本地 GAE 基础上乘以位置折扣:

从而使 token 处获得的实际折扣为 ,恰好对应于该 token 在完整压缩后 rollout 中到最终结果的真实距离。

3. 实验设计

3.1 训练与评测基准

  • 训练数据:开源 SWE-Dev 代码工程数据;
  • 评测基准
  • SWE-bench Verified:从全集随机采样 200 个任务,报告 Pass@1(与全量公开分数不可直接比较,已声明);
  • Terminal-Bench 2.0:使用全集;
  • 评测框架:Harbor 环境,Terminus-KIRA 智能体脚手架;top-p=1.0,temp=1.0,最长 250 个交互轮次、最多 3 次压缩。

3.2 模型与基线

训练两种开放模型规模:

  • GLM-4.7-Flash(30B-A3B)——上下文预算 k;
  • GLM-4.5-Air-SFT(106B-A30B)——上下文预算 k,其中 GLM-4.5-Air-SFT 由 GLM-4.7 生成的轨迹 SFT 得到。

每个模型都初始化 critic,并在训练集上做 50 步 value pretraining。Advantage 估计采用 length-adaptive GAE(),并对 critic 做 2 次更新 / 1 次策略更新。

主要对比对象:

  • base 模型 + 推理时压缩;
  • 标准 PPO without compaction:与 CompactionRL 同 / 更长训练预算;
  • CompactionRL 不训练摘要变体(mask 掉摘要响应损失);
  • 公开基线:GPT-5 mini(72.0/31.9)、Qwen3-Coder-480B-A35B(66.5/23.9)、gpt-oss-120b(62.0/18.7)、Qwen3-Coder-30B-A3B、Qwen3-235B-A22B、Qwen3-30B-A3B、Qwen3.5-35B-A3B 等(说明脚手架不同,仅作参考)。

3.3 训练超参

  • 全局 batch size = 128,组大小 = 1;
  • 单响应上限 10,240 tokens,压缩阈值 tokens;最多 3 次压缩 / rollout;
  • 优化器 Adam,policy 学习率 ,critic 学习率
  • RL 框架使用开源异步 RL 框架 slime

4. 资源与算力

文中未明确披露所用 GPU 型号、数量、训练总时长等具体算力信息。仅给出:

  • 全局 batch size = 128;
  • 训练步数大约 80 步(从图 4 训练动力学横轴推断);
  • 使用开源 RL 框架 slime 与 Harbor / Terminus-KIRA 评估栈;
  • 在 30B 与 106B 模型上进行实验,提示训练应至少在多节点并行环境上完成。

因此算力规模与训练时长作为信息缺口明确指出

5. 实验数量与充分性

论文整体做了较大规模的验证,主要包括:

  • 总结器质量敏感性实验(Table 1):固定执行智能体 GLM-4.7-Flash,切换 Qwen3.5-27B / GLM-4.7-Flash / Qwen3-30B-A3B 三种摘要器,证明摘要质量决定任务表现;
  • 主结果(Table 2):4 个模型变体 × 2 个基准 × 2 个评测上下文窗口(Single ×1 / Compacted ×4)+ 6 个公开基线;
  • 两组规模的完整消融(Table 3):包括"无压缩 + 同 / 加倍上下文"、"有压缩但掩掉摘要损失"、"完整 CompactionRL"等共 6 种配置;
  • 核心优化模块消融(Table 4):在 GLM-4.5-Air-SFT 上分别移除 token 级损失与跨段 GAE;
  • 行为分析(Figure 3):压缩次数、工具调用次数、压缩触发任务子集准确率三项;
  • 训练动力学(Figure 4):摘要长度、推理 token、策略熵的变化曲线;
  • 每项实验报告 2 次评测均值。

整体看,实验在不同模型规模、基准、消融维度上较为系统,并通过"加长上下文窗口的无压缩 RL"作为强参照,体现了对比的公平性。但评测任务数(SWE-bench 上 200 条)和评测次数(每个实验 2 次)相对有限,仍有提升空间。

6. 主要结论与发现

  • 压缩必须进入训练:当把 compact 作为 trainable skill 训练时,长视野 agentic 表现显著提升;推理时压缩 + 标准 PPO 不足以释放完整潜力(甚至在压缩评测下发生退化)。
  • 主结果(Table 2):
  • GLM-4.5-Air:CompactionRL 在 80k×4 压缩评测下达 SWE-bench Verified 66.8% / Terminal-Bench 2.0 24.5%,分别提升 +7.0 / +3.1 绝对点;
  • GLM-4.7-Flash:在 64k×4 压缩评测下达 56.0% / 20.2%,分别提升 +5.5 / +6.8
  • 同时单窗口(禁用压缩)下 CompactionRL 与 base 接近,说明收益主要来自训练-评测一致地开启压缩。
  • 消融结论
  • 训练摘要 vs. 不训练摘要:训练摘要一致提高压缩评测表现(80k×4: 64.5 → 66.8;80k×4 Terminal: 21.5 → 24.5);
  • token 级损失与跨段 GAE 都对最终性能关键,去掉 token 级损失退化最大;
  • 压缩感知训练能在短峰值上下文(64k/80k)下追平甚至超过"窗口加倍的无压缩训练"。
  • 行为研究(Figure 3):CompactionRL 在压缩触发子集上 Pass@1 最高,且压缩次数 / 工具调用次数均显著低于无摘要训练变体,说明学到的摘要提高了后压缩的交互效率。
  • 训练动力学(Figure 4):随训练进行,摘要长度变长且更详尽、每轮推理 token 上升、策略熵上升更慢。
  • 工程化落地:CompactionRL 已作为基础组件部署在 GLM-5.2(750B-A40B)开源模型的 RL 训练流水线中。

7. 优点

  • 问题定位精准:抓住"compact 把历史一刀切成不可逆的段"这一核心特性,分析了组式优势估计和段级 GAE 的不适用性,给出 PPO + critic 的清晰理由;
  • 机制设计完整:token 级损失归一化解决长度/段数偏倚,跨轨迹 GAE 解决跨压缩边界的信用分配,二者搭配形成可解释的优化闭环;
  • 联合优化摘要:把摘要从"推理时启发式"提升为"可学习策略",并通过 Table 1 的对照充分说明其必要性;
  • 多规模验证:在 30B 与 106B 两档 MoE 模型上均观察到稳定收益,还扩展到 750B GLM-5.2;
  • 消融与可解释性强:包括 base / standard RL / CompactionRL(w/o sum.) / CompactionRL 四档对比,并辅以摘要长度、压缩次数、工具调用熵等训练动力学曲线;
  • 直接工程落地:被 GLM-5.2 实际采用,体现工业可用性。

8. 不足与局限

  • 算力信息披露缺失:未提供 GPU 类型 / 数量 / 总训练时长 / 调参细节,复现门槛较高;
  • 训练-评测口径失衡:在禁用压缩的 single-window 评测下,CompactionRL 相比 base / 标准 RL 没有稳定增益,部分基准甚至显著下降,反映存在训练-评测不匹配;
  • GAE 仅为近似:跨轨迹 GAE 用 折扣做近似,但压缩后"摘要对未来多个段"的长期影响仍无法精确刻画,存在对早期摘要信用低估或高估的风险;
  • 领域覆盖有限:实验主要聚焦代码工程类(swe-dev + SWE-bench Verified + Terminal-Bench 2.0),对 web / GUI / 多模态等长视野 agent 场景的外推未知;
  • 摘要奖励的简化设计:未对摘要本身设计显式奖励,仅靠最终任务奖励进行信用传播,可能限制训练效率与可控性,也未分析摘要幻觉风险;
  • 评测规模与统计强度:SWE-bench Verified 采用 200 条随机子集,每个实验仅 2 次评测,且公开基线脚手架不一致,对比公平性有限
  • 最大压缩次数限制:每 rollout ≤ 3 次压缩,对超长视野任务的扩展性未充分验证。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记