面向多任务智能体强化学习的熵调步策略优化
Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning
📝 TLDR
在多任务智能体强化学习中,不同任务间存在探索-利用节奏不匹配问题:简单任务过早收敛至低熵策略,制约困难任务学习,而困难任务又反过来将简单任务推向高熵探索,形成熵交叉与频繁波动。为此本文提出熵步调策略优化EPPO,通过任务级动态裁剪替代GRPO中固定阈值,实现任务间熵协调。在多任务智能体基准上,EPPO优于现有方法,为多任务agentic RL训练稳定性提供新方案。
🧭 速览
多任务agentic RL中任务间探索-利用节奏不一致,简单任务过早低熵收敛,困难任务被反向推回高熵探索,造成跨任务熵交叉与训练不稳定。
提出熵步调策略优化EPPO,以任务级熵感知的动态裁剪机制替代GRPO固定裁剪阈值,对过自信任务收紧、对欠探索任务放宽策略更新。
在多任务agentic基准上,EPPO优于GRPO等基线方法,有效缓解熵波动并提升多任务整体表现。
EPPO通过跨任务熵协调为多任务智能体RL训练稳定性提供新路径,验证任务级熵自适应控制的有效性。
📊 论文图表(共 15 张)
展开查看 15 张图
TL;DR
这篇论文针对多任务智能体强化学习中不同任务间探索-利用节奏不匹配的问题,提出了名为 EPPO(Entropy Pacing Policy Optimization)的解决方案。通过将 GRPO 中的固定裁剪阈值替换为任务熵感知的自适应边界,EPPO 实现了跨任务的熵协调与更新步幅调控。实验结果表明,在五任务和三任务训练场景下,EPPO 均显著优于 AgentRL 等基线方法,且训练过程中的熵曲线更加稳定。
研究背景与动机
近年来,强化学习已成为训练复杂智能体大语言模型的关键技术,在推理规划、工具调用等任务上展现出巨大潜力。然而,现有工作大多聚焦于单任务场景,而现实应用往往需要通用智能体能够同时处理多种不同类型的任务。多任务智能体强化学习因此成为研究热点,但如何在异构任务间高效协调学习过程仍是悬而未决的难题。
现有研究主要沿两条路线推进:第一条是专家训练加蒸馏的流水线方案,如 MiMo-V2-Flash 和 DeepSeek-V3.2 等模型所采用的分阶段训练策略;第二条是端到端联合训练路线,以 AgentRL 为代表直接在多任务混合数据上进行 GRPO 训练。作者指出,这两条路线都存在显著缺陷——蒸馏路线依赖教师模型性能上限且错失任务间的正向迁移机会,而端到端联合训练则面临更根本的挑战:不同任务在训练过程中会相互干扰,形成梯度冲突。
更关键的是,作者在实验中发现了一个此前未被充分重视的现象:在多任务 GRPO 训练中,不同任务表现出明显的探索-利用节奏错配。具体而言,学习曲线较为平缓的简单任务(如操作系统命令执行)往往过早收敛到低熵的确定性策略,而困难的推理任务则需要较长时间维持高熵的探索状态。这种不对称性导致两类任务的策略熵曲线反复交错,形成所谓的熵交叉现象。更糟糕的是,随着训练推进,困难任务对共享参数的调整会反过来污染已收敛任务的策略,将其重新推向高熵的探索状态,产生晚训练熵尖峰。这种来回拉锯使得多任务训练过程极不稳定,难以收敛到高质量的多任务策略。
方法
面对上述问题,EPPO 的核心思路是:既然固定裁剪阈值无法同时满足收敛任务和探索任务的不同需求,那就用任务级的动态裁剪范围来替代。具体而言,以策略熵作为任务探索状态的在线指示器,对已坍缩至低熵的过自信任务收紧更新幅度,对仍处于高熵状态的欠探索任务放宽更新幅度,从而实现跨任务的熵协调。
整个方法包含三个相互配合的模块。第一个模块是熵追踪器,负责对每个任务 计算当前策略的策略熵 ,并用指数移动平均(EMA)进行平滑以抑制多回合交互带来的噪声,得到 。随后以训练初期熵值 为基准,构造无量纲的熵坍缩比 ,用于衡量任务相对于初始状态的探索程度。
第二个模块是全局进度调速器,负责将各任务的坍缩比转化为任务级的裁剪边界。首先将所有任务的 在任务间归一化为 z 分数 ,这一步的核心作用是消除任务间绝对熵值量纲的差异,使不同任务可以在同一尺度下进行比较。接着通过有界缩放因子将 z 分数映射为逐任务的裁剪乘数 ,最终的裁剪范围为 。由于 ,且 ,故 被限制在 区间内, 控制了调速强度的上限。直观上理解,当任务熵低于均值()时,其裁剪范围会收缩到 以下,更新受到抑制;反之则放宽更新约束。
第三个模块是稳定性趋势约束,用于应对训练后期可能出现的熵反弹振荡问题。作者观察到,当某个任务的熵出现回升时,往往意味着其策略正在经历重新随机化,此时若给予过大的更新步幅,可能加剧震荡甚至引发发散。因此该模块定义了熵趋势 ,并规定当 (熵上升)时,需要额外收紧更新幅度。
最终,EPPO 将 GRPO 的固定 clip 替换为任务熵感知的自适应边界,形成了新的目标函数:
论文还在附录中提供了理论分析,证明 EPPO 的裁剪范围始终有界,且趋势约束具有收缩性和 Lipschitz 连续性,为方法的稳定性提供了形式化保障。
实验与结果
实验基于 AgentBench 改造的多任务智能体基准展开,包含五个任务:操作系统命令执行(OS)、数据库查询(DB)、知识图谱导航(KG)、文本型家务操作(ALFWorld)和在线购物交互(WebShop)。作者在两组任务混合设置下进行了训练评估——五任务全量训练和三任务子集(ALFWorld、DB、OS)训练,骨干模型涵盖 Qwen2.5-0.5B、Qwen2.5-3B 和 Qwen3-8B 三个规模。
在多任务训练对比中,EPPO 相比核心基线 AgentRL 取得了显著提升。五任务场景下,Qwen2.5-3B 的平均成功率从 51.6% 提升至 54.3%;三任务场景下,该指标从 56.8% 提升至 59.1%,Qwen3-8B 则从 61.6% 提升至 63.1%。与同样采用动态裁剪的 DCPO 和 BAPO 相比,EPPO 也展现出稳定优势。作者进一步报告了稳定性诊断的量化结果:跨任务熵曲线交叉次数从基线的 727 次降至 555 次,晚训练熵尖峰幅度从 0.443 降至 0.351,趋势拟合 从 0.107 升至 0.154。这些数据表明 EPPO 确实将熵曲线从反复交叉的混乱状态引导至更加平稳的带状分布。
消融实验验证了两个组件的贡献。移除任务级动态裁剪后,性能出现显著退化,证明该机制是方法的核心支柱;移除趋势约束后在五任务高冲突场景下出现明显性能衰减,说明该模块在复杂任务组合中尤为关键。超参敏感度分析表明 是较为稳健的取值,过小会导致协调效果不足,过大则会引入不必要的振荡。此外,作者还在 RLOO 训练框架下验证了 EPPO 的可迁移性,发现同样带来约 1.4 个百分点的提升,说明该方法并非 GRPO 专属。
下游推理迁移方面,经过多任务 agentic 训练后的模型在标准推理基准上展现出差异化表现。在 MATH500、GSM8K、GPQA 等任务上,EPPO 训练出的模型优于 AgentRL 基线;而在 MMLU-Pro 和 AIME 系列上则略有下降,作者将其归因于不同任务类型对探索-利用权衡的不同需求。
讨论与可借鉴点
EPPO 的一个重要贡献在于将多任务强化学习中的节奏不匹配现象从经验观察提升为可量化的诊断维度。通过交叉次数、趋势 和尖峰幅度这三项指标,研究者得以更系统地评估不同训练策略对多任务协调的影响。这种从现象到机制的闭环分析范式值得借鉴。
从方法论角度看,EPPO 的设计哲学值得品味:作者并未声称熵直接等价于学习进度,而是将其定位为探索状态的指示符,将自适应裁剪定位为更新步幅的调节旋钮。这种保守而精确的概念界定避免了过度解读,同时充分利用了熵作为策略确定性代理的直观物理含义。
然而,这项工作也存在若干局限。首先,实验仅在 AgentBench 的固定任务集上验证,缺乏跨领域泛化性评估,真实应用场景中的具身智能、GUI 导航等任务可能呈现不同的交互模式。其次,当前方法仅以策略熵作为单一信号,未与奖励稀疏度、模型不确定性等其他信号进行融合,更丰富的探索指示器可能带来更精细的协调效果。第三,EPPO 针对固定任务集的静态协调设计,尚未与动态任务调度或课程学习策略进行联合优化。此外,由于复现环境与原 AgentRL 论文存在硬件配置和代码层面的差异,部分性能增益能否严格归因于机制本身仍有待更严格的消融控制验证。
对于后续研究而言,EPPO 的框架提供了若干有价值的探索方向:将熵协调机制扩展至更大规模的任务集合、探索多模态探索信号的信息融合、以及设计与动态任务采样策略的联合优化方案等。
摘要
近年来强化学习(RL)的突破凸显了其在复杂智能体大语言模型(LLM)任务中的潜力。然而,现有工作主要聚焦于单任务场景,而实际部署需要能够同时解决多个任务的通用智能体。在本文中,我们识别出多任务智能体强化学习中一个关键但尚未充分探索的现象:不同任务可能表现出探索-利用节奏的不匹配。具体而言,较容易的任务可能过早收敛到低熵策略,从而阻碍对较困难任务的学习;而较困难的任务反过来又可能将较容易的任务推回高熵探索状态。这种反复的相互作用产生了任务间的熵交叉现象和频繁的熵尖峰。受此观察启发,我们提出了面向多任务智能体大语言模型的熵调步策略优化(EPPO),该方法通过跨任务协调熵来稳定多任务优化。EPPO的核心是一种逐任务动态裁剪机制,它将组相对策略优化(GRPO)中的固定裁剪阈值替换为任务熵感知的自适应边界,对过度自信的任务收紧更新幅度,对探索不足的任务放宽更新幅度。在多任务智能体基准上的实验表明,所提出的EPPO能够取得优于其同类方法的性能。
Abstract
Recent breakthroughs of Reinforcement Learning (RL) have highlighted its potential for complex agentic Large Language Model (LLM) tasks. However, existing efforts largely focus on single-task settings, whereas real-world deployment necessitates a generalist agent capable of solving multiple tasks simultaneously. In this work, we identify a critical yet underexplored phenomenon in multi-task agentic RL: different tasks can exhibit exploration-exploitation pace mismatch. Specifically, easier tasks may converge early to low-entropy policies that hinder learning on harder tasks, while harder tasks can, in turn, push easier tasks back toward high-entropy exploration. This back-and-forth interaction creates inter-task entropy crossovers and frequent entropy spikes. Inspired by this observation, we introduce Entropy Pacing Policy Optimization (EPPO) for multi-task agentic LLMs, which coordinates entropy across tasks to stabilize multi-task optimization. At the core of EPPO is a task-wise dynamic clipping mechanism that replaces the fixed clipping threshold in Group Relative Policy Optimization (GRPO) with a task entropy-aware adaptive bound, tightening updates for over-confident tasks while relaxing them for under-explored ones. Experiments on the multi-task agentic benchmarks demonstrate that the proposed EPPO yields results superior to its counterparts.
论文详细总结(自动生成)
论文总结:面向多任务智能体强化学习的熵调步策略优化(EPPO)
1. 核心问题与整体含义
1.1 研究背景
- 强化学习(RL)已成为训练复杂智能体大语言模型(LLM Agent)的关键技术,但现有工作多聚焦于单任务场景。
- 实际部署需要通用智能体(Generalist Agent)能同时处理多任务,这推动了多任务智能体强化学习(Multi-Task Agentic RL)的研究。
- 现有路径存在不足:
- 专家训练 + 蒸馏路线(如 MiMo-V2-Flash、DeepSeek-V3.2):分阶段流水线复杂,且依赖教师性能,可能错失正向迁移。
- 端到端联合训练路线(如 AgentRL):异构任务在同一策略下梯度冲突严重,简单任务过早收敛、困难任务长期欠探索,导致负迁移。
1.2 本文识别的关键现象:"节奏不匹配"(Pace Mismatch)
- 作者观察到多任务 GRPO 训练中一个关键但被忽视的现象:不同任务呈现探索-利用节奏(Exploration-Exploitation Pace)的错配。
- 具体表现:
- 熵交叉(Entropy Crossover):简单任务过早坍缩至低熵;困难任务保持高熵,两条曲线反复交错。
- 晚训练熵尖峰(Late-Stage Spikes):被"过自信"任务污染的共享参数,会把已稳定任务重新推向高熵。
- 根源分析:GRPO 的全局固定裁剪范围 是任务无关(task-agnostic)的信任域代理,无法同时让"已收敛"任务保留探索与让"欠探索"任务获得足够更新。
2. 方法论:熵调步策略优化(EPPO)
2.1 核心思想
- 用 任务级动态裁剪 替代 GRPO 中的固定 ,将熵作为任务探索状态的在线指示器,通过相对步调(Relative Pace)协调跨任务更新幅度。
- 即:过自信任务(熵坍缩快)→ 收紧裁剪;欠探索任务(仍高熵)→ 放宽裁剪;并通过趋势约束抑制反弹引发的振荡。
- 设计哲学澄清:作者不主张熵等价于学习进度,仅把熵当作探索状态的指示符,把 当作更新步幅的调节旋钮。
2.2 算法三模块(对应图 2)
模块 A:熵追踪器(Entropy Tracker)
- 任务 的策略熵定义为
- 用 EMA 平滑以抑制多回合噪声
- 记录初始参考 ,构造无量纲熵坍缩比
模块 B:全局进度调速器(Progress Pacer)
- 将 在任务间归一化为 z 分数
- 通过有界缩放因子生成逐任务裁剪
- 因 ,故 , 控制调速强度。
- 含义:(过自信)→ ;(欠探索)→ 。
模块 C:稳定性趋势约束(Stability-Aware Trend Constraint)
- 定义熵趋势 。
- 当熵上升时收紧更新
- 直觉:熵回升说明任务进入重随机化(re-randomization)状态,需抑制激进更新以避免振荡。
2.3 目标函数
最终 EPPO 损失替换 GRPO 的固定 clip:
其中 。
2.4 理论保证(附录 D)
- 命题 1(裁剪一致有界):对所有 有 。
- 命题 2(趋势约束的收缩性):当 时收缩比 ,且对 单调递减;有效信任域半径对 Lipschitz 连续。
3. 实验设计
3.1 数据集 / 场景
基于 AgentBench 改造的五个智能体任务:
| 任务 | 内容 |
|---|---|
| OS | 操作系统命令执行 |
| DB | 数据库查询(含 BIRD 增广) |
| KG | 知识图谱导航 |
| ALFWorld | 文本型家务操作 |
| WebShop | 在线购物交互 |
数据构造:ALFWorld、WebShop 用官方数据集;OS/KG/DB 用 Self-Instruct 合成数据。奖励归一化至 ,异常终止 。
3.2 训练设置
- 主骨干:Qwen2.5-3B-Instruct(部分实验含 Qwen2.5-0.5B、Qwen3-8B)。
- 任务混合:两组——五任务训练、三任务训练(ALF+DB+OS)。
- EPPO 超参:,,;裁剪边界 ,。
3.3 对比方法
- API 基线:Claude-Sonnet-4 (含 Thinking)、o3-mini、o4-mini、GPT-5。
- 开源基线:DeepSeek-V3、DeepSeek-R1、Qwen2.5 系列(3B/14B/32B)、Hephaestus-8B(Base/IFT)、AgentLM(7B/13B/70B)。
- RL 基线(核心):
- AgentRL(主基线,多任务 GRPO + 任务优势归一化)
- DCPO(动态裁剪,单任务级别)
- BAPO(off-policy 自适应裁剪平衡策略优化)
- 其他泛化性验证:基于 RLOO 的 EPPO 变体(附录 B)。
4. 资源与算力
- GPU 型号与数量:8 块 NVIDIA H20 GPU(论文正文明示,附录 A 进一步说明)。
- 硬件差异:原 AgentRL 论文使用 16 块 H800;本文复现受限于 H20。
- 训练框架:
- Actor 模型 float32;Reference 模型 bfloat16;梯度检查点开启。
- Ray 编排 + FSDP (NCCL) 分布式训练;SGLang 用于推理。
- GPU 在 rollout 与训练间均分,多出 25% 的 rollout 资源用于跨策略采样,每 25 步同步。
- 训练规模:700 步,每批 128 prompts,每个 prompt 8 个 rollout;AdamW,,无 weight decay;token-mean loss,每 micro-batch 最多 16384 tokens。
- 附录 C:详述复现与原 AgentRL 报告结果的差异原因(代码层修复、H20 vs H800 硬件差异、软件版本与非确定性)。
- 训练时长:未明确披露(论文未给出小时数)。
5. 实验数量与充分性
5.1 核心实验组
- 多任务训练对比:5 任务训练(表 1)+ 3 任务训练(表 2,含三种 backbone 规模)。
- 泛化性实验:RLOO 变体(附录 B,表 6)。
- 下游推理迁移:AIME 24+25、MATH500、GSM8K、MMLU-Pro、GPQA(表 3)。
- 稳定性诊断:3 个量化指标——交叉次数 Crossover Count、趋势 、晚训练尖峰幅度(图 1c)。
- 学习曲线:5 任务和 3 任务的验证集 pass-rate 轨迹(图 3)。
- 消融:去掉任务级动态裁剪 / 去掉趋势约束(表 4);附带 z-score 轨迹分析(图 4)与各组件熵曲线(附录 F,图 7)。
- 超参灵敏度:三任务下 (表 5)。
5.2 实验充分性评价
- 较充分:
- 五任务 / 三任务两个粒度,多个 backbone(0.5B/3B/8B)验证泛化性。
- 提供了量化诊断指标(交叉计数、趋势 、尖峰幅度),佐证现象并支撑方法。
- 含组件消融、超参敏感度与 RLOO 变体的算法可移植性检验。
- 可能的不足:
- 与原 AgentRL 论文在硬件(H20 vs H800)和代码修改上不一致,作者在附录 C 进行了说明,但仍可能影响数值公平性。
- 仅使用 Qwen 系列骨干,未涵盖 Llama、DeepSeek 等其他家族。
- 任务集合固定为 AgentBench 中的 5 个,未扩展到动态任务采样或工具调用真实场景。
6. 主要结论与发现
1. 现象揭示:在多任务 agentic GRPO 中确实存在"节奏不匹配"现象,伴随跨任务熵交叉与晚训练熵尖峰。
2. 方法有效:EPPO 在五任务与三任务训练下平均成功率均优于 AgentRL、DCPO、BAPO。论文报告差距:
- 5 任务(Qwen2.5-3B):AgentRL 51.6 → EPPO 。
- 3 任务(Qwen2.5-3B):AgentRL 56.8 → EPPO ;Qwen3-8B:61.6 → 。
3. 稳定性提升:EPPO 下熵曲线呈"稳定带状"(persistent bands),跨任务交叉次数从 727 降至 555,尖峰幅度从 降至 ,趋势 从 升至 。
4. 下游迁移:训练后模型在 MATH500、GSM8K、GPQA 上表现优于 AgentRL;但 AIME 24+25 略弱于 AgentRL,MMLU-Pro 普遍下降。
5. 组件贡献:任务级动态裁剪起主导作用;趋势约束在 5 任务高冲突场景尤其关键(去掉后在 KG、ALFWorld 出现明显退化)。
6. 可迁移性:在 RLOO 训练下,EPPO 也带来 的平均提升,说明其不仅是 GRPO 专属。
7. 方法 / 实验亮点
- 问题识别新颖:将"节奏不匹配"从经验观察提升为可量化诊断(交叉计数、趋势 、尖峰幅度),形成现象→机制→方法的闭环。
- 轻量即插即用:仅替换裁剪范围为 ,无需重构训练流水线,额外统计量极小(EMA + 任务级 z 分数)。
- 形式化保证:在附录 D 通过两个命题给出裁剪统一有界性与趋势约束的 Lipschitz 性质,区别于纯经验方法。
- 多层验证:现象诊断 + 主对比 + 消融 + 超参灵敏度 + RLOO 变体 + 下游推理迁移,覆盖较全面。
- 可视化友好:图 2 全景框架图清晰呈现三模块与更新引擎的耦合关系。
8. 不足与局限
1. 任务集合受限:仅在 AgentBench 的 5 个任务、2 种任务数量组合下评估,缺少跨域(如具身、GUI 导航、长文档 QA)与更多任务数的验证。
2. 未考虑动态任务调度:仅处理固定任务集,未与任务采样/课程学习策略进行联合优化。
3. 超参与信号单一:仅以政策熵为探索指标,未与奖励稀疏度、回放难度、模型不确定性等其他信号融合。
4. 复现偏差风险:复现 AgentRL 时改动了交互循环的鲁棒性和任务调度代码,且硬件(H20 vs H800)差异可能引入数值偏差(附录 C)。EPPO 与原版 AgentRL 的差值能否严格归因于机制,而非环境差异,仍需更严格的消融控制。
5. 下游推理覆盖窄:AIME、MATH500、GSM8K 等仅作为迁移性测试,与训练目标(多任务智能体)非同一分布,正向迁移幅度的解释力有限。
6. 可扩展性未验证:未在更大模型(如 13B+)和更长训练周期下验证,对训练资源敏感。
7. 缺乏人类偏好对齐的对照:本文聚焦策略优化与稳定性,未与 RLHF / DPO 等对齐目标做联合考量。
(完)
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。














