arXiv 2607.01120v1 · 发布 2026-07-01

下一代智能体强化学习系统赋能自进化智能体

Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents

AUTHORS Ran Yan, Wei Fu, Jiale Li, Shusheng Xu, Zhiyu Mei, Jiaxuan Gao, Jiarui Zhang, Xujie Shen, Hao Dai, Chuyi He, Zhen Pu, Jun Mei, Zhiyao Lin, Haitao Wang, Zhiqiang Ding, Jiawei Zhang, Huaijie Wang, Ruida Xu, Youhe Jiang, Yi Wu, Tongkai Yang, Binhang Yuan
EVIDENCE 面向自进化智能体的强化学习系统
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-08 21:37:00 UTC

📝 TLDR

当前企业级LLM智能体的权重、提示、工具均冻结,能力提升依赖人工数据收集与离线微调。本文认为制约自进化智能体落地的瓶颈并非强化学习算法,而是缺乏三大基础设施:步粒度的轨迹数据协议、企业级工作负载数据代理,以及统一的进化控制平面。文章提出下一代智能体强化学习系统应围绕这三者协同设计,并基于AReaL2.0构建了面向策略权重更新的在线学习回路。

🧭 速览

动机

企业部署的LLM智能体在权重、提示、工具方面完全静态,能力演进依赖离线人工循环,制约了自进化智能体在大规模服务中的落地。

方法

提出三大核心支柱:步粒度轨迹数据协议、企业级工作负载数据代理、统一进化控制平面,并基于AReaL2.0实例化在线强化学习回路。

结果

通过AReaL2.0将现有强化学习基础设施重组为面向智能体的在线回路,实现从已部署工作负载直接更新策略权重。

结论

下一代智能体强化学习系统需围绕数据协议、数据代理与控制平面三大支柱协同设计,方能支撑企业级自进化智能体服务。

📊 论文图表(共 2 张)

展开查看 2 张图

TL;DR

这篇论文指出企业级自进化智能体落地的真正瓶颈不在于[[强化学习]]算法本身,而在于缺乏支撑在线学习的系统基础设施。论文提出应围绕三大支柱协同设计下一代智能体强化学习系统:标准化的步粒度轨迹数据协议(ATDP)、企业级数据代理、以及统一的进化控制平面,并基于 AReaL2.0 原型验证了将现有 [[强化学习]] 基础设施改造为在线智能体学习回路的可行性。

研究背景与动机

当大语言模型智能体从实验室走向生产环境时,一个根本性的矛盾逐渐浮现:部署的智能体需要应对异构业务环境中复杂的长视野任务——调用工具、检索文档、操作 API、更新记忆、申请人工审批——但其能力提升却依赖部署后的人工循环。运维人员需要审查轨迹、设计评测基准、修改提示、添加工具描述、重新训练模型并重新部署,整个过程不仅耗时,而且无法捕捉生产环境中持续涌现的真实改进信号。

近期面向个人用户的自进化智能体研究已经验证了"从自身经验中持续学习"这一方向的可行性。OpenClaw、MetaClaw、SkillClaw 等工作表明,[[大型语言模型]] 的下一次能力飞跃将来自于能够持续从自身经验中学习的智能体。然而,这些面向个人用户的方案与企业级场景存在本质差异:后者需要处理多租户隔离、权限管理、审计合规、跨团队工作流协调等复杂约束。论文的核心论点是:阻碍企业级自进化智能体部署的瓶颈不是更大规模的 [[大型语言模型]] 或更聪明的 [[强化学习]] 算法,而是缺乏一套能够将部署后的智能体交互经验转化为受治理、可归因、可回放学习材料的系统底座。

方法

论文将下一代智能体 [[强化学习]] 系统拆解为三个必须协同设计的支柱。

第一个支柱是标准化智能体轨迹数据协议(ATDP)。当前缺乏一种能够跨异构智能体范式承载步级 [[强化学习]] 信号的通用格式。论文定义的轨迹由一系列类型化事件组成,其中每个事件包含可观测状态(工具输出、检索片段、用户消息)、隐藏内部状态(计划、推理摘要、置信度)、所选动作(带类型化参数的函数调用或文本生成)、动作结果(工具返回或用户反馈)、奖励信号(二元结果、标量分数、自然语言批评)以及元数据(时延、token 数、租户标识、模型版本)。这一定义使得轨迹不仅可用于学习,还能满足企业级的审计和合规需求。ATDP 的设计遵循六项原则:决策相关信息的有限揭示保证隐私与效用的平衡;迟到奖励机制允许奖励字段事后追加而不破坏因果归因;版本化可回放能力绑定 harness schema、工具版本、检索索引快照等完整上下文,确保训练与推理的一致性;治理可观测性则内置数据分类标签和训练资格字段,满足监管要求。

第二个支柱是企业级智能体数据代理。这个组件并非单纯的 API 网关或日志服务,而是将生产负载转化为受治理学习材料的必需机制。它的插桩位置覆盖 LLM 调用、工具调用、检索调用、记忆读写、文件操作、审批事件、用户反馈等稳定执行边界。数据代理的核心挑战在于框架无关的拦截能力——必须兼容 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、MCP 工具等异构编排框架,同时保留 prompt 模板指纹、system-prompt 版本、暴露工具、解码参数、采样输出等完整上下文。数据代理还需要区分确定性回放、近似回放和不可回放事件,并支持跨租户聚合与隔离。奖励采集方面,论文将用户回复、ticket 重开率、测试失败、人工纠错、审批延迟、下游编辑等弱信号和延迟信号视为候选学习信号。数据完整性检查——包括 redaction、访问控制、保留与训练资格检查——构成 [[强化学习]] 循环的第一道安全边界。

第三个支柱是统一智能体进化控制平面。论文强调自进化不应被简单等同于盲目更新模型权重,因为已部署智能体是组合策略,包含策略 [[大型语言模型]] 参数、in-context harness、记忆、工具集、以及安全治理配置。控制平面的任务是观察一段时间窗口内的 ATDP 轨迹,然后决定最优干预动作。这个动作空间包含六类干预:策略权重更新(可以是 SFT、DPO、on-policy [[强化学习]] 或过程奖励学习)、in-context harness 更新(skill patch 或 prompt edit)、记忆更新、工具集与 schema 更新、回滚、以及 no-op。控制平面的关键设计包括基于轨迹统计的自动触发机制——将评测分数、用户纠错率、工具失败聚类、canary 增量等监控指标提升为干预触发器,以及分阶段安全审计部署,从 shadow 评测逐步过渡到回放检查、离线回归、canary 发布。

基于这一框架,论文通过 AReaL2.0 原型实例化了策略权重更新这条分支。AReaL2.0 将 [[强化学习]] 的 rollout 与训练 worker 包装为智能体微服务组件,使已部署智能体服务可以将其标准 LLM 推理后端替换为在线 [[强化学习]] 运行时。Gateway 组件对外暴露标准 LLM API,透明地将智能体服务重定向至在线 RL 运行时;Router 负责 session-affinity 管理,保证多轮对话和工具调用状态的一致性;Data Proxy 控制数据轨迹记录并为下游训练准备数据;Agent-Compute Worker 则将推理引擎与训练 worker 封装为微服务接口,按需动态分配计算资源。

实验与结果

需要明确的是,这篇论文本质上是一篇立场与愿景文章,而非以实证评测为主的学术论文。论文并未提供完整的基准对比或系统性消融实验。

论文以 Hermes Agent 作为代表性智能体服务,展示其接入 AReaL2.0 的端到端集成流程。具体而言,只需将 Hermes Agent 的 SGLang 后端替换为 AReaL2.0 Gateway,即可在不重写智能体应用的前提下,将已部署智能体的工作流转变为在线 [[强化学习]] 训练数据源。这个案例说明"轻量重组"路径的可行性:无需推翻现有架构,只需重新组织推理与训练组件的协作关系。

在相关工作讨论中,论文将 AReaL2.0 与 HybridFlow/verl、StreamRL、AsyncFlow、AReaL 等 [[强化学习]] 系统进行了定性区分,指出这些系统虽然在训练吞吐和解耦设计上有优化,但仍未解决企业级在线学习所需的数据协议标准化、治理合规和自动控制问题。然而,论文承认 AReaL2.0 目前仅覆盖策略权重更新这一分支,完整的 ATDP 实现、综合数据代理的端到端能力、以及跨干预面的自动控制平面仍属于待开发的研究议程。

讨论与可借鉴点

这篇论文的核心贡献在于将自进化智能体从一个算法研究问题重新定位为系统学科问题。论文提出的三大支柱框架具有启发性:它提醒研究者们注意,在追求更强大的 [[强化学习]] 算法之前,首先需要解决数据协议、治理机制和自动控制系统等基础设施层面的问题。

然而,论文的局限性也显而易见。实证不足是最大的短板:三大支柱中除策略权重更新外,其余均未完整实现;缺乏吞吐量、轨迹利用率、跨任务泛化、长期稳定性等关键指标的定量报告。安全与攻击面的讨论也相对浅薄——自进化智能体可能面临的对抗性操纵、记忆投毒、回放欺骗等问题尚需更深入的缓解方案设计。此外,论文未对 ADP、MCP/A2A、RLDS 等现有数据协议进行字段覆盖度或跨框架兼容性的实证评估,相关工作的讨论停留在定性区分层面。

对于后续研究而言,论文的框架设计提供了几个值得深挖的方向。ATDP 的六维事件 schema 和迟到奖励机制为轨迹数据的标准化提供了起点,但如何在保证隐私的前提下最大化学习效用仍需探索。控制平面的多面决策框架将"自进化"从狭隘的权重更新拓展为受治理的多干预面优化,这一视角值得在更多真实场景中验证其有效性。数据代理对弱信号和延迟信号的利用思路,则可能为 [[强化学习]] 在非游戏场景中的落地开辟新的蹊径。

摘要

大语言模型智能体正快速被部署到生产环境中,包括编程助手、客服聊天机器人和科学研究助手等,但在企业部署中仍然从根本上保持静态。大语言模型的权重、系统提示、工具集合以及上下文层面的智能体框架在部署时即被冻结,任何改进都需要经过人工整理数据收集、离线微调、修改智能体范式以及重新部署这一人工循环。针对个人用户的 OpenClaw 等自进化智能体的近期研究表明,智能体能力的下一次飞跃将来自于能够持续从自身经验中学习的智能体。在本文中,我们认为阻碍企业级大规模智能体服务实现自进化智能体部署愿景的不是强化学习(RL)算法本身,而是智能体在线强化学习系统。具体而言,当前的智能体强化学习系统及其周边的可观测性软件栈在三个关键方面存在不足:(一)缺乏能够跨异构智能体范式承载具备步级粒度的强化学习信号的标准化智能体轨迹数据协议;(二)缺乏能够将真实工作负载转化为受管控学习基底的企业级综合数据代理;(三)缺乏一个统一的智能体进化控制平面,能够基于轨迹统计信息自动决定何时更新策略权重或进化上下文层面的智能体框架。下一代智能体强化学习系统必须围绕这三大支柱进行协同设计,我们勾勒了具体的架构、案例研究和反方论点。我们通过 AReaL2.0 实例化了其中一个分支,将现有强化学习基础设施重组为面向智能体的在线强化学习循环,以实现从已部署工作负载中进行策略权重更新。

Abstract

LLM agents are rapidly being deployed in production, including coding assistants, customer-support chatbots, and scientific research assistants, yet they remain fundamentally static in enterprise deployment. The LLM weights, system prompts, tool repertoires, and in-context harnesses are frozen at deployment time, and any improvement requires a manual loop of human-curated data collection, offline fine-tuning, modification of the agentic paradigm, and re-deployment. Recent work on self-evolving agents, such as OpenClaw for individual users, indicates that the next leap in agent capability will come from agents that continually learn from their own experience. In this paper, we argue that this vision for self-evolving agent deployment is being held back for enterprise-level large-scale agentic service not by reinforcement learning (RL) algorithms but by agentic online RL systems. Specifically, current agentic RL systems and the surrounding observability software stack are inadequate along three essential aspects: (i) there is no standardized agent trajectory data protocol capable of carrying RL learning signals at step granularity across heterogeneous agent paradigms; (ii) there is no enterprise-grade comprehensive data proxy that converts real workloads into governed learning substrates; and (iii) there is no unified agent evolution control plane that automatically decides, based on trajectory statistics, when to update policy weights or evolve the in-context harness. The next generation of agentic RL systems must be co-designed around these three pillars, and we sketch concrete architectures, case studies, and counter-arguments. We instantiate one branch through AReaL2.0, reorganizing existing RL infrastructure into an agent-oriented online RL loop for policy weight updates from deployed workloads.


论文详细总结(自动生成)

论文总结:下一代智能体强化学习系统赋能自进化智能体

一、核心问题与研究动机

随着大语言模型(LLM)智能体从实验室走向生产环境(如编程助手、客服机器人、科学研究助手),企业级部署面临一个根本矛盾:智能体的部署对象是"异构业务环境中的长视野智能体策略"(需调用工具、检索文档、操作 API、更新记忆、申请人工审批),但其能力提升却依赖冻结部署后的人工循环——运维人员需审查轨迹、设计评测基准、修改提示、添加工具描述、重新训练并重新部署模型。

论文指出,近期面向个人用户的自进化智能体(如 OpenClaw、OpenClaw-RL、MetaClaw、SkillClaw)已经验证了"从自身经验中持续学习"这一方向的可行性,但企业级场景在多租户、权限隔离、审计、合规、跨团队工作流等方面存在本质差异。论文的核心论点是:制约企业级自进化智能体落地的瓶颈不是更大的模型或更聪明的 RL 算法,而是缺乏一套"在线智能体强化学习系统"基础设施。当前的可观测软件栈在三方面存在根本性不足:

1. 缺乏承载步粒度 RL 信号的标准化智能体轨迹数据协议;

2. 缺乏将真实生产负载转化为受治理学习基底的企业级数据代理;

3. 缺乏能自动决策何时更新策略权重或修改 in-context harness 的统一进化控制平面。

二、方法论:核心思想与关键技术细节

论文提出下一代智能体强化学习系统应围绕三大协同设计的支柱展开。

支柱一:智能体轨迹数据协议(ATDP)

ATDP 将"可学习轨迹"定义为类型化、可审计、可回放、可归因的事件序列:

其中每个步级事件定义为:

各分量含义:

  • :可观测状态(工具输出、检索片段、用户消息、环境状态)
  • :隐藏内部状态(计划、暂存区、推理摘要、置信度)
  • :所选动作(带类型化参数 schema 的工具调用、生成消息、代码编辑、记忆更新)
  • :动作结果(工具返回、用户接受/编辑/重试/删除、退出码)
  • :奖励信号(二元结果、标量分数、自然语言批评、从 提取的隐式信号)
  • :元数据(时延、token 数、租户、session、harness 指纹、模型 ID)

且忽略 时,该 schema 退化为标准 POMDP 抽象;但其表达能力足以容纳 LLM 特有的推理轨迹、检索片段、工具 schema、人工批评与被拒动作类。

ATDP 的六项设计原则:决策相关有界揭示、跨框架/任务统一、信用可归因、迟到学习信号(reward 字段允许事后追加且不可篡改因果记录)、版本化可回放(绑定 harness schema、工具版本、检索索引快照、guardrail 配置、policy LLM checkpoint)、治理可观测(内置 redaction 状态、数据分类标签、租户 ID、保留策略、训练资格字段)。

支柱二:企业级智能体数据代理(Data Proxy)

数据代理并非单纯的 API 网关、追踪导出器或日志服务,而是"将生产负载转化为受治理学习材料的必需机制"。其插桩位置在 LLM 调用、工具调用、检索调用、记忆读写、文件/浏览器动作、审批事件、用户反馈、最终任务结果等稳定执行边界。

关键设计要点:

  • 框架无关的拦截:兼容 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、MCP 工具等异构编排;
  • 无损 ATDP 事件发射:保留 prompt 模板指纹、system-prompt 版本、暴露工具、解码参数、采样输出、token ID(如可用)、对数概率(如可用)、模型版本/checkpoint;
  • 回放能力:区分确定性回放、近似回放、不可回放事件;
  • 跨租户聚合与隔离:支持隔离租户存储、基于策略的聚合、联邦/分割学习、租户感知评测;
  • 奖励采集:将用户回复、ticket 重开率、测试失败、编译器错误、人工纠错、升级决策、退款反转、审批延迟、下游编辑、放弃行为等弱/延迟信号视为候选学习信号;
  • 学习前的数据完整性:执行 redaction、访问控制、保留与训练资格检查——这是 RL 循环的第一道安全边界

支柱三:统一智能体进化控制平面(Control Plane)

自进化不应被简单等同于"盲目更新模型权重"。已部署智能体 是组合策略:

其中 为策略 LLM(参数 ), 为 in-context harness(参数 ), 为记忆, 为工具集与 schema, 为安全治理/guardrail 配置。控制平面观察一个时间窗内的 ATDP 轨迹 ,并求解:

动作空间 包含六类:

1. 策略 LLM 权重更新(SFT、DPO、on-policy RL、process-reward learning、蒸馏);

2. in-context harness 更新(skill patch、prompt edit);

3. 记忆更新(检索策略更新);

4. 工具集与 schema 更新(工具描述/类型变更);

5. 回滚;

6. no-op(受 治理)。

实现要点:多面自适应(不同失败模式对应不同干预面)、基于轨迹统计的自动触发(取代人工检查,将评测分数、用户纠错率、过程奖励估计、工具失败聚类、canary 增量、单任务成本、工作负载分布漂移从监控产物提升为干预触发器)、统一触发接口下的算法多元性(按需选择 on-policy RL、process-reward learning、prompt 优化、轨迹蒸馏等)、安全审计的分阶段部署(shadow 评测、回放检查、离线回归、canary 发布、回滚语义、差分监控)、回放优先的评测版本化溯源与回滚

原型实现:AReaL2.0

AReaL2.0 将 AReaL 的 rollout 与训练 worker 包装为"智能体微服务组件",使已部署智能体服务可将其标准 LLM 推理后端替换为 AReaL2.0 管理的 agent-compute worker。其包含四个核心组件:

  • Gateway:公共入口,对外暴露标准 LLM API(兼容 SGLang/vLLM 接入方式),透明地将智能体服务重定向至在线 RL 运行时;
  • Router:多在线 RL 训练任务的轻量级 session-affinity 管理,将每个 session 路由到同一数据代理以保证多轮/工具调用状态一致性;
  • Data Proxy:控制面管理、数据轨迹记录(对话历史、工具调用事件与响应)、为下游训练准备数据;
  • Agent-Compute Worker:将 SGLang/vLLM 推理引擎与 Megatron/FSDP 训练 worker 封装为微服务接口,按轨迹流与训练需求动态分配/释放计算资源。

论文以 Hermes Agent 作为示例:替换其 SGLang 后端为 AReaL2.0 gateway,即可在不重写智能体应用的前提下,将已部署智能体的工作流变为在线 RL 训练数据源。

三、实验设计

论文以系统架构/立场文章为主,并未提供完整的基准评测。实验/案例部分包括:

  • 场景/数据集:以 Hermes Agent 作为代表性智能体服务接入 AReaL2.0 的端到端集成示例;
  • 基准:未报告独立基准对比,论文将"完整自进化智能体系统底座"作为长期研究议程,AReaL2.0 仅作为"在线策略权重更新"这一分支的可行性证明
  • 对比方法:在相关工作章节讨论了多个 RL 系统(HybridFlow/verl、StreamRL、AsyncFlow、AReaL)和数据协议(MCP、A2A、ADP、D4RL、RLDS)的差异,但未在统一基准上与这些方法做端到端对比
  • 案例研究:Hermes Agent 接入 AReaL2.0 的工作流示例说明"无需重写智能体应用即可接入在线 RL 训练回路"。

四、资源与算力

论文文本中未明确报告 GPU 型号、数量、训练时长、训练 token 量等算力信息。仅可从 AReaL2.0 的实现描述中推断其计算资源涵盖 SGLang/vLLM 推理引擎和 Megatron/FSDP 训练 worker,可动态分配/释放,但具体的算力规模、训练吞吐、轨迹吞吐等性能数字未给出。

五、实验数量与充分性

论文本质上是立场/愿景论文(position paper)+ 系统原型描述,实验数量非常有限:

  • 仅给出了 AReaL2.0 与 Hermes Agent 的集成示例,未提供系统性消融实验
  • 三大支柱各自的设计原则以论述形式呈现,缺少对每条原则的实证验证
  • 论文自承 AReaL2.0 仅覆盖"策略权重更新"分支,完整 ATDP、跨框架数据代理、跨干预面的自动控制平面尚未实现,因此不构成端到端自进化闭环的完整评测。

从学术标准看,实验部分显著不足:缺乏定量对比、消融、可扩展性测试、跨租户/跨任务泛化评测、长期在线学习稳定性评估等。但从立场论文范式看,其价值在于概念框架与系统原型的提出,而非对算法性能的实证。

六、主要结论与发现

1. 根本瓶颈在系统层而非算法层:企业级自进化智能体的核心障碍不是 LLM/RL 算法的能力,而是缺少将部署后的智能体交互经验转化为受治理、可归因、可回放学习材料的系统底座;

2. 三大支柱缺一不可:标准化的步粒度轨迹数据协议(ATDP)、企业级数据代理、统一进化控制平面必须协同设计;

3. 自进化是多面决策问题:不应等价于权重更新,而应视为在记忆/skill/harness/工具 schema/权重/回滚/no-op 之间进行受治理的多面优化决策;

4. 现有 RL 系统不足以支撑自进化智能体:HybridFlow/verl、StreamRL、AsyncFlow、AReaL 等系统虽优化了吞吐与解耦,但仍未解决企业级在线学习所需的数据协议、治理与自动控制问题;

5. AReaL2.0 验证了"轻量重组"路径:将现有 RL 基础设施从离线后训练流水线改造为面向在线智能体服务的微服务组件是可行的,无需重写智能体应用层。

七、优点与亮点

  • 系统视角的新颖性:将自进化智能体从算法研究问题重新定位为"系统学科"问题,强调"数据协议—数据代理—控制平面"三件套的协同设计;
  • ATDP 的形式化定义:给出了带六维元组的步级事件 schema,并显式讨论了决策相关有界揭示、迟到奖励、版本化回放、治理可观测等设计权衡;
  • 控制平面的动作空间设计:将六类干预面纳入统一决策框架,避免将"自进化"窄化为"权重更新";
  • AReaL2.0 的低侵入集成:通过"替换 LLM 推理后端"的方式连接已部署智能体与在线 RL 训练,实践上降低了集成成本;
  • 跨租户/合规约束的显式纳入:将租户隔离、retention、训练资格、redaction 等企业级治理要求提升为协议第一类字段;
  • 可回放性作为学习与监控的分水岭:明确指出"可回放"使数据代理有别于传统监控探针,是反事实评估的前提。

八、不足与局限

  • 实证不足:整篇以架构论述与原型描述为主,缺少定量实验(吞吐、轨迹利用率、跨任务泛化、长期稳定性等均无报告);
  • 三大支柱中两支柱未实现:ATDP 完整实现、综合数据代理的端到端能力、控制平面的自动决策与多面干预均属"待开发"议程,AReaL2.0 仅覆盖策略权重更新一条分支
  • 安全/攻击面讨论尚浅:仅在控制平面提到分阶段审计与回滚,未对"自进化智能体的对抗性操纵、记忆投毒、回放欺骗"等给出具体缓解方案
  • 跨租户学习与隐私权衡缺乏案例:联邦/分割学习的具体实现路径与性能代价未给出;
  • 未与现有数据协议(ADP、MCP/A2A、RLDS)做正式对比:相关工作章节仅做定性区分,缺少对协议字段覆盖度、回放能力、跨框架兼容性的实证评估
  • 算力/可扩展性数据缺失:未给出部署规模、并发租户数、轨迹吞吐、训练/推理 GPU 配置等关键系统参数;
  • 控制平面"自动触发"机制尚未落地:公式化的 给出了目标形式,但如何估计 、如何处理冷启动、如何避免反馈循环导致的性能漂移等问题未给出方案
  • 应用范围与负面结果未披露:未讨论哪些智能体范式/任务类型不适用于该框架,也未给出失败案例。

(完)

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记