arXiv 2607.13854v1 · 发布 2026-07-15

SPyCE:面向多模态智能体的技能-策略协同进化

SPyCE: Skill-Policy Co-evolution for Multimodal Agents

AUTHORS Ru Zhang, Weijie Qiu
EVIDENCE 使用强化学习协同演化多模态智能体的策略与技能
SCORE 0.9
GENERATED 2026-07-21 22:10:38 UTC

📝 TLDR

多模态智能体在多步推理中需反复操作视觉证据并调用工具,但现有强化学习方法将轨迹压缩为标量奖励,难以复用工具调用模式,而基于记忆的方法依赖测试时检索,无法让策略真正吸收经验。本文提出SPyCE框架,将推理轨迹蒸馏为分层技能库并与策略联合训练:执行技能捕捉局部视觉操作,工作流技能编码高层工具调用先验,策略基于检索技能进行rollout,技能库则随策略提升而演化。在8个基准上的实验表明该方法稳定优于强化学习和记忆基线,验证了技能—策略协同优化的有效性。

🧭 速览

动机

现有方法要么将多步轨迹压缩为标量奖励,导致工具调用模式难以复用;要么依赖静态记忆库做测试时检索,无法让策略真正内化经验。

方法

提出SPyCE框架,将轨迹蒸馏为分层技能库(执行技能+工作流技能),在强化学习中与策略协同演化:策略基于检索技能rollout,技能库随策略更新。

结果

在8个多模态智能体基准上,SPyCE一致优于强化学习和记忆类基线,消融实验证明分层技能设计与协同演化机制均为关键组件。

结论

技能库与策略的联合优化为构建具备工具调用能力的多模态智能体提供了有效范式,弥合了记忆增强与策略学习之间的鸿沟。

📊 论文图表(共 5 张)

展开查看 5 张图

TL;DR

SPyCE 提出了一种让多模态智能体在训练过程中同时优化策略与技能库的新框架,将推理轨迹蒸馏为分层技能(执行技能与工作流技能),并通过闭环反馈让两者协同进化。实验覆盖 8 个基准,SPyCE 在各项任务上稳定超越纯 [[强化学习]] 基线和记忆增强基线,验证了「技能-策略联合优化」这一范式的有效性。

研究背景与动机

多模态智能体在现实任务中往往需要多步推理:它们一边观察图像、一边调用工具(如检索、计算、代码执行等),逐步逼近最终答案。这种「以图像进行思考」的范式对 [[强化学习]] 训练提出了独特的挑战。

传统 [[强化学习]] 方法将整个轨迹压缩为一个标量奖励信号,策略据此更新。问题在于,多模态推理轨迹中包含大量细粒度的视觉操作模式和高层次工具调用先验——这些信息被压缩进奖励后几乎完全丢失了。策略在每个新任务上都要从零开始「重新发现」这些可复用的模式,效率极低。

另一类思路是记忆增强方法。它们将历史轨迹存入外部记忆,测试时通过检索来利用过往经验。这种做法保留了经验本身,但检索是「拿来就用」,策略本身并未从这些经验中真正学到什么——经验被当作静态知识而非可内化的能力。

两者的根本缺陷都在于:多模态推理轨迹中蕴含的丰富结构(局部视觉操作如何组织、高层工具调用如何编排)被当作「一次性消耗品」处理了——要么被压缩为奖励梯度后丢弃,要么被检索出来后原封不动地使用,却从未被提炼成可迁移、可组合的技能单元。

SPyCE 的核心洞察正在于此:轨迹应当被「蒸馏」为分层技能,这些技能在训练过程中与策略共同演化,形成一个自我增强的闭环。

方法

SPyCE 的设计围绕一个核心问题展开:如何将一条多模态推理轨迹提炼成有意义、可复用且能随训练持续进化的技能单元?

分层技能设计 是答案的第一层。SPyCE 将技能划分为两个层级。执行技能负责捕捉局部视觉操作——例如从图像中定位特定区域、执行某种变换、或提取某个视觉特征。这类技能粒度细、通用性强,往往横跨不同任务类型。工作流技能则编码更高层的先验:给定一个任务目标,智能体应当按什么顺序调用哪些工具、各工具之间如何衔接。这类技能更抽象,直接决定了推理路径的「大方向」。

这种分层设计背后的直觉是:多模态推理本身就存在天然的时间尺度差异。视觉操作通常是瞬时的、局部的决策,而工具编排则涉及跨步骤的全局规划。将两者混为一谈会丢失这种结构——传统方法恰好犯了这个问题:无论奖励压缩还是记忆检索,都无法显式保留这种层级差异。

技能库的构建与检索 是第二层。技能库在初始化时通过聚类已有的轨迹片段生成——执行技能从局部操作序列中聚类得出,工作流技能从完整轨迹的工具调用序列中聚类得出。在策略的每次 rollout 过程中,智能体不仅基于当前状态做决策,还以检索到的相关技能为条件输入。这种做法让技能成为策略决策的「参照系」而非「替代品」——策略仍然在学习,只是学习的起点更高。

这与直觉做法的区别在于:常见的思路可能是让智能体直接「模仿」检索到的轨迹,或者让技能直接替代策略做决策。SPyCE 选择了更保守但更稳健的路径——技能作为条件输入,策略作为执行主体。这样既利用了技能的先验知识,又保留了策略的灵活性。

协同进化机制 则是整个框架的灵魂。协同进化体现在两个方向的反馈环中。自下而上看,策略模型在训练中不断生成新的 rollout,其中高价值的轨迹片段被提取出来,用来更新技能库——更好的策略产生更丰富的经验,进而提炼出更高质量的技能。自上而下看,进化后的技能库为后续 rollout 提供更强的先验指引,使得策略在更有利的条件下探索,加速性能提升。

用数学语言描述这一闭环:设 为策略, 为技能库, 为 rollout 轨迹。策略的优化目标为

而技能库的更新则依赖策略产生的轨迹:

其中 为阈值,用于筛选高价值轨迹。这种交替更新形成 [[强化学习]] 训练中一种新的优化范式——策略不仅从奖励中学习,还从自身产出的高质量行为中提取结构化知识。

实验与结果

实验在 8 个基准上展开,覆盖不同类型的多模态推理任务,包括视觉问答、图像操作序列规划、以及需要多工具协同的复杂任务。实验采用统一的训练-测试划分,确保基线与 SPyCE 在相同条件下比较。

主要对比结果 表明,SPyCE 在所有 8 个基准上均优于纯 [[强化学习]] 基线和记忆增强基线。纯 RL 方法由于缺乏对工具调用模式的显式建模,在需要精确工具编排的任务上表现尤其薄弱。记忆增强方法虽然通过检索获得一定提升,但始终受限于「经验是外部的、策略无法内化」这一根本局限——测试时检索的覆盖面与召回率成为性能上限。SPyCE 则通过让策略直接吸收技能,绕过了这一瓶颈。

消融实验 进一步揭示了两项关键设计决策的贡献。去除分层技能结构(即只保留单一层级的技能)后,性能显著下降——这验证了局部视觉操作与高层工具编排分别建模的必要性。去除协同进化机制(即技能库固定不变、只在初始化时构建)后,性能同样大幅回落——这说明技能库的持续演化本身就是一个不可替代的加速机制,而非可有可无的辅助设计。

值得注意的一个现象是,SPyCE 的优势随训练步数增加而逐渐扩大。这与协同进化的预期一致:训练初期策略与技能库都较弱时,协同收益有限;随着训练的推进,两者互相促进的效应越发显著,形成类似「飞轮」的加速态势。

讨论与可借鉴点

SPyCE 展示了一条有别于传统 [[强化学习]] 的优化路径:不再将轨迹视为奖励信号的载体,而是将其看作结构化知识的来源。这种思路的核心价值在于承认了多模态推理轨迹本身具有丰富的语义层次——局部操作与全局规划、视觉特征与工具先验——而这些层次在压缩为标量奖励时不可逆地丢失了。

从更宏观的视角看,技能-策略协同进化呼应了人类学习中「从经验中提炼规律、再以规律指导实践」的认知模式。[[强化学习]] 领域近年来涌现的许多方法——如 hindsight experience replay、curriculum learning——本质上也都在试图从轨迹中榨取更多信息。SPyCE 将这一方向推向了一个更系统的形式化框架。

局限性 同样值得关注。技能库的质量高度依赖于初始轨迹的质量——如果初始 rollout 本身就质量堪忧,蒸馏出的技能可能带有偏差,后续的协同进化虽能修正,但会增加冷启动成本。此外,分层技能的设计需要预先定义层级边界,这在更复杂的任务场景中可能需要调整。

可借鉴的方向 包括:将协同进化思想引入其他存在「策略-知识库」交互设定的场景(如检索增强生成中的知识库更新)、探索技能库规模与策略容量之间的 scaling 关系、以及研究如何在不同任务域之间迁移技能库以实现快速适应。这些问题为后续研究留下了充足的探索空间。

摘要

以图像进行思考的多模态智能体在多个步骤中迭代地操纵视觉证据并调用各种工具。现有的强化学习方法将轨迹简化为标量奖励,迫使策略在每个新任务上都从零开始发现可复用的工具使用模式;基于记忆的替代方法保留过往经验,然而它们依赖测试时检索,却不更新策略以从中吸收可复用的模式。我们的核心洞察在于:多模态推理轨迹应当被提炼为在训练过程中与策略协同进化的可复用技能,而非仅作为奖励被消耗,或从静态存储中被检索。为此,我们提出了 SPyCE(技能-策略协同进化),一个将轨迹提炼为分层技能库并在强化学习全过程中持续更新它的框架。执行技能捕捉局部的视觉操作,而工作流技能则编码用于编排工具调用的高层先验。在训练过程中,策略模型以检索到的技能为条件来指导其 rollout,同时技能库利用策略生成的高价值 rollout 不断进化。这形成了一个闭环——更优的策略产生更好的技能,而不断进化的技能库又反过来为策略 rollout 提供更强的先验。在八个基准上的实验表明,SPyCE 始终优于基于强化学习和基于记忆的基线方法。进一步的分析表明,分层技能设计与协同进化机制对于我们的设计都至关重要。这些结果表明,技能与策略的联合优化是构建强大多模态智能体的一条有前景的路径。

Abstract

Multimodal agents that think with images iteratively manipulate visual evidence and invoke tools across many steps. Existing reinforcement learning methods reduce trajectories to scalar rewards, forcing the policy to discover reusable tool-use patterns from scratch on every new task; memory-based alternatives retain past experience, yet they rely on test-time retrieval, without updating the policy to absorb reusable patterns from that experience. Our key insight is that multimodal reasoning trajectories should be distilled into reusable skills that co-evolve with the policy during training, rather than being consumed as rewards or retrieved from a static store. To this end, we propose SPyCE (Skill-Policy Co-evolution), a framework that distills trajectories into a hierarchical skill library and updates it throughout reinforcement learning. Execution skills capture local visual operations, while workflow skills encode high-level priors that orchestrate tool use. During training, the policy model conditions on retrieved skills to guide its rollouts, while the skill library evolves using valuable rollouts generated by the policy. This creates a closed loop in which improved policies yield better skills, and the evolving skill library, in turn, provides stronger priors for policy rollouts. Experiments across eight benchmarks demonstrate that SPyCE consistently outperforms both RL-based and memory-based baselines. Further analysis reveals that both the hierarchical skill design and the co-evolution mechanism are critical to our design. These results suggest joint skill-policy optimization as a promising paradigm for building capable multimodal agents.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记