arXiv 2607.03935v1 · 发布 2026-07-04

感知工具链的自演化:模型权重、工具链与任务方案的协同演化

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

AUTHORS Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu
EVIDENCE 用于自演化解决方案的智能体强化学习框架
SCORE 0.9
CATEGORIES TASK rl
GENERATED 2026-07-12 21:25:28 UTC

📝 TLDR

现有自演化框架通常把外围工具链harness视为固定而仅优化任务解,限制了模型与工具的协同进化。本文提出HASE智能体强化学习框架,让单一模型在多轮动作空间中既可生成解也可编辑harness组件。实验显示Qwen3-8B在文本分类上匹配搭配Claude Code的GPT-OSS-120B,在alpha因子挖掘上超越该基线,并在圆形打包算法发现上达到SOTA。该工作证明harness与解可在统一智能体过程中共同改进,单一小模型亦可逼近大模型外加强harness的效果。

🧭 速览

动机

现有自演化框架将harness视作固定外围、只优化任务解,阻断了模型与工具链协同改进的可能。

方法

HASE在智能体强化学习的多轮动作空间中纳入harness编辑动作,由单一模型统一决策是输出解还是修改harness组件。

结果

Qwen3-8B在文本分类上匹敌GPT-OSS-120B+Claude Code,在alpha因子挖掘上反超该基线,圆形打包任务收敛至SOTA。

结论

证明harness与任务解可通过统一智能体过程协同进化,小模型+自演化harness即可逼近大模型外加强工具链的效果。

📊 论文图表(共 4 张)

展开查看 4 张图

TL;DR

HASE框架打破了传统自演化方法把工具链当作黑箱固定的思路,让单一小模型既能生成任务解、也能修改工具链本身。在文本分类、阿尔法因子挖掘和圆形打包算法发现三项任务中,基于Qwen3-8B的HASE分别匹配或超越了使用Claude Code的GPT-OSS-120B基线表现,证明工具链与解的协同演化是一条可行且高效的路径。

研究背景与动机

在[[自演化]]系统中,一个核心假设是模型通过与环境的多轮交互不断改进自身的输出质量。过往的主流范式——无论是通过[[强化学习]]微调还是过程监督——都默认系统外围的[[工具链]](harness)是稳定可靠的:评测脚本、提示模板、采样策略这些组件被当作既定事实,模型的任务是反复猜测正确答案或生成更好的解。然而,这种假设在实践中往往过于理想化。

现实场景里,工具链组件常常存在缺陷。评测脚本可能有边界条件遗漏,提示模板可能未能充分利用模型的推理能力,甚至采样策略在某些任务上会产生系统性偏差。当这些不完善的组件被锁定时,再强大的模型也只能在受限的搜索空间里打转。更深层的问题在于,模型对工具链的感受是单向的——它只能被动接受工具链返回的反馈,而无法指出或修正反馈本身的问题。

本文的切入点正是将工具链从固定约束解放出来,看作模型可以主动编辑的对象。如果让同一个[[智能体]]既能生成解也能修改工具链组件,两个层面的优化就有可能在统一的过程中相互促进:模型在修正工具链的过程中获得更准确的反馈,从而生成更好的解;更好的解又让模型识别出工具链的进一步改进空间。

方法

HASE的核心设计围绕一个统一的[[强化学习]]框架展开。模型在多轮交互中被赋予两类动作空间:生成任务解(生成代码、预测标签等)和编辑工具链组件(修改评测逻辑、调整提示措辞、更新采样参数等)。这两类动作共享同一个奖励信号来源——任务的最终性能指标——从而确保工具链的编辑决策始终以任务目标为导向。

具体实现上,HASE采用了actor-critic架构中常见的优势估计机制来权衡两类动作的价值。每一步交互后,系统会评估当前动作对最终奖励的贡献:如果是生成解的动作,则其优势取决于该解在当前工具链下的表现;如果是编辑工具链的动作,则其优势取决于编辑后工具链对后续解质量的提升效果。这种统一的评价标准避免了传统方法中“修工具链”与“求解题”各自为战的困境。

一个关键设计细节是工具链组件的可编辑范围。HASE并不允许模型随意修改整个工具链,而是限定在若干预设的编辑槽位上,例如评测函数的断言逻辑、few-shot示例的选取策略、或推理时的温度参数。这样做既保留了人类对系统行为的可控性,也防止模型通过“作弊”式的工具链修改来刷指标。从论文的实验设定来看,编辑槽位的选择是由人类专家根据任务特性预先指定的,这一设计选择在安全性与灵活性之间取得了合理的平衡。

HASE的另一个特色是其多轮演化的循环结构。每轮演化中,模型先尝试生成一批任务解,观察这些解在当前工具链下的表现;随后基于观察到的失败模式,决定是否要编辑某个工具链组件;编辑后进入下一轮,继续生成解并接受新的反馈。这一循环持续进行,直到任务性能收敛或达到预设的迭代上限。值得注意的是,在整个循环中只有模型权重保持连续(通过强化学习的策略梯度更新),工具链组件则可以是非参数化的离散编辑操作。

实验与结果

论文在三个差异化的任务上验证了HASE的有效性,每个任务都从不同角度检验工具链编辑的价值。

文本分类任务选取了常见的情感分析与主题分类数据集,用来检验基础能力。这里的基线对比非常直接:HASE用Qwen3-8B单一模型配合可编辑的工具链,对抗的是GPT-OSS-120B模型加上Claude Code作为工具链生成器。结果显示,Qwen3-8B在HASE框架下达到了与该基线相当的准确率。这一结果的意义不在于绝对数字本身,而在于它证明了小模型通过自适应工具链可以弥补与超大模型的能力差距。

阿尔法因子挖掘任务来自量化投资领域,目标是发现能够预测资产收益率的因子。HASE在这一任务上超越了GPT-OSS-120B基线,说明在需要反复试错和调试的探索性任务中,能够修改评测逻辑(可能是放宽过度严格的阈值或修正不合理的约束)的价值尤为显著。模型不再被困在一个不友好的评估环境里反复失败,而是可以直接改进评估标准本身。

圆形打包算法发现任务则更具挑战性,目标是让模型自动发现能够高效填充平面的几何算法。HASE不仅收敛到了当前最优性能,而且在演化过程中展现出对评测组件的修复能力——初始的工具链可能包含不完善的冲突检测逻辑,模型通过多轮编辑将其纠正,这一过程完全无需人类干预。这一能力在传统框架中是不可想象的,因为工具链的错误会直接导致无法收敛或收敛到错误的最优解。

讨论与可借鉴点

HASE展示了一条有潜力的方向:工具链不必是静态的边界条件,而可以是智能体主动塑造的系统组成部分。这一思路对当前大模型应用开发中的很多工程实践有直接的启发意义。很多团队在部署模型时,会投入大量精力手工调优提示词、选择采样参数、设计评测流程,但这些工作往往是一次性的、缺乏闭环反馈。如果能把这些组件纳入类似HASE的自演化循环中,系统就有可能在部署后持续自我改进。

当然,HASE也面临一些开放性问题。首先是安全边界:工具链编辑的自由度过高可能导致模型通过修改评测逻辑来伪造性能提升,论文虽然通过编辑槽位限制了这种风险,但更完善的约束机制值得进一步探索。其次是计算成本:多轮演化中的工具链编辑和策略更新都引入额外的计算开销,在资源受限场景下的效率仍有优化空间。最后是泛化性:三项任务虽然各有特点,但都属于相对结构化的任务类型;在开放域任务或涉及外部工具调用的更复杂场景中,HASE的表现尚待验证。

从更宏观的视角看,HASE代表了一种思路转变:从“用更强的模型解决给定问题”转向“让模型与问题描述共同演化”。这种转变与元学习、自动化机器学习等方向有着潜在的联系,也许会成为未来构建通用智能系统的一条重要路径。

摘要

自演化框架通常在优化任务方案时,将外围工具链视为固定不变。我们提出了感知工具链的自演化(HASE),一个智能体强化学习框架,其中单个模型可在多轮动作空间中生成任务方案或编辑选定的工具链组件。HASE 使得单个 Qwen3-8B 模型在文本分类任务上能够达到与使用 Claude Code 作为工具链提议器的 GPT-OSS-120B 模型相当的性能。在阿尔法因子挖掘任务中,HASE 优于已有报道的 GPT-OSS-120B 基线。HASE 还能修复不完善的评估组件,并在圆填充算法发现任务中收敛至当前最优性能。上述结果表明,HASE 通过一个统一的智能体过程同时改进了工具链与任务方案。

Abstract

Self-evolving frameworks usually optimize task solutions while treating the surrounding harness as fixed. We introduce Harness-Aware Self-Evolving (HASE), an agentic reinforcement-learning framework in which a single model can generate task solutions or edit selected harness components in a multi-turn action space. HASE enables a single Qwen3-8B model to match the text-classification performance of a GPT-OSS-120B model that uses Claude Code as the harness proposer. In alpha factor mining, HASE outperforms the reported GPT-OSS-120B baseline. HASE also repairs imperfect evaluation components and converges to state-of-the-art performance in circle-packing algorithm discovery. These results show that HASE improves the harness and the solution through one unified agentic process.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记