参数化技能
Parametric Skills
📝 TLDR
智能体 LLM 的技能以文本形式存放在上下文中,在长上下文复杂任务中模型难以定位并遵循指令,能力受限。为此提出 ParametricSkills 框架,用超网络在测试时将文本技能转为 LoRA 适配器参数,实现无上下文技能利用。该方法先构建技能库并用 OpenCode 合成单/多轮使用轨迹,再训练超网络同时编码技能内容与利用方式。在六项软件工程子任务上,由 DeepSeek-V4-Flash 评判,平均比上下文学习高 6.44 分,BERT Score 与 F1 也显著领先,且参数化技能天然可累积,为测试时持续学习提供了初步途径。
🧭 速览
文本形式的技能受限于模型理解与遵循复杂指令的能力,在长上下文中关键指令难以定位,技能利用效果受限,且技能演化与模型学习相解耦。
提出 ParametricSkills 框架,构建大规模技能库并用 OpenCode 合成单轮与多轮技能利用轨迹,训练一个超网络,将文本技能映射为 LoRA 适配器参数,实现测试时无上下文技能利用。
在六项复杂软件工程子任务上,ParametricSkills 经 DeepSeek-V4-Flash 评判平均比上下文学习高出 6.44 分,BERT Score 与 F1 也显著更高。
参数化技能天然具备可累积性,初步展示了测试时持续学习的可行路径,并为技能全生命周期管理提供了新方向。
📊 论文图表(共 6 张)
展开查看 6 张图
TLDR
智能体 LLM 的技能以文本形式存放在上下文中,在长上下文复杂任务中模型难以定位并遵循指令,能力受限。为此提出 ParametricSkills 框架,用超网络在测试时将文本技能转为 LoRA 适配器参数,实现无上下文技能利用。该方法先构建技能库并用 OpenCode 合成单/多轮使用轨迹,再训练超网络同时编码技能内容与利用方式。在六项软件工程子任务上,由 DeepSeek-V4-Flash 评判,平均比上下文学习高 6.44 分,BERT Score 与 F1 也显著领先,且参数化技能天然可累积,为测试时持续学习提供了初步途径。
Abstract
Since intelligence fundamentally relies on efficient skill acquisition (Chollet, 2019), the ability to leverage skills is critical. For LLMs, skills, manually authored or extracted from task trajectories, are textual recipes encoding mature problem-solving experience and are critical to agentic capabilities. Despite widespread deployment, their utility is limited by the model's ability to comprehend and follow skill instructions, especially under complex and long-context scenarios, where key instructions are difficult to locate and adhere to. To address this limitation, we propose ParametricSkills, a framework that can convert free-form textual skills into parameters at test time, enabling context-free skill exploitation. Specifically, we first construct a large-scale, high-quality skill library, and synthesize single-turn and multi-turn skill exploitation trajectories built around these skills with OpenCode. Using these data, we then train a hypernetwork that parameterizes both the skill content and the test-time exploitation methodology by receiving textual skills and converting them into LoRA adapters. Experimental results on six complex software engineering (SWE) subtasks demonstrate that, the proposed ParametricSkills averagely outperforms in-context learning by 6.44 points as judged by DeepSeek-V4-Flash, while also achieving significantly higher BERT Score and F1 score, confirming its effectiveness. Beyond performance, we further find that parametric skills, being inherently accumulative, offer a preliminary yet promising avenue toward test-time continual learning.
动机
文本形式的技能受限于模型理解与遵循复杂指令的能力,在长上下文中关键指令难以定位,技能利用效果受限,且技能演化与模型学习相解耦。
方法
提出 ParametricSkills 框架,构建大规模技能库并用 OpenCode 合成单轮与多轮技能利用轨迹,训练一个超网络,将文本技能映射为 LoRA 适配器参数,实现测试时无上下文技能利用。
结果
在六项复杂软件工程子任务上,ParametricSkills 经 DeepSeek-V4-Flash 评判平均比上下文学习高出 6.44 分,BERT Score 与 F1 也显著更高。
结论
参数化技能天然具备可累积性,初步展示了测试时持续学习的可行路径,并为技能全生命周期管理提供了新方向。
深度精读
> 基于 PDF 全文生成 · 模型: MiniMax-M3 · 全文
一、全文翻译(节选)
智能能力从根本上依赖于高效的技能获取 (Chollet, 2019),因此能否利用好技能对 LLM 至关重要。对 LLM 而言,技能(无论是人工编写的还是从任务轨迹中抽取的)是编码成熟解题经验的"文本配方",是智能体能力的核心。虽然已被广泛部署,但其效用受到模型理解和遵循技能指令能力的限制——尤其是在复杂的长上下文场景中,模型难以定位并遵循关键指令。针对这一局限,我们提出 ParametricSkills,一个可在测试时将自由形式的文本技能转换为参数、解耦上下文依赖的技能利用框架。具体而言,我们先构建一个大规模高质量技能库,并借助 OpenCode 围绕这些技能合成单轮与多轮的技能利用轨迹;再在这些数据上训练超网络,使其在接收文本技能的同时,将技能内容与测试时的利用方法都编码进 LoRA 适配器参数。在六项复杂软件工程子任务上的实验表明:ParametricSkills 经 DeepSeek-V4-Flash 评判,平均比上下文学习高出 6.44 分,同时 BERT Score 和 F1 也显著更高,验证了其有效性。除性能外,我们还进一步发现:参数化技能天然具备可累积性,为测试时持续学习提供了一条初步但前景广阔的新路径。
二、研究背景与动机
LLM 驱动的智能体在全自动软件工程 (Yang et al., 2024; Wang et al., 2025)、科学研究 (Phan et al., 2025; Wang et al., 2026b; Yang et al., 2026a) 以及奥数级推理 (Yu et al., 2025; Huang & Yang, 2025; Li et al., 2026) 等复杂真实任务中表现亮眼,其核心使能因素之一正是技能(Anthropic; Zhou et al., 2026)——结构化的"文本配方",封装了成熟的解题经验或流程知识,可以通过技能库实现"维护、检索、复用、演化"的闭环。然而,当前主流将技能表示为上下文中文本的范式存在两大根本局限。
第一,技能利用能力受限于模型的指令遵循能力。 开源模型(无论规模如何)在通过 ICL 充分利用技能方面普遍表现欠佳,尤其在长上下文、复杂任务场景下,关键指令难以定位与遵循 (Liu et al., 2024; 2025)。而且已有工作表明 ICL 一贯弱于 fine-tuning,且模型规模越小差距越大 (Lu et al., 2026; Shi et al., 2026; Xia et al., 2026; Wang et al., 2026a),指令遵循能力不足直接导致任务结果欠佳。
第二,文本空间的技能演化与模型学习天然解耦。 近期代表性的文本技能演化方法,如 EvoSkill (Alzubi et al., 2026)、CoEvoSkills (Zhang et al., 2026)、SkillOpt (Yang et al., 2026b),通过失效分析、联合验证器演化、神经网络优化等技术反复改写自然语言技能文档,在不更新模型的前提下提升下游性能。然而,这些文本侧方法本质上仍与 LLM 的内在能力分离——模型本身的参数并未被优化,技能的"演化"止步于语言表层。
由此,作者将注意力转向参数空间表示技能——既消除长上下文中模型定位与遵循指令的瓶颈,也让技能演化与模型学习天然耦合。借助超网络驱动的测试时参数生成范式 (Ha et al., 2016; Chauhan et al., 2024; Text-to-LoRA、LoRAGen、Doc-to-LoRA、SHINE),他们将测试时参数生成应用于智能体技能的完整生命周期:创建 → 组合 → 部署 → 利用 → 持续演化,直接同时缓解"指令遵循瓶颈"和"技能演化与模型学习解耦"两大痛点。
三、方法详解
3.1 整体框架
ParametricSkills 的核心思路是用参数编译技能:用一个训练好的超网络 h_θ,接收冻结文本编码器 g(·) 嵌入得到的技能表示 z = g(s),单次前向映射为 LoRA 增量 φ = h_θ(z),再 reshape 成各层 A、B 矩阵合并到冻结骨干 f_{W_0}(·) 上,得到技能条件化模型 f_{W_0+ΔW(φ)}(·)。推理时,只需对每个文本技能做一次前向即可获得"即插即用"的适配器,无需技能 token 进入上下文。
整个 pipeline(图 1)分为四大阶段:
- (I) 参数化技能生成:接收任意 free-form 文本技能 s,通过超网络即时生成 LoRA φ;
- (II) 技能文档预训练:用自监督重建/补全任务让超网络学会"编码技能内容";
- (III) 技能利用微调:在真实利用轨迹上微调超网络,使其同时编码"技能内容"和"利用方法";
- (IV) 自演化与持续学习:在测试时通过 verifier 反馈反复修订文本技能并刷新 LoRA,再用 EMA 累积到全局参数技能。
3.2 预备:LoRA 与超网络驱动 text→LoRA
LoRA(Hu et al., 2022)。对预训练权重 W_0 ∈ R^{d_out × d_in},冻结 W_0,学习低秩增量 ΔW = B A(A ∈ R^{r×d_in}, B ∈ R^{d_out×r}, r ≪ min(d_in, d_out));推理时 ΔW 可以合并回 W_0,无额外延迟,具备 plug-and-play 特性,非常适合把离散技能表示为连续可组合参数。本文约定一个技能表示为 LoRA 适配器 φ ∈ R^{d_φ},即其所有 A、B 矩阵的拼接。
超网络驱动 text→LoRA。超网络 h_θ 参数化为 θ,将文本技能 s 经冻结编码器 g(·) 映射为 z = g(s) ∈ R^{d_z},再生成扁平化的 LoRA 参数 φ = h_θ(z) = h_θ(g(s)) ∈ R^{d_φ}。生成 φ 后,reshape 为各层 A、B 矩阵合并入基模型,得到技能条件化模型 f_{W_0+ΔW(φ)}(·)。关键一点是:训练好 h_θ 后,生成一个新技能适配器只需一次前向——无需对基模型反向传播、无需为该技能收集数据、无需占用部署时的上下文窗口。
3.3 关键模块
模块一:技能库构造 (Skill Document Collection)。技能来自两个互补来源——(1) 显式技能文档:从 skills.sh、SkillsMP、skilldb、npm、GitHub 等公共仓库爬取 SKILL.md,经"规范化与过滤"流水线(剔除 404 页、空文件等低价值样本);(2) 经验驱动的隐式技能:从成功的智能体轨迹(repos 级 SWE、Terminal Dev 等)中挖掘。原始轨迹经过三阶段 short-call 流水线:Summarize(压缩预处理过的轨迹为结构化 JSON 摘要,抽取关键证据、定位步骤、修改策略、验证信号等,同时保留智能体推理流)→ Extract(提出多个候选,按可复用性、具体性、非平凡性择优)→ Validate(按轨迹支撑、跨仓库可迁移性、可操作性、非平凡性、训练价值五个维度过滤)。最终保留 45.8K 条高质量可复用技能,覆盖 13 个领域(图 3),最大类为 Software(26.4%),其次是 AI & LLM(14.2%)、API & Auto(9.4%)、Web & UI(7.9%) 等。
模块二:技能重建预训练 (Skill-Reconstruction Pretraining)。三个自监督目标共享同一种自回归形式:给定特定上下文,超网络生成参数化技能,适配后的语言模型在 teacher-forcing 下生成目标文本,损失回传至超网络。通过改变上下文,迫使超网络同时捕获全局语义和细粒度操作组件:
- Full Reconstruction:超网络接收完整技能上下文,生成的适配器要能重建整个文档,促进对全部信息的忠实编码;
- Prefix Completion:超网络只在段边界处截断的初始前缀上进行条件化,目标仍是完整文档,迫使其从有限前缀推断出完整内容;
- Section-level Component Completion:随机删除一个功能段,以"剩余段 + 缺失段名称"为条件生成适配器,目标仍是完整文档——这是一个 cloze 风格的双向推理任务,迫使超网络学会技能各组件(触发条件、执行步骤、失败处理等)如何组织、相互关联与共同支持。该目标对组合泛化提供了强归纳偏置,并支持对已学技能进行受控的局部编辑。
模块三:技能利用微调 (Skill-Exploitation Fine-tuning)。每个训练样本是一对(文本技能 s, 受监督的技能利用轨迹 τ)。为保证生成的参数化技能可泛化,作者构造了一个多粒度、多格式的监督集合,包括单轮轨迹和合成的多轮智能体轨迹(后者涵盖规划、上下文检查、工具使用、修改、验证等典型步骤)。该阶段将学习重心从"压缩技能内容"转向"技能利用"——把参数化技能落地为具体的行为方法,使适配后的模型在真实场景中能基于技能知识执行任务。
模块四:多技能合并 (Multiple Parametric Skills Merging)。复杂场景通常需要多个技能协同,作者将各技能文档编译为独立 LoRA 适配器,合并后再推理。对第 i 个技能适配器的有效增量 Δ_i = A_i B_i,目标是构造合并适配器使其有效增量等于各技能增量的加权和 Δ_merge = Σ_i w_i Δ_i = Σ_i w_i A_i B_i。实现方式是 update-space rank concatenation:拼接所有被选适配器的低秩因子、乘以各自的合并权重;为保持合并稳定,合并前按每个适配器有效增量的范数做校准,防止高范数适配器因纯尺度原因主导合并。
模块五:自演化参数技能 (Self-Evolving Parametric Skills)。分两个层次:
- (a) 任务级自演化 (Task-level Skill Evolution)。(1) 技能生成:给定任务指令,技能生成器产出一份初始文本技能(流程、验证检查等),编译为参数技能;(2) 验证:模型用当前参数技能生成答案,verifier 评估并返回反馈;(3) 修订:若被拒绝,依据反馈修订文本技能(精化能力描述、补充遗漏约束等),重新编译,进入下一轮;(4) 终止检查:固定轮数内或被接受则停止。
- (b) 持续学习演化 (Continual Skill Evolution)。在线任务流中,自演化循环逐步通过合并把新学到的技能累积进"全局参数技能 Φ":每个任务仍生成一份基础参数技能,但推理时叠加当前全局技能的小幅贡献;若任务最终被接受,把对应轨迹汇总为技能、用超网络转至参数空间,按有效增量范数归一化后,用 EMA 合并入 Φ:
全局参数技能充当来自先前成功轨迹的"可复用先验",在零反向传播、几乎无额外算力与显存的前提下,为后续任务装备先验,实现"测试时持续学习"。
3.4 关键公式解读
这是 ParametricSkills 的"编译核心":一条文本技能 s 经冻结编码器 g(·) 压缩为嵌入 z = g(s),再经超网络 h_θ 单次前向映射为扁平化的 LoRA 参数 φ ∈ R^{d_φ}。这是后续所有 LoRA 注入、组合、演化操作的根基。
多技能合并的形式化目标:合并适配器的有效增量应等于各技能增量的加权和。论文通过 update-space rank concatenation 实现,即把所有被选适配器的 A_i、B_i 拼接、各自乘以合并权重 w_i,并在合并前按 ‖Δ_i‖ 做校准,避免尺度差异带来的不均衡。该公式的多技能插拔性是"测试时能力组合"的关键。
持续学习的核心更新式:每个被接受任务的"成功任务技能 φ^★_t"先按 ‖φ^★_t‖_F 归一化(防止高范数适配器独大),再以 EMA 系数 β 合并入全局技能 Φ。具体在 HumanEval 子集实验中,β = 0.1,每条被接受的技能贡献 10% 增量。
3.5 数据配方 (Training Data Curation)
合成训练数据经历三个紧耦合阶段(图 2):
(1) 单轮技能利用轨迹构造。每条技能构造两类互补的单轮样本:Type 1: QA 风格示例——聚焦具体、聚焦、技能直接使用的子场景(文件路径、代码片段、错误日志、配置片段),训练基本技能激活能力(何时调用、如何应用核心流程);Type 2: 真实开发场景——repo 级任务,信息丰富、含少量干扰(过期命令、误导性文件位置、过宽范围的修改建议),在长上下文、多约束、噪声输入下训练稳健技能执行。
(2) 多轮技能利用轨迹构造。为可实例化到可执行沙箱的技能构造多轮轨迹:每条技能生成一个轻量级沙箱仓库和一段多轮用户请求序列;任务信息、约束、支撑证据跨轮逐步揭示(新错误日志、更新需求、失败测试、不一致的配置、过期文档命令),模型须复用先前证据、更新中间假设、检查相关文件、做必要修改并在全程进行验证;每条任务在 OpenCode 沙箱中真实执行,产出完整交互轨迹,再变换为训练样本。
(3) 结构化质量验证。检查轮次衔接一致性、动作与环境反馈一致性、显式验证的存在、最终响应质量,过滤低质量样本。最终数据集:技能库 45.8K 条(按类目分布:Software 26.4% / AI&LLM 14.2% / API&Auto 9.4% / Web&UI 7.9% / Testing&QA 5.9% / Security 7.2% / 等);单轮样本约 13.4 万条,平均每条技能对应 12.26 个样本,中位 5,最少 1、最多 60。
3.6 图表解读
图 1(Overall Pipeline)。四阶段总览:(I) 文本技能 → 超网络 → LoRA 适配器(即参数化生成);(II) & (III) 训练流水线,从文档级预训练到多轮技能利用微调;(IV) 自演化与持续学习,把任务级技能经归一化与 EMA 拼入全局技能 Φ。
图 2(Training Data Construction Pipeline)。左到右三阶段:(1) 从 skills.sh、SkillsMP、skilldb、npm、GitHub 显式文档与 OpenCode 隐式轨迹汇总并过滤得到 45.8K 条;(2) Type 1 QA 与 Type 2 真实开发两类单轮轨迹;(3) 多轮轨迹合成→沙箱执行→轨迹恢复→规范化→结构化验证。
图 3(Skill Category Distribution)。扇形比例展示 13 个领域的分布(Software 26.4% / AI&LLM 14.2% / API&Auto 9.4% / Web&UI 7.9% / Content&Edu 7.2% / Testing&QA 6.9% / Security 5.9% / Data&ML 5.0% / DevOps&Cloud 4.4% / Product&Biz 3.0% / Design&Media / Other 7.3%),说明技能库在软件与 AI 工程方面高度聚焦。
图 4(Skill Definition Template)。结构化技能卡片示例,字段包括:Purpose、Pattern、Core mapping(把触发映射到具体 API/调用)、When to Use + Inputs、Implementation Recipe(分步实现步骤)、Minimal trigger → response、Verify/Watch for/Avoid、Evidence(来源轨迹)。这一模板贯穿收集、过滤、利用,既是数据规范也是"把程序性知识显式化"的工程契约。
图 5-7(Training Loss & PPL)。三阶段(预训练 / 单轮微调 / 多轮微调)的 loss 与 PPL 曲线,均呈"早期快速下降后趋稳"形态,整体收敛稳定。
四、实验设置与结果
4.1 主实验设置
训练。骨干采用 Qwen3-8B (Yang et al., 2025)。超网络沿用 SHINE (Liu et al., 2026) 的同款架构与最终 checkpoint 作为初始化;在技能库上预训练 2 epoch,使用 AdamW 优化器(零权重衰减、梯度裁剪比 1.0、线性学习率衰减,峰值 1e-5);再在单轮技能利用轨迹上微调 1 epoch,优化器与调度器同上,最大上下文长度 10K tokens。
评估。对不与训练/验证集重叠的 SWE 任务评估最终超网络。三个对照基线:(1)SHINE——使用 SHINE 最终 checkpoint 生成的参数化技能;(2)In-Context——使用上下文技能;(3)No-Skills——既无参数化也无上下文技能。三种指标:模型输出与 gold 答案间的 F1(BERT Score 用 RoBERTa-large 计算)与由 DeepSeek-V4-Flash 基于评分规则给出的 LLM judge。所有生成设置沿用 SHINE,仅调整上下文长度以最小化截断率,保证公平比较。
4.2 主实验结果 (SWE 六任务)
主实验覆盖六类 SWE 子任务:Feature/Patch(125)、Robustness Fix(55)、Refactor/API Migration(39)、Performance/Data(10)、Diagnosis/Search(30)、Configuration/Integration(20)。在所有指标、所有任务上,ParametricSkills 都显著优于三个基线:
- No-Skills:LLM 平均得分 50.21;
- SHINE:48.48(说明 SHINE 不能直接迁移到参数化技能生成,无法忠实压缩技能内容与利用方法);
- In-Context:57.65,比 No-Skills +7.44,但仍低于 ParametricSkills 6.44;
- ParametricSkills:64.09,且平均 BERT Score +1.17、F1 +5.53%。
在分项指标上,ParametricSkills 在 5/6 任务上 LLM 判分最高(Performance/Data 38.50 vs In-Context 33.00 / No-Skill 37.00,仅小幅领先);F1 与 BERT 全部领先——说明参数化技能既"答得更准"又"答得更像 gold"。
4.3 多技能合并
在 529 个需要多个技能协同的 SWE 任务上对比三档设置:gold 单技能 / update-space rank-concat 合并 / factor-wise linear 控制(直接按 LoRA 因子同名线性组合)。Rank-concat 合并 Avg. F1 = 0.3586、Avg. Judge = 60.12,超越单技能(58.27)并大幅领先 factor-wise linear(56.15);factor-wise linear 较低说明"在 update 空间合并适配器"比"直接拼接 LoRA 因子"更有效。
4.4 自演化评估 (HumanEval)
在 HumanEval 上评估"自演化"且不假设测试时有 gold 技能——每条任务用 DeepSeek-V4-Flash 由任务指令生成初始技能,再编译为参数技能(文本技能不进入上下文)。运行最多 5 轮,接受即停。No Skill 133/164 (81.09%);Base Parametric Skill 123/164 (75.00%)(初始技能质量低,拖累表现);Self-evolved Parametric Skill 139/164 (84.76%)——验证多次自演化能显著补偿"无 gold"的初始偏差。
在线累积 在 HumanEval 子集(31 题):Base model 9/31 (29.03%);独立自演化 12/31 (38.71%);Online continual merge 16/31 (51.61%)——通过 EMA 把不同任务的成功技能累积成全局参数技能,跨任务经验显著强化了测试时学习。
4.5 消融与设计要点
- 指标设计:LLM judge prompt 与 0-100 评分规则(图 9)强调"语义正确性而非表面形式相似度",并对捏造细节、缺失约束、不一致回答等明确惩罚;
- 训练监控:图 5-7 的 loss/PPL 曲线显示三阶段训练稳定收敛;
- 训练数据规模:单轮 SFT 总样本 140,100,其中训练用单轮 134,115;覆盖 10,936 个独特技能;每条技能中位 5 个样本;技能文档长度中位 728 token;对话长度中位 1,511 token(范围 155-8,183);
- 任务独立性:评估任务严格与训练/验证无重叠,避免数据泄漏。
五、Related Work 与本文定位
测试时参数生成。Hypernetwork-based 的"免 fine-tuning 即时适配器"路线已积累一批代表方法:Text-to-LoRA (Charakorn 2025) 以任务描述经 MLP 单次前向生成 LoRA;LoRAGen (Xiao 2025) 引入 latent diffusion + 模块级 MoE 结构应对 LoRA 非唯一性;Doc-to-LoRA (Charakorn 2026) 把"任意文本"即时内化为适配器;SHINE (Liu 2026) 同时期工作,用 LLM 参数构造超网络,复用其 ICL 能力;视觉侧 LoRA.rar 用超网络预测 LoRA 合并系数。ParametricSkills 将这条范式首次系统地应用到"技能生命周期"上来——而非泛指任务或文档。
技能利用与自演化。以"agent 经验编码为可复用文本技能"为代表:CoEvoSkills 联合技能生成器与协演化验证器,generate-verify-refine 循环报告 46% 提升;SkillOpt 把技能文档视为可训练参数并通过轨迹驱动文本编辑优化;OpenSpace 开源自演化技能引擎;SE-Agent 优化推理轨迹。这些方法均在文本空间运行,迭代噪声大、易漂移,且推理时占上下文 token。ParametricSkills 转而在参数空间内化技能,获得加权组合、相似度驱动的合并-或-创造决策、零上下文开销等优势,且能让小模型(无法文本遵循技能的那种)也能用上技能。
与 LatentSkill (Yu et al., 2026)(同期工作)的差异。两者共享"skill → LoRA"骨架但关键不同:ParametricSkills (i) 针对生产级软件工程而非 ALFWorld + Search-QA;(ii) 构建综合技能库(从 OpenCode 真实轨迹汇总技能),并用强教师模型生成大量"技能利用轨迹";(iii) 引入原则化的多技能合并应对常常需要 ≥2 个技能的现实任务;(iv) 维护自演化 + 持续学习闭环。
六、优点与局限性
优点:
1. 首个针对生产级 SWE 的"参数化技能"框架:相比同期 LatentSkill 在 ALFWorld / Search-QA 上验证,本文直面"代码工程任务需要 ≥2 技能"的高难度场景,LLM 判分比 In-Context 高 6.44 分,实证了"用权重编译技能"在真实长上下文软件工程上的有效性与必要性。
2. 数据规模与方法论双重诚意:45.8K 高质量技能库(显式爬取 + 隐式挖掘)+ 13.4 万条单轮 SFT 样本 + 真实 OpenCode 沙箱执行的多轮轨迹,三阶段训练(重建预训练 → 单轮微调 → 多轮微调)结构清晰、损失曲线稳定可复现;并以 Update-space rank concatenation 实现多技能合并。
3. 从"技能利用"跨越到"测试时持续学习":通过 EMA 把每个被接受任务的成功技能累积进全局参数技能 Φ,首次把"演化技能"等价于"改进模型"(无需反向传播、零上下文开销),为持续学习开辟新范式。
局限性(Appendix D 明确列出):
1. 规模仍可继续扩大:技能库与微调轨迹可继续规模化,以进一步释放超网络能力;
2. 仍依赖 SHINE 预训练 checkpoint:超网络架构与训练规模仍受 SHINE 框架制约,未来需要摆脱 SHINE 的初始化依赖、扩大超网络规模才能释放更大潜力;
3. 持续学习的分布漂移尚未根治:虽然"测试时持续学习"展示出前景,但仍不能解决长迭代期的分布漂移,需要更先进的超网络架构才能缓解;
4. 任务代表性集中在 SWE:6 类子任务虽有代表性,但长期、多模态、多智能体协作等场景仍是开放问题;另外,测试时多技能仍需预设选择(本文未给出自动化技能路由机制)。
七、复现要点
- 骨干与超网络:Qwen3-8B(冻结) + 复用 SHINE 同架构超网络(从 SHINE 最终 checkpoint 初始化);
- 训练超参:AdamW,zero weight decay,grad clip ratio 1.0,lr 峰值 1e-5,线性 lr decay;预训练 2 epoch,单轮微调 1 epoch,最大上下文长度 10K tokens;
- 数据:45.8K 技能库(13 个领域)+ 13.4 万单轮训练样本 + OpenCode 沙箱执行的多轮轨迹;单轮样本平均每条 12.26 个、中位 5,文档长度中位 728 token、对话长度中位 1,511 token;
- 评估:LLM judge = DeepSeek-V4-Flash,0-100 评分规则(强调语义正确性,捏造/缺失/不一致要扣分);F1 与 BERT Score 用 RoBERTa-large 计算;
- 自演化超参:HumanEval 上最多 5 轮,verifier 接受即停;EMA β = 0.1,全局技能贡献权重 λ = 0.05;
- 基线:SHINE(直接用 SHINE 最终 ckpt 的参数化技能)、In-Context(同技能文档,放提示)、No-Skills;
- 多技能合并实现:update-space rank concatenation + 有效增量范数校准。
八、适用场景与延伸思考
适合场景:(1) 复杂生产级软件工程——长上下文、多技能、噪声输入下的代码任务(如端到端 PR / 缺陷修复 / 性能优化 / API 迁移),本文在六类子任务上验证;(2) 包含专有流程的智能体产品——技能不再以明文出现在 prompt 中,降低信息泄露与提示注入风险;(3) 任务流式演进的真实部署——测试时可对每个成功任务累积技能,无需反向传播也能让模型在生命周期内"越用越强";(4) 多技能路由与编排——同一模型同时挂载多份技能 LoRA,通过权重空间算术按需拼装。
下游可借鉴:(1) 多模态技能——把 GUI/视觉/具身流程也编译为 LoRA,扩展到 GUI Agent、机器人控制;(2) 自演化技能市场——把技能编译接口开放给第三方,Skill Marketplace 中每个技能独立编译、独立缓存、独立下线;(3) 多智能体专家混合——不同 agent 持有不同技能 LoRA,通过参数空间算术实现"专家混合",绕过 prompt 通道串扰;(4) 安全审计——权重空间技能天然抵御 Extract 攻击,可作为可分发的审计单元。
未来方向:(1) 自适应技能路由——根据任务自动选技能、自动调注入系数,消除人工选择门槛;(2) 跨模型泛化研究——不同 backbone/规模/LoRA rank 下的稳定性;(3) 大规模与超网络自进化——摆脱 SHINE 初始化,扩大超网络规模;(4) 长迭代持续学习——解决分布漂移;(5) 理论刻画——为什么 LoRA 权重能成为"程序性技能"的可组合表征;(6) 与 RAG / 工具 / 多智能体协作的协同——技能参数化与检索增强、工具调用、其他 agent 技能之间的接口设计。
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。





