LatentSkill:面向 LLM 智能体、从上下文文本技能到权重内潜在技能
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
📝 TLDR
现有LLM智能体将文本技能注入提示词,存在上下文开销大且暴露技能内容的问题。LatentSkill通过预训练超网络将文本技能转为即插即用的LoRA适配器,把技能知识存储于权重空间而非上下文。在ALFWorld和Search-QA上以显著更少的prefill token超越上下文技能基线,且生成技能LoRA具备结构化、可控、可组合的特性。
🧭 速览
文本技能库在每步注入提示造成大量上下文开销,重复技能文本增加prefill成本并暴露专有内容;将技能融入参数又丧失模块化能力。
训练一个超网络(hypernetwork),输入技能描述即可单次前向生成对应LoRA适配器,挂载到骨干LLM上完成推理,实现零技能token的即插即用。
ALFWorld seen/unseen split成功率提升21.4和13.4点,prefill token减少64.1%;Search-QA EM提升3.0点,技能token开销降低72.2%。
权重空间技能既保持模块化加载、缩放与组合灵活性,又显著压缩提示开销,为扩展LLM智能体提供高效、低暴露的知识表征基底。
📊 论文图表(共 5 张)
展开查看 5 张图
TLDR
现有LLM智能体将文本技能注入提示词,存在上下文开销大且暴露技能内容的问题。LatentSkill通过预训练超网络将文本技能转为即插即用的LoRA适配器,把技能知识存储于权重空间而非上下文。在ALFWorld和Search-QA上以显著更少的prefill token超越上下文技能基线,且生成技能LoRA具备结构化、可控、可组合的特性。
Abstract
Agent systems increasingly use textual skills to encode reusable task procedures, but injecting these skills into the prompt at every step incurs substantial context overhead and exposes skill content as plaintext. We present LatentSkill, a framework that converts textual skills into plug-and-play LoRA adapters through a pretrained hypernetwork. LatentSkill stores skill knowledge in weight space rather than context space, removing per-step skill tokens while preserving modular loading, scaling, and composition. On ALFWorld and Search-QA, LatentSkill outperforms the corresponding in-context skill baseline while using substantially fewer prefill tokens: it improves ALFWorld success by 21.4 and 13.4 points on the seen and unseen splits with 64.1% fewer prefill tokens, and improves Search-QA exact match by 3.0 points with 72.2% lower skill-token overhead. Further analysis shows that generated skill LoRAs form a structured semantic geometry, can be precisely controlled via the LoRA scaling coefficient, and can be composed through parameter-space arithmetic when skill components are aligned. These findings suggest that weight-space skills provide an efficient, modular, and less exposed substrate for extending LLM agents.
动机
文本技能库在每步注入提示造成大量上下文开销,重复技能文本增加prefill成本并暴露专有内容;将技能融入参数又丧失模块化能力。
方法
训练一个超网络(hypernetwork),输入技能描述即可单次前向生成对应LoRA适配器,挂载到骨干LLM上完成推理,实现零技能token的即插即用。
结果
ALFWorld seen/unseen split成功率提升21.4和13.4点,prefill token减少64.1%;Search-QA EM提升3.0点,技能token开销降低72.2%。
结论
权重空间技能既保持模块化加载、缩放与组合灵活性,又显著压缩提示开销,为扩展LLM智能体提供高效、低暴露的知识表征基底。
深度精读
> 基于 PDF 全文生成 · 模型: MiniMax-M3 · 全文
一、全文翻译(节选)
智能体系统越来越多地使用文本形式的技能来编码可复用的任务流程,但在每一步将这些技能注入提示词会带来显著的上下文开销,并将技能内容以明文形式暴露。我们提出 LatentSkill,这是一个通过预训练超网络将文本技能转换为即插即用 LoRA 适配器的框架。LatentSkill 将技能知识存储于权重空间而非上下文空间,在保留模块化加载、缩放与组合能力的同时,消除了每一步的技能 token。在 ALFWorld 和 Search-QA 上,LatentSkill 以显著更少的 prefill token 超越了对应的上下文技能基线:它在 seen 和 unseen split 上分别将 ALFWorld 成功率提升 21.4 和 13.4 个点,同时 prefill token 减少 64.1%;在 Search-QA 上将 EM 提升 3.0 个点,技能 token 开销降低 72.2%。进一步分析表明,生成的技能 LoRA 在权重空间中形成了结构化的语义几何,可通过 LoRA 缩放系数精确控制其强度,并在技能组件对齐时通过参数空间算术进行组合。这些发现表明,权重空间技能为扩展 LLM 智能体提供了一种高效、模块化且暴露面更小的知识表征基底。
二、研究背景与动机
LLM 智能体在处理长视野、专业化任务时,普遍依赖从技能库中检索相关文本技能并将其注入提示词的设计。然而,这种"上下文技能"模式存在三个层面的问题:(1) 上下文开销膨胀——同一技能文本会在多个决策步骤中重复注入,持续消耗上下文窗口,显著抬高 prefill 计算成本;(2) 长上下文利用率下降——已有研究表明,模型在长 prompt 中难以稳健地利用所有信息("lost in the middle"现象);(3) 专有内容暴露与安全风险——技能以明文形式驻留在 prompt 中,既暴露了专有流程,又与不可信的环境观测共享同一指令通道,容易被 prompt 注入或劫持攻击所利用。
另一条路线是将技能融入模型参数(如智能体微调或课程学习),但这种方式将技能与骨干权重不可逆地熔合,丧失了模块化更新、删除与组合的能力。因此,领域面临一个三难困境(trilemma):既要在推理时避免重复注入技能文本,又要支持技能的可模块化更新与运行时组合。LatentSkill 正是为打破这一三难困境而提出的——它把文本技能编译成可插拔的 LoRA 适配器,既不占用上下文,也保留模块化灵活性。
三、方法详解
3.1 整体框架
LatentSkill 的核心思路是"用权重替代 token":将文本技能 s 通过一个训练好的技能编译器(超网络 G_φ)单次前向映射为 LoRA 增量 Δs = Gφ(s),再挂载到冻结的骨干 LLM M_θ 上。推理时,prompt 中不再包含技能文本,智能体仅依赖任务历史 h_t 和参数化的技能增量 Δ_s 进行决策。整个 pipeline 由四个环节组成:潜在技能形式化定义 → 文档级预训练 → 轨迹监督微调 → 推理时控制与组合,实现"编译一次、缓存复用、加载即用"的端到端流程。
3.2 关键模块
模块一:潜在技能定义 (Latent Skill Definition)。设 M_θ 为冻结骨干 LLM,s 为文本技能,决策步 t 时智能体观察历史 h_t、产出 y_t。在上下文技能模式下,p(y_t | h_t, s) 直接以技能文本为条件;LatentSkill 用参数条件替换文本条件,p(y_t | h_t, s) = p(y_t | h_t; θ ⊕ αΔ_s),其中 Δs = Gφ(s) 是由编译器生成的潜在技能,⊕ 表示 LoRA 形式的参数叠加,α 控制注入强度。每个目标模块 m 内的生成更新沿用标准 LoRA 形式 ΔW^(m)_s = B^(m)_s A^(m)_s,挂载后 W' = W + (α/r) B_s A_s(r 为 LoRA 秩)。一份完整的潜在技能是各目标模块生成更新的集合 Δ_s = {ΔW^(m)s}{m∈M}。
模块二:文档级预训练 (Skill Document Pretraining)。为了让超网络掌握"把程序性文本映射为可用 LoRA 权重"的能力,作者从 GitHub 抓取了约 17.1 万去重的技能文档(约 3 亿 token),随机采用两种自监督任务:(a) 重建任务(reconstruction)——编译器读完整文档 s,适配后的骨干接收重建指令后输出原文;(b) 补全任务(completion)——把文档随机截断得到前缀 s̃,编译器读 s̃,骨干补全出完整文档。骨干全程冻结,仅更新编译器参数 φ。该阶段的关键设计是:技能文档只对编译器可见、对骨干不可见,因此必须把信息压缩进 LoRA 才能完成重建/补全。损失函数为 −Σ{i,j} log p(z{i,j} | q_i, z_{i,<j}; θ ⊕ αΔ^pre_i),仅对 token 级目标做 teacher-forcing。
模块三:轨迹监督微调 (Trajectory-Supervised Fine-Tuning)。在 Xia et al. (2026) 公开的教师轨迹上进行微调,每条样本是 (技能文档 s_i, 教师轨迹 τ_i) 对,其中 τi = {(h{i,t}, y★_{i,t})}。同一份轨迹内,智能体所有决策步共享同一份由 s_i 编译出的 Δ^sft_i —— 这种"跨步共享同一适配器"的设计,促使编译器学到"跨步稳定的技能级策略"而非每步适配。训练集混合了 ALFWorld(237 条完整轨迹)与 Search-QA(500 条),共 8 个技能(ALFWorld 5 + Search 3)。损失 L_sft 与 L_pre 同形,只在 Δ 的来源与 y★ 的角色上不同,只有编译器参数 φ 被更新。
模块四:推理时技能控制与组合 (Inference-Time Skill Control and Composition)。编译与执行解耦:每个技能 s_k 编译一次并缓存为 C[k] = G_φ(s_k),推理时不再需要技能文本。通过 LoRA 注入系数 α_k 可以平滑调节技能强度:α=0 退化为原始骨干,α 越大技能影响越强,过大则破坏骨干(倒 U 曲线)。多技能组合为 ΔK = Σ{k∈K} α_k C[k]——这是直接的参数空间算术。当多技能共享子组件时,直接相加会双重计数共享行为;LatentSkill 进一步支持组件级组合(component-level composition):把一个技能 s_k 分解为语义组件 c_{k,1}, …, c_{k,L_k},各组件独立编译 Δ{k,ℓ} = Gφ(c_{k,ℓ}),最终 Δcomp = Σ{c∈U} γc Gφ(c),U 为被选组件集合,γ_c 为组件级注入系数。
3.3 关键公式解读
这是 LatentSkill 的"参数条件化"核心定义:在给定技能 s 与历史 h_t 的条件下,输出 y_t 的概率等价于"在冻结骨干 θ 之上叠加 α·Δ_s 缩放后的 LoRA 增量"后,仅依据 h_t 预测的概率。其中 θ 为冻结骨干参数,φ 为编译器参数,Δs = Gφ(s) 是由编译器生成的技能 LoRA,α 是注入强度系数,⊕ 表示 LoRA 形式的参数叠加。该公式的关键意义在于:条件信息 s 被完全消化进参数 Δ_s,而不再出现在上下文输入中——这是"用权重替代 token"思想的形式化落地。
对每个目标模块 m(attn_q/k/v/o、mlp_gate/up/down)采用标准 LoRA 形式:B、A 分别是超网络生成的下投影与上投影矩阵,W' = W + (α/r)·B_s A_s 是挂载后的有效权重。该形式保证适配器只引入低秩增量,既经济又便于组合与缩放。
推理时多个技能的组合公式:K 是被选中的技能集合,C[k] 是缓存好的技能 k 的 LoRA,α_k 是各自的注入系数。该式实现了"参数空间算术"——技能组合不需要重新训练,而是直接对 LoRA 做线性叠加。但作者在 case studies 中指出:直接合并共享组件会双重计数导致权重冗余(Direct Merging 失败模式),因此补一个 component-level 做法作为"对齐语义的细粒度组合"。
3.4 图表解读
图 1(Key Advantages)。左侧列出 LatentSkill 相对 In-Context Skill 的两大关键优势:(1) 提示词中无技能 token 但仍具备即插即用的模块化能力(重量而非文本);(2) 权重空间技能形成的"结构化、可控、可组合"结构。
图 2(Overview)。三段式架构:左图描绘从文本技能到权重空间技能的整体数据流(技能文本 → 技能编译器 → 技能 LoRA → 骨干 LLM);中图说明编译器经过两阶段训练——文档级预训练(重建 + 补全)与轨迹监督微调;右图突出生成出的 LoRA 在权重空间中的三大特性:结构化(Structured)、可控(Controllable)、可组合(Composable)。
图 3(MDS Visualization)。左图对 8 个域内技能 LoRA(5 个 ALFWorld + 3 个 Search)做 MDS 降维可视化,显示跨域距离 0.0887(预训练后)、0.0704(SFT 后降低 20.6%),且域内余弦相似度(0.982)显著高于跨域(0.910);右图对来自 Code/Finance/Writing 三域的 42 个 OOD 技能做聚类——域内 0.783/0.9664/0.9681、跨域更低,说明编译器编码出的不是"压缩提示",而是"语义组织的程序性知识"。
图 4(Scale-Performance Curves)。横轴为 LoRA 注入系数 α ∈ [0, 1.2],纵轴为 ALFWorld 成功率。曲线呈倒 U 形——seen split 在 α≈0.6 达到 74.29%,unseen split 在 α≈0.5 达到 70.90%;过大(α=1.2)时性能骤降至 22.86% / 8.21%。这验证了"权重空间技能可通过 α 实现连续、平滑、可控的强度调节",而非只能"加载/卸载"二选一。
四、实验设置与结果
4.1 数据集与基线
ALFWorld:文本交互式家庭任务基准,与 ALFRED 具身 AI 对齐,共 6 类任务(Pick / Look / Clean / Heat / Cool / Pick2)。评估 seen split(140 集)与 unseen split(134 集),每集上限 50 步,指标为成功率。
Search-QA:遵循 Jin et al. (2025) 的评估协议,覆盖 7 个搜索增强 QA 数据集,包括 3 个单跳(NQ 训练用、TriviaQA / PopQA 域外)和 4 个多跳(HotpotQA 训练用、2WikiMultihopQA / MuSiQue / Bamboogle 域外),各取 500 条样本(Bamboogle 全量 125 条),指标为 Exact Match。
基线方法:ALFWorld 上对比 Vanilla、Few-shot、Reflexion (Shinn et al., 2023)、AdaPlanner (Sun et al., 2023)、In-Context Skill;Search-QA 上对比 Vanilla、CoT、Few-shot、R1-Instruct、RAG、In-Context Skill。其中 In-Context Skill 与 LatentSkill 使用同一份技能文档,只是前者放提示、后者编成 LoRA,是最直接的对照。
实现细节:骨干为 Qwen3-8B(全程冻结),编译器为基于 Transformer 的超网络;预训练阶段在 8×H100 上训 10 epoch,batch 64,lr 5e-5(200 warmup),max len 4096,AdamW(wd 0.1);SFT 阶段 batch 32,lr 1e-5(400 warmup),同 10 epoch;Search-QA 的 passage 检索器为 E5,top-k=3,最多 4 步。
4.2 主要结果
性能:LatentSkill 在两项基准上均刷新 SOTA。ALFWorld seen/unseen 平均成功率 74.3% / 69.4%,相对 In-Context Skill(52.9% / 56.0%)分别提升 +21.4 / +13.4 个点;Search-QA 平均 EM 35.6,相对 In-Context Skill(32.6)提升 +3.0 个点。增益在多步/复杂任务上尤其显著——unseen Pick2 上从 23.5%(In-Context Skill)跳升至 70.6%,领先第二名(Reflexion 0%)41.2 个点;同时在 HotpotQA 与 MuSiQue 上也获得最佳分数。
Token 效率:ALFWorld prefill token 减少 64.1%(从 1.21k 步均降至 0.44k,与 Vanilla 持平);Search-QA 技能 token 开销降低 72.2%(从 1.10k 降至 0.31k)。同时轨迹长度也缩短——seen split 平均步数从 Vanilla 的 35.0 降至 28.4,即用更少环境交互达到成功。
鲁棒性(扰动):在 Paraphrase / Plaintext / Reorder / Noise 四种扰动下,LatentSkill 在 ALFWorld 上仍领先 In-Context Skill 17.2~24.3 个点,Search-QA 全面占优;Markdown 去除(Plaintext)不带来任何下降(ALFWorld 仍 74.3%),说明 LoRA 抓取的是语义而非格式;四种扰动下 ALFWorld 平均为 70.7%,仅比基线低 3.6 个点。
安全性(对抗攻击):Hijack 攻击下,ALFWorld In-Context Skill 从 52.9% 骤降至 8.57%,而 LatentSkill 仍保留 38.6%(Search-QA 仅下降 1.6 个点);Extract 攻击下技能不再以明文暴露——ALFWorld 上 LatentSkill 70.0% vs In-Context Skill 48.6%,Search-QA 29.3 vs 21.3。权重空间存储显著缩小了攻击面。
4.3 消融实验
(1) 注入位置消融 (Appendix D)。对 7 个 LoRA 注入位置(attn_q/k/v/o、mlp_gate/up/down)分析"域内-跨域余弦相似度差",发现 attn_o 与 mlp_down 的差异度显著高于其他位置(pretrain 0.056/0.105,SFT 0.050/0.094),而 attn_q/k/v 接近 0。功能上,只往 attn_o + mlp_down 两个位置注入(full:o+d)在 seen split 保留 93.3% 性能(unseen 还略超 +2.2 个点),表明剩余 5 个位置主要贡献噪声。
(2) 低秩编码分析 (Appendix E)。Frobenius 范数 ‖ΔW‖ 在预训练/SFT 间跨域差异极小,说明超网络输出的是量级稳定的权重;稳定秩仅 2.35~2.40(预训练)/ 2.17~2.23(SFT),而随机初始化的同形状 LoRA 稳定秩为 837.87——差距约 380 倍;SFT 后所有技能 top-2 能量从 ~67% 上升至 ~70%、top-5 在 ~93%,进一步证实技能知识被压缩到极少的奇异方向。这从数值层面证实:超网络学到的不是"任意 LoRA 形状",而是"压缩到低秩子空间的程序性表征"。
(3) 组合策略消融 (Table 3, §4.5)。在 Look + Pick 组合任务上比较 5 种配置。结果显示 Component Merging 在 seen 84.6% / unseen 77.8%,全面领先 Look-Only(61.5%/72.2%)、Direct Merging(69.2%/61.1%)、Text Merging(61.5%/61.1%)、Pick-Only(61.5%/61.1%)。案例研究(Appendix H)揭示了三种失败模式的根因:
- Direct Merging (Case 2, ep6):Look + Pick 共享 general + mistakes 组件,完整 LoRA 直接相加会重复叠加共享组件,超放大通用行为模式,导致"识别到 keychain 后无法触发 pick-up"的决策阈值受损;
- Text Merging (Case 3, ep36):把两段技能文本拼接成单一输入给超网络,而超网络训练时只见过"单一技能",拼接文本构成 OOD 输入,生成的 LoRA 无法分解两个技能——模型能执行单步正确动作但无法将其串联为连贯序列(取了闹钟 → 放下 → 开台灯 → 又离开);
- Component Merging (Case 1, ep4):把组件拆出来独立编译,通用组件只挂一次,Pick-specific 搜索策略(系统化遍历 shelf 1→2→3)被无缝注入 Look 的台灯激活行为,无需其他调整。
五、Related Work 与本文定位
LLM 智能体与技能系统:从 Voyager 的可执行技能库、Xia et al. 的 SkillBank 层次化自演化、Wu et al. (Evolver) 的经验生命周期,到 Anthropic Agent Skills 工业规范(已被 Claude Code、Cursor、Gemini CLI 采用),主流路线均把技能作为"上下文中的自然语言文本"注入;Lu et al. (Skill0) 反其道而行,通过渐进式课程将技能内化进骨干参数,但代价是模块化丧失。LatentSkill 处于"上下文技能"与"参数内化"的中间地带:把技能显式编码为外挂 LoRA,既无需上下文注入,又保持完全模块化——这条"权重即技能"的中间地带,正是本文最核心的差异化贡献。
超网络生成 LoRA:Text-to-LoRA (Charakorn 2025) 用小 MLP 逐层生成 LoRA 片段;Generative Adapter (Chen 2024) 利用骨干隐状态生成权重;ICAE (Ge 2024) 压缩上下文为紧凑 token;SHINE (Liu 2026) 逐层提取记忆状态并通过注意力实现跨层信息流;Doc-to-LoRA (Charakorn 2026) 用 Perceiver 编码器即时内化上下文。这些工作聚焦"上下文→LoRA"的通用映射,而 LatentSkill 首次聚焦"智能体技能→LoRA"的特定场景,并系统揭示生成 LoRA 权重空间的结构性、可控性与可组合性——同时也为后续 ParametricSkills 提供了从"ALFWorld / Search-QA 概念验证"走向"软件工程 / 测试时持续学习"的桥梁。
六、优点与局限性
优点:
1. 真正的"零技能 token":与上下文压缩方法不同,LatentSkill 把技能彻底移出 prompt,带来 64~72% 的 prefill 成本下降,同时性能不降反升,做到"鱼与熊掌兼得"——这是"用权重替代 token"思想的最直接落地。
2. 模块化与安全性兼得:LoRA 形式天然支持加载/卸载/替换/缩放/组合,同时把专有技能从明文 prompt 中隐藏,显著缩小 prompt 注入与劫持的攻击面——Hijack 下仍保持 38.6% 性能(基线 8.57%),Extract 下技能不复以明文出现。
3. 揭示权重空间的内在结构:不仅给出方法,还通过 MDS / 注入系数 α 缩放 / 组件级合并三类实验,系统论证生成的 LoRA 形成的语义几何(可聚类)、α-可调(倒 U 曲线)、组件级可组合——为"权重即知识表征"提供了可分析、可干预的研究基底;低秩编码分析还证实技能知识被压缩到极少的奇异方向(稳定秩 ~2.4 vs 随机 ~838,差距 380×)。
局限性:
1. 基准覆盖面有限:仅在 ALFWorld 与 Search-QA 上验证,缺少网页浏览、软件工程、多智能体协作等更贴近真实部署的场景,对长视野、跨工具链技能的泛化能力未知。
2. 骨干与配置单一:所有实验均在 Qwen3-8B + 固定 LoRA 配置下完成,未验证不同模型家族、规模、adapter 配置下的稳定性;LoRA 秩与目标模块选择(attn_o + mlp_down 最优)在跨模型迁移时可能需要重新调优。
3. 最优 α 依赖任务,且缺乏自适应机制:倒 U 曲线显示最优 α 因任务难度而异(0.5~0.8 不等),单一全局 α 在部分任务上会损失 12~22 个点;但论文未给出自动 α 选择方案,组合时还需人工做语义对齐分解,自动化门槛较高。
七、复现要点
开源情况:代码已开源,地址为 https://github.com/yuaofan0-oss/LatentSkill;技能库复用 Xia et al. (2026) 公开数据。
核心超参:LoRA 注入目标模块为 attn_o + mlp_down(2/7 位置,大幅减少参数);α 默认 1,SFT 阶段;注入位置消融表明该选择兼顾性能与参数效率。LoRA rank 与具体超参详见 Appendix A。
训练配置:预训练阶段 8×H100、batch 64、lr 5e-5、200 warmup、4096 max len、10 epoch、AdamW(wd 0.1);SFT 阶段 batch 32、lr 1e-5、400 warmup、10 epoch。
数据规模:预训练 171K GitHub 技能文档(~300M tokens,去重);SFT 含 237 条 ALFWorld + 500 条 Search-QA 教师轨迹;ALFWorld 评估 140+134 集,Search-QA 各数据集 500 条(Bamboogle 全量 125 条)。
硬件门槛:最低 8×H100 GPU 用于训练;推理时只需单卡即可,但需为每个技能额外缓存一份 LoRA,占少量显存。
八、适用场景与延伸思考
适合场景:(1) 高频调用、文本冗长的技能型智能体——例如代码助手、客服机器人、流程自动化,长会话中重复注入技能文本成本极高;(2) 涉及专有/敏感流程的智能体——技能内容需要保护,不希望以明文出现在 prompt 中;(3) 多技能组合的复杂工作流——例如既要搜索又要推理、既要调度又要反思的复合任务,可借助权重空间组合按需拼装;(4) 多租户/插件市场场景——每个租户的技能可独立编译、独立缓存、独立下线。
下游可借鉴:(1) 多模态技能——结合 MMSkills 等视觉技能,把图像/视频操作流程也编成 LoRA,扩展到 GUI Agent、具身机器人;(2) 终身学习与技能演化——超网络本身可作为技能更新接口,新增技能时只需增量训练编译器,无需重训骨干;(3) 多智能体协作——不同 agent 持有不同技能 LoRA,通过参数空间算术实现"专家混合",避免 prompt 通道的串扰;(4) 安全审计——权重空间难以被 Extract 攻击还原,可作为 Skill Marketplace 中的可分发、可审计单元(结合 Skillprobe 类多智能体审计)。
未来方向:(1) 自适应 α 选择机制(根据任务难度自动调参;作者已经在文中提示"Optimizing P(α | task) is a promising future direction");(2) 跨模型泛化研究(不同 backbone/规模下的稳定性,作者明确指出 Qwen3-8B + 固定 LoRA 配置是验证局限);(3) 技能冲突与干扰度量(建立组件级组合的失败检测与自动重对齐,Direct Merging / Text Merging 的失败模式已暴露该问题);(4) 在线技能蒸馏(把用户交互轨迹持续回灌编译器,实现 LoRA 的运行时演化,可与 ParametricSkills 的 EMA 持续学习形成对照);(5) 理论刻画(从信息论/线性表征视角解释"为什么 LoRA 权重能形成语义几何");(6) 与 ParametricSkills 协同——LatentSkill 解决"如何在测试时把文本技能编译进权重",ParametricSkills 解决"如何在真实复杂生产级软件工程场景下让权重技能进一步支持演化与持续学习",两者形成"编译→部署→演化"完整链路。
✨ 编译论文
点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。




