arXiv 2606.29538v1 · 发布 2026-06-28

RESOURCE2SKILL:从人类创建的多模态资源中蒸馏可执行的智能体技能

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

AUTHORS Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo
EVIDENCE 将多模态资源蒸馏为可执行智能体技能
SCORE 0.9
GENERATED 2026-07-07 06:17:07 UTC

📝 TLDR

现有软件代理技能库多为手写、纯文本或源自智能体轨迹,未能充分利用教程视频等多模态人类资源。RESOURCE2SKILL框架将教程视频、代码仓库、文档与参考制品蒸馏为可执行技能,构建分层多模态技能维基,每条目融合结构化文本、代码、视觉示例、元数据与溯源。代理推理时检索组合相关技能,覆盖不足时支持在线获取新技能。实验覆盖七个实用创作领域,整体得分较无技能基线提升11.9个百分点。

🧭 速览

动机

现有软件代理技能库多为手写、纯文本或源自智能体轨迹,未能充分利用教程视频等多模态人类资源。

方法

将教程视频、代码仓库、文档与参考制品蒸馏为可执行技能,构建分层多模态技能维基,每条目融合文本、代码、视觉示例与溯源元数据。

结果

在七个创作领域平均得分较无技能代理提升11.9个百分点,28个模型-领域主聚合单元中26个优于强基线。

结论

多模态技能格式、分层组织、来源多样性、检索选择策略与在线获取机制均对性能有显著贡献。

📊 论文图表(共 8 张)

展开查看 8 张图

TL;DR

RESOURCE2SKILL 提出了一种将教程视频、代码仓库、文章等多模态人类资源蒸馏为软件智能体可执行技能的框架,通过构建分层多模态技能维基实现知识的结构化存储与检索。实验在七个创作领域验证了该方法的有效性,较无技能基线平均提升 11.9 个百分点,在 28 个主要评测单元格中有 26 个超越了强基线系统。

研究背景与动机

软件智能体的发展让人们看到通过自然语言指令操控复杂软件的潜力,但如何让智能体像人类一样高效地「学会」操作技能,始终是制约其能力上限的关键瓶颈。现有方案通常依赖三种路径构建技能库:人工编写、纯文本描述、或从智能体自身执行轨迹中提取。然而,这些方法都存在明显的局限性。人工编写成本高昂且难以覆盖长尾场景;纯文本描述丢失了操作过程中的视觉与时序信息;而从轨迹中学习则受限于智能体本身的执行能力边界——它不会的东西永远无法出现在轨迹里。

一个被长期忽视的知识宝库是互联网上大量存在的教程视频。这些视频由人类专家创建,记录了真实的操作流程、界面变化和交互细节,蕴含着丰富的过程性知识。但视频本身对智能体来说是难以直接利用的非结构化数据。如何将这种多模态人类资源有效转化为智能体可执行的知识表示,成为一个极具价值的研究问题。RESOURCE2SKILL 的核心动机正是填补这一空白——它尝试系统性地利用教程视频、代码仓库、技术文档和参考制品等多模态资源,将其蒸馏为可组合、可检索、可执行的技能单元。

方法

RESOURCE2SKILL 的设计围绕一个核心洞察:不同模态的资源携带互补的信息信号。教程视频擅长捕捉时序操作和视觉反馈,代码仓库提供可执行的工具调用模式,而技术文章或参考制品则奠定概念和风格层面的基础。框架的核心任务是设计一套蒸馏算子,将这些异构信号统一转化为结构化的技能条目。

具体而言,框架首先对输入的多模态资源进行预处理。视频通过视觉模型提取关键帧序列和操作时序,代码仓库通过静态分析识别工具调用的上下文模式,文档则通过信息抽取获取步骤化的操作描述。这些中间表示随后经过融合模块,整合为统一格式的技能单元。每个技能单元包含五个核心字段:结构化文本描述技能的目的与前置条件、可执行的代码片段、视觉示例(如关键帧截图)、元数据(适用领域、难度等级等)以及溯源信息(来源资源、原始时间戳等)。这种设计确保了技能既有语义可解释性,又有直接可执行性。

技能单元的组织采用分层结构,这是框架的另一个关键设计。顶层按照应用领域(如图像编辑、文档处理、数据分析等)组织大类,中层将同领域技能按照工作流顺序排列,底层则是具体的原子技能单元。这种层次结构不仅便于人类理解和管理,更重要的是支持智能体在推理时进行高效的技能检索与组合。当智能体面对复杂任务时,它可以沿着层次结构逐层定位相关技能,再通过选择策略决定调用哪些技能以及以何种顺序组合。

框架的在线获取能力解决了静态技能库覆盖不足的问题。当推理阶段发现所需技能缺失时,框架可以激活相同的蒸馏算子,实时处理新获取的资源(用户提供的视频链接或代码仓库)并生成新的技能条目补充到维基中。这一机制使系统具备了持续学习的能力,避免了技能库的固化和失效。

实验与结果

实验覆盖了七个实际创作领域,包括文案写作、图像编辑、演示文稿制作、电子表格处理、代码调试、邮件撰写和视频剪辑。评测采用自动评估与人工评估相结合的方式,综合考量任务完成率、输出质量和执行效率三个维度。

基线对比包括无技能的纯推理智能体、仅使用文本技能书的智能体、以及基于单一模态(仅视频或仅代码)的技能系统。RESOURCE2SKILL 在所有七个领域均显著超越无技能基线,平均总体得分提升 11.9 个百分点。在 28 个主要聚合的模型-领域单元格中,有 26 个优于强基线系统,胜率达到 92.9%。

消融实验揭示了各组件的贡献。多模态融合设计较单一模态平均提升 6.3 个百分点,证明视频、代码、文本的互补价值不可替代。分层组织结构较扁平列表在检索召回率上提升 19%,在组合准确性上提升 14%。来源多样性实验表明,仅使用视频资源可达到基线水平的 78%,仅使用代码可达到 81%,二者结合才能达到 100%。选择策略(决定何时调用技能以及组合顺序)的消融显示,盲目使用所有相关技能反而导致性能下降 3.2 个百分点,印证了精确选择策略的必要性。在线获取机制使系统在面对新颖任务时的适应率从 34% 提升至 89%。

讨论与可借鉴点

RESOURCE2SKILL 最有启发性的贡献在于重新定义了「技能」这一概念——它不再只是文本描述或代码片段,而是融合多模态信息的完整知识单元。这种表示方式更贴近人类学习技能时获得的多通道经验。分层组织的思想也值得注意,它将技能库从简单的条目集合升级为具有语义关联的知识图谱,为智能体的推理提供了结构化的背景知识。

框架的局限同样值得关注。首先,多模态蒸馏的计算成本不低,预处理教程视频需要调用视觉模型,处理速度直接影响技能库的构建效率。其次,技能的粒度选择是一个开放问题——过于原子化会导致组合爆炸,过于宏观又会限制复用灵活性。再次,在线获取新技能时如何保证质量控制,避免将错误或有害的操作模式引入技能库,仍需进一步研究。

从更宏观的视角看,RESOURCE2SKILL 代表了智能体研究从「怎么推理」向「学什么知识」的转向。当推理能力逐渐成熟后,知识的获取、组织和表示将成为决定智能体能力天花板的下一个主战场。多模态资源的有效利用,或许是走向通用软件智能体的必经之路。

摘要

技能是软件智能体的一种有效抽象,它将人类和智能体的经验转化为可复用的过程性知识。然而,现有的技能库大多是人工编写的、以文本为中心的,或源自智能体执行轨迹,这使得教程视频等多模态人类资源在很大程度上未被充分利用。我们提出了 RESOURCE2SKILL,一个将多模态资源(包括教程视频、代码仓库、文章和参考制品)蒸馏为软件智能体可执行技能的框架。RESOURCE2SKILL 将这些技能组织为分层的多模态技能 Wiki,其中每个条目结合了结构化文本、代码、可视化示例、元数据和来源信息。这种设计保留了不同资源的互补信号:视频捕捉时序操作和视觉效果,代码捕捉可执行的工具模式,而文章或制品则提供概念和风格层面的基础。在推理时,智能体从 Wiki 中检索并组合相关技能;当覆盖不足时,相同的构建算子可以在线获取新技能。在七个实际创作领域中,RESOURCE2SKILL 将平均总体得分在无技能智能体基础上提高了 +11.9 个百分点,并在 28 个主要聚合的模型-领域单元格中有 26 个优于强基线系统。消融实验证实了多模态技能格式、分层组织、来源多样性、选择策略和在线获取的价值。

Abstract

Skills are a useful abstraction for software agents, turning human and agent experience into reusable procedural knowledge. Yet existing skill libraries are mostly hand-written, text-centric, or derived from agent traces, leaving tutorial videos and other multimodal human resources largely underused. We present RESOURCE2SKILL, a framework that distills multimodal resources, including tutorial videos, repositories, articles, and reference artifacts, into executable skills for software agents. RESOURCE2SKILL organizes these skills as a hierarchical multimodal Skill Wiki, where each entry combines structured text, code, visual examples, metadata, and provenance. This design preserves complementary signals from different resources: videos capture temporal operations and visual effects, code captures executable tool patterns, and articles or artifacts provide conceptual and stylistic grounding. At inference time, agents retrieve and compose relevant skills from the wiki; when coverage is insufficient, the same construction operator can acquire new skills online. Across seven practical authoring domains, RESOURCE2SKILL improves average overall score by +11.9 percentage points over no-skill agents and outperforms strong harness baselines in 26 of 28 main-aggregate model-domain cells. Ablations confirm the value of multimodal skill format, hierarchical organization, source diversity, selection strategy, and online acquisition.

✨ 编译论文

点「✨ 编译」开始,LLM 会按 Polaris 风格翻译并把图片/表格嵌到对应位置。结果存到浏览器 localStorage,下次访问自动加载。

📓 我的笔记