Microsoft 提出 Resource2Skill:把人类教程蒸馏成 Agent 真能执行的多模态技能库
Skill 的价值不在于给 Agent 多塞一段提示,而在于把人类经验变成可检索、可验证、可执行、可复用的程序性知识。
让 Agent 做一张专业幻灯片、一个多表联动的 Excel 仪表盘或一段 Blender 场景,难点往往不是“知道答案”,而是知道 先做什么、调用什么工具、检查什么中间状态。这些步骤藏在人的教程、演示和成品里,却很难直接塞进上下文。
Resource2Skill 的关键动作,是把视频、代码库、文章和参考成品蒸馏为 层级多模态 Skill Wiki。Agent 不再被动检索一段相似文字,而是先浏览技能树,再选择带文字、视觉和代码视图的技能,最后通过 MCP 接到真实软件后端执行。它把“参考资料”推进成了“可运行的程序性记忆”。
💡 一句话总结 本文提出 Resource2Skill,将人类多模态资源蒸馏为层级可执行技能,使七域平均总分较无技能 Agent 提升 11.9 个百分点。
+11.9
平均提升 / pp
26/28
胜过强 Harness
+21.6
新能力在线补齐 / pp
HIGHLIGHTS · 本文看点
01
教程如何变成可执行技能
02
层级、多模态与选技为何有效
03
强提升背后的失效边界
01
PROBLEM
Agent 缺的不是更多资料,而是可复用的“做法”
想象你让 Agent 做一份十页路演。它可能知道什么叫“信息层级”,也能写出标题和要点,却不知道 页面节奏如何变化、图表该怎样落位、失败后应检查哪里。论文把这类可重复调用的流程性知识称为 Skill:它包含任务分解、工具或 API 模式、中间状态检查和故障恢复。
现有技能库通常来自专家手写、Agent 自己的交互轨迹,或纯文本与代码资源。问题在于,很多商业软件的隐性知识最自然地存在于 教程视频:点击顺序、前后视觉变化、节奏、空间布局和参数调整,都比一段说明文字更完整。只把视频压成摘要,恰恰会丢掉视频最有价值的时序与感知信号。
— 图 1|从多模态资源到 Skill Wiki,以及七类软件创作域的代表性结果。
把“看教程”改造成“调用技能”
Resource2Skill 不让 Agent 在任务时反复观看原始视频,也不把整个代码仓库硬塞进上下文。它先离线抽取程序性信号,再统一写入技能条目;当任务出现时,只暴露少量候选技能。这个设计同时解决 原始资源太长 和 文本摘要太薄 两个问题。
「资料告诉 Agent“是什么”,Skill 进一步告诉它“怎么做、何时用、如何验证”。」
02
METHOD
一条流水线,把多模态资源蒸馏成 Skill Wiki
— 图 2|Resource2Skill 的构建、组织、选择、执行与评测全流程。
第一步:按模态抽取真正可执行的证据
输入来自四类资源:教程视频、代码仓库、文章、参考成品。系统对视频采样关键帧,对仓库定位代码区域与参数签名,对文章切分段落,对成品做图像预处理,再由视觉语言模型生成结构化技能候选。每个候选技能被组织为路径 p、文本视图、视觉视图、代码视图和元数据 m。
第二步:五道确定性质量门
•完整性
必填字段、最小正文长度和至少一种内容模态必须存在。
•可追溯性
来源路径或视频链接必须能在连接器清单中解析,方便审计与回查。
•去重
根据域、来源路径和抽取节点生成稳定技能 ID,并辅以同源规范化名称检查。
•模态一致性
元数据声称存在的文本、视觉或代码文件,都必须在磁盘上真实存在。
•结构可执行性
带代码的技能要在沙箱中导入、运行并产出非空结果;未通过者只能作为参考技能。
这里有一个容易被忽略的细节:质量门不是另一个 LM-as-a-Judge,而是 规则化、可复现的确定性检查。模型负责蒸馏,规则负责结构与执行层面的验收。这让 Skill Wiki 更像可维护的软件资产,而不是一堆未经验证的提示词。
03
RETRIEVAL
MetaBrowse:先走技能树,再让模型挑组合
层级结构不是目录装饰,而是检索先验
不同软件域使用不同分类树:PPT 按布局、字体、配色和动效组织,Blender 按几何、材质、灯光和构图组织。给定任务 q,MetaBrowse 先用 BM25 在技能名称、标签、适用性说明和 分类路径 p(s) 上取 K=20 个候选,再让语言模型选出最多 n=5 个技能进行组合。
第二阶段做的是 子集选择,不是简单排序。模型可以组合互补技能,也可以在候选都不合适时选择零个,退回自由代码路径。这样,系统把“语义相似”与“任务适配”拆开:前者缩小搜索区,后者判断技能是否真的能一起完成当前任务。
执行层只保留一个统一接口
Wiki 侧提供分类浏览、技能卡片、按模态读取与搜索;软件侧则提供统一 apply 动作和域能力清单。带代码技能可直接对真实 MCP 后端执行,中间不再让语言模型把代码“翻译一次”。仅作参考的技能仍能提供文字和视觉依据,由 Agent 自行改写实现。
论文还把上下文账算得很清楚:五个核心域中,单技能平均约 4,332 tokens;候选筛选消耗约 4K–10K,五个完整技能约 22K,总技能上下文约 26K–32K tokens。由于 K 和 n 固定,技能库继续扩容并不会线性撑大推理上下文。
04
RESULTS
主结果:技能带来的提升,不只是 Harness 红利
— 表 1|四种模型后端、七个创作域上的主结果。Overall 为五个域内维度的等权平均。
主比较覆盖 7 个软件创作域 × 4 个模型后端,每个域使用匹配的 N=80 任务。跨 28 个模型—领域单元,w Skills 全部胜过同模型的 w/o Skills:平均总分从 45.0% 升至 56.8%,提升 11.9 个百分点。
更关键的是,作者没有只拿“裸 Agent”作对照,还加入 ClaudeCode-H 与 Codex-H 两个现成 Agent Harness。Resource2Skill 在 28 个主聚合单元中有 26 个超过更强的 Harness 基线;仅 GPT-5.5 的 Web 和 GPT-5.4 Nano 的 PPT 两格落后,而且差距都不到 1 个百分点。主要增益来自被检索和组合的 Skill Wiki,而不是执行外壳本身。
不同域的收益并不均匀
以 GPT-5.4 为例,平均分从 51.9% 升至 66.9%,提升 15.0 个百分点。其中 UE5 从 29.1% 升至 67.3%,增加 38.2 个百分点;Excel 增加 17.8,Blender 增加 14.6,Web 增加 13.7。Reaper 只增加 4.1,说明模型本身对音频制作已有较强先验,技能的边际空间更小。
论文报告的配对单元中,w Skills 相对 w/o Skills 的差异均达到 Wilcoxon p<10⁻³。人类盲评包含 200 个独立评分;排除平局后,w Skills 的胜率为 85.5%。这两组证据共同说明提升不是由少量漂亮案例撑起来的。
05
ABLATION
为什么有效:规模、模态、来源和选技缺一不可
— 图 3|技能池规模曲线,以及无技能、纯文本扁平库与完整 Wiki 的对比。
技能数量从 0 增至 200 时,五个核心域获得最大一段收益;此后曲线趋于饱和,400 到完整技能池每个域最多只再增加 0.8 个百分点。这表明前 200 个技能覆盖了常见操作和恢复路径,后续条目主要补齐长尾。与此同时,完整 Wiki 比扁平纯文本库高 2.5–8.2 个百分点,说明层级导航、视觉预览和可执行代码不是包装层。
— 表 2|资源来源消融:视频是不可替代的基础,来源多样性负责补齐覆盖。
去掉视频后,只保留代码、文章与成品,平均分从 68.9% 降到 59.4%;反过来,仅视频 的 66.8% 仍高于无视频三来源组合 7.4 个百分点。Excel 的视频移除损失为 14.2 个百分点,Web 为 11.5,恰好都是高度依赖操作顺序与视觉反馈的域。
— 表 3|固定技能 ID 与检索预算后,只改变 Agent 能看到的模态。
只给精心整理的文本技能,平均分已经有 65.0%;加入视觉到 66.9%,加入代码到 67.0%,三种视图全开达到 68.9%。视觉和代码的单独增益接近,但两者互补。多模态并不是替代好文本,而是在好文本之上补足“长什么样”和“怎样运行”。
— 表 4|固定库、Agent、评测器与候选预算后的选择策略消融。
层级后接 LM 的 MetaBrowse 以 68.9% 排名第一,超过 BM25 的 66.0%、BM25+Embed 的 64.2% 和纯向量检索的 60.0%。随机从全库抽技能只有 58.0%,几乎贴近无技能的 57.3%。结论很直接:技能质量重要,选对技能同样重要;不合适的技能会增加参数绑定和组合冲突成本。
06
ONLINE
在线学习不是常驻加速器,而是能力缺口的补丁
— 表 5|固定 891 个离线技能,最多在线增加 100 个技能时的结果。
当离线库已经覆盖常见请求时,加入最多 100 个在线技能,标准任务集只从 65.4% 升到 66.1%,即 0.7 个百分点。这个变化很小,说明频繁联网蒸馏不是默认情况下的免费增益。
但在专门挑选离线库缺口的 Tnovel 上,在线技能把 41.2% 提升到 62.8%,增加 21.6 个百分点。在线条目使用与离线相同的构建和验收流程,并单独存放,不回灌默认库。合理的定位不是“每次都搜索”,而是先发现能力缺口,再定向补齐。
一套更稳妥的部署策略
•离线库覆盖高频能力
把常见操作、风格模板和恢复路径预先蒸馏并版本化。
•运行时先做层级选择
限制候选和完整技能数量,控制上下文与组合复杂度。
•检测缺口后再在线扩展
让新技能进入隔离池,通过同一组质量门后再参与当前任务。
•执行后必须渲染检查
无论技能是否通过结构测试,最终成品仍要经过域内渲染与质量验证。
07
CASES
成功与失败都说明:Skill 的最后一公里是参数落地
— 图 4|Web 成功案例:技能侧形成完整长页、稳定排版和丰富内容结构。
在农场餐厅落地页案例中,技能侧把字体、卡片、信息密度和长页节奏组织成统一系统;无技能侧则停留在占位感很强的六段骨架。这里的优势不是多写几行 CSS,而是多个技能共同提供了 内容结构、版式模式和视觉约束。
— 图 5|Web 失败案例:技能侧更保守、更稀疏,无技能侧反而完成度更高。
但在复古未来主义桌游页中,技能侧过度贴住单一模式,页面稀疏;无技能侧反而有更完整的章节覆盖。论文的十个边界案例反复出现两类问题:一是 partial grounding,技能表面模式被复用,但公式、背景、曝光或相机等绑定没有真正落地;二是 conservative composition,Agent 因锚定某个技能而失去必要变化。
— 图 6|Blender 成功案例:技能侧建立了主体、材质与多光源层次。
— 图 7|Blender 失败案例:复杂技能组合未正确绑定背景、曝光和相机参数。
Blender 的一正一反更直观:首饰案例中,技能侧确实用上了 PBR 材质和蓝/琥珀色轮廓光;香水瓶案例却被过曝与构图错误吞没。Excel 案例还出现可见的 #NAME? 公式错误,PPT 案例出现未处理的占位文本。一个技能只有在参数被正确绑定、冲突被正确裁决时,才会真正成为能力。
08
EVALUATION
如何读这些数字:评测设计、边界与未来方向
这套实验证据强在哪里
主比较在每个域使用匹配的 N=80 任务,消融使用固定 N=40 子集;同一比较中的任务 ID、Agent、评测器和随机设置保持一致。未产出、不可打开、过小或静音的成品按 0 分计入均值,不会被静默剔除。非音频成品由 GPT-5.4 视觉评测器按五个域内维度打分,Reaper 由音频模型评测。
自动评测并非完美:17 个任务—成品样本上,评测器与人类中位数的总体 Spearman ρ=0.71、ICC=0.66;评测器重复运行相关性 ρ=0.83。论文又加入五人盲评,方向上支持主结果。更合理的读法是:证据链相互印证,但不等于每个小差异都具有同等确定性。
还要区分 论文评测范围 与 当前公开资源范围:论文主结果覆盖 Web、Excel、Reaper、PPT、Blender、CAD、UE5 七域;当前官方项目页把可发布域标为五个,即 Web、PPT、Excel、Blender 和 Reaper,并说明 CAD、UE5 属于论文评测抽象。若要复现完整七域结果,需要额外确认对应后端与资源是否已开放。
未来方向
•加强参数绑定
在执行前后追踪技能变量是否映射到真实对象、单元格、材质、相机和工具状态。
•处理技能冲突
当前一次运行只按序应用最多五个技能,没有多轮重规划或冲突仲裁;未来可把冲突检测放进控制回路。
•补充同预算原始资源基线
现有检索基线在蒸馏后的技能库上运行,尚未与等 token 预算的原始视频转录、仓库片段和文章检索正面对比。
•扩展到弱工具化领域
论文不主张方法已泛化到缺少可编程接口或公开程序性内容的领域,这决定了当前系统的适用边界。
对 Agent 工程的真正启示
Resource2Skill 的价值,不只是“从视频生成技能”的单点能力,而是一套知识工程闭环:资源采集 → 多模态蒸馏 → 确定性验收 → 层级检索 → 组合执行 → 成品验证。它把人类经验从临时上下文中抽出来,变成有路径、有版本、有来源、有执行接口的资产。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
