
让 Agent 做一个网页、调一张表格,或许已经不算稀奇。但如果任务变成“在 Blender 里搭出有质感的场景”“在 UE5 里完成可用的镜头”“在 Reaper 里做一段像样的混音”,问题立刻变了。
这些任务的难点,不只是模型知不知道按钮在哪,而是它是否掌握了一整套做事的章法:先做什么,看到什么结果再继续,参数不对时如何回退,以及最终作品怎样才算过关。
论文名称: Resource2Skill: Distilling Executable Skills from Human-Created Resources for Software Agents 论文链接: https://arxiv.org/pdf/2606.29538v4

微软研究院等机构的一篇新论文 Resource2Skill,试图把这类藏在人类教程里的经验,变成软件 Agent 可以直接调用的技能。
Agent 真正缺少的,往往不是更多事实,而是可以反复执行的“程序性记忆”。

今天的大多数技能库,主要来自三条路:专家手写、Agent 自己跑任务留下轨迹,或从文本与代码中挖掘。它们都有效,却漏掉了一个巨大的知识源——人类制作的多模态教程。
学习复杂软件时,人往往不会只读手册。我们会看视频里操作的先后顺序,观察一次拖动怎样改变画面,比较调整前后的光影、排版或波形。这些信息很难完整写成文字。
但把整段视频直接塞进上下文也不现实。原始资源太长、重复太多,真正有用的步骤只分布在少数关键帧里;若只压成文字摘要,又会丢掉空间布局、动态效果、操作节奏和视觉标准。
原始多模态资源太重,纯文字摘要又太薄。Resource2Skill 解决的正是两者之间的表示鸿沟。


论文把系统拆成四个阶段:构建、组织、选择、执行。

首先,系统从四类人类资源中提取技能:教程视频提供操作顺序与视觉变化,代码仓库提供可执行的工具模式,文章补充原理与适用条件,参考作品则告诉 Agent 成品应该长什么样。
每条技能都不是一段孤立提示词,而是一个多模态条目。它包含分类路径、结构化文字、视觉示例、可执行或可改写的代码,以及来源和验证状态等元数据。换句话说,一条技能同时回答“什么时候用、怎么做、做成什么样、证据从哪里来”。

生成候选技能后,系统还要经过五道确定性检查:完整性、来源可追溯、去重、模态一致性,以及代码的结构可执行性。这里有个值得注意的细节:代码跑不通的条目不会被伪装成已验证技能,而会保留为参考型知识,并在默认的“仅已验证”模式下被过滤。

技能随后进入按领域组织的层级 Wiki。PPT 可以按版式、字体、动效分类,Blender 可以按几何、材质、灯光、构图分类。树状结构本身就是检索信号,它让 Agent 不必在一堆扁平文本里盲找。
收到用户任务后,MetaBrowse 先用 BM25 在技能名称、标签、适用条件和分类路径上筛出候选区域,再让语言模型阅读候选条目的文字、视觉与代码证据,选出一个可以组合的小集合。
论文实现中,第一阶段固定取 K=20 个候选,语言模型再挑选 n=5 条完整技能。这样一来,技能库继续增长,也不会把整座 Wiki 塞进上下文;每次任务的技能相关上下文约为 2.6 万至 3.2 万 token。

被选中的代码可以通过 MCP 直接作用于软件后端,中间不再让模型重新翻译一遍。整个过程形成“计划—浏览—应用—渲染”的闭环:Agent 不只执行,还要查看产物,再决定是否继续。
如果离线库确实没有覆盖某项能力,同一个资源蒸馏器会在线搜索教程和代码,临时构建新技能。作者特别强调,在线获取是补缺口,不是每次任务都启动的性能加速器。
研究覆盖网页、Excel、PPT、Blender、CAD、UE5 和 Reaper 七个创作领域,并在 GPT-5.5、GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano 四种后端上比较。

主实验每个领域使用 80 个匹配任务。综合 28 个“模型×领域”单元,启用技能的 Agent 平均总分为 56.8%,无技能版本为 45.0%,提升 11.9 个百分点;面对两种现成 Agent 执行框架,它在 28 个单元中的 26 个领先。

提升最大的地方,恰好是惯例密集、试错昂贵的领域。以较大模型为例,UE5 的增益达到约 30 至 40 个百分点,而 Reaper 的增益较小。这说明技能库并非平均地“给模型加知识”,而是在模型最缺操作套路的地方补上脚手架。

自动评审之外,论文还做了盲测人评。五名评审者对七个领域的 200 次配对结果投票:技能版本获得 136 票,无技能版本 23 票,另有 41 票平局;去掉平局后,技能版本胜率为 85.5%。
消融实验揭示了几个比总分更有价值的结论。
第一,视频是不可替代的来源。完整四类资源的平均分为 68.9%;移除视频后降到 59.4%。甚至只用视频的技能库也达到 66.8%,比“代码+文章+参考作品但没有视频”高 7.4 个百分点。时间顺序和视觉变化,确实不是文字可以轻易补回来的。
第二,多模态不是装饰。只暴露文字时得分为 65.0%;加入视觉后为 66.9%,加入代码后为 67.0%,文字、视觉、代码全部开放时达到 68.9%。视觉告诉 Agent “成品像什么”,代码告诉它“动作如何落地”,两者补的是不同缺口。
第三,检索方式决定技能能否真正被用上。层级筛选再交给语言模型组合的策略得分 68.9%,高于纯 BM25 的 66.0%、向量检索的 60.0% 和随机选择的 58.0%。相关不等于适用,适用也不等于能与其他技能协同。
最后,在线学习的价值高度依赖场景。在常规任务上,增加 100 条在线技能只带来 0.7 个百分点;在专门挑选的能力缺口任务上,分数却从 41.2% 升至 62.8%,提升 21.6 个百分点。先用稳定离线库覆盖高频能力,再按需扩展长尾,是更合理的工程路径。


传统 RAG 往往回答“资料里写了什么”,Resource2Skill 更关心“这段人类经验怎样变成可执行动作”。从这个角度看,它建立的不是知识库,而是一条人类经验的编译流水线:原始教程是源代码,技能条目是中间表示,软件工具是运行时,最终作品才是测试结果。
这也解释了为什么来源、结构、选择和验证缺一不可。只积累文件,技能库会退化成难以维护的提示词仓库;只做向量相似度,Agent 会拿到“看起来相关”却无法组合的片段;只检查代码能运行,也不能保证它真正解决用户任务。
对软件 Agent 来说,能力扩展的下一步,可能不是继续扩大一次调用的上下文,而是建设一套可增长、可验证、能被正确路由的技能供应链。

这项工作也有清晰边界。
其一,多数结果由 GPT-5.4 视觉评审器对渲染作品打分,虽然小规模一致性测试与人类盲测支持总体方向,但自动评分仍不是最终真理。
其二,论文不声称方法能推广到缺少程序化工具接口,或缺少公开教程资源的领域。没有可调用的运行时,再好的技能也难以落地。
其三,在线搜索会增加检索、蒸馏和验证延迟;论文也没有完成“同等 token 预算下,直接检索原始资源”这一对照。因此,我们可以相信技能化表示在当前实验中有效,但还不能断言它在所有成本条件下都优于原始资源 RAG。
Resource2Skill 最有启发性的地方,不是又做了一个更大的技能库,而是把技能的来源、形态、检索、执行和增长放进了同一个系统问题里。
当 Agent 从聊天窗口走进真实软件,决定上限的将越来越少是“它知道多少”,越来越多是它能否调用经过验证的做事方法,并在结果不对时继续修正。
如果你正在关注大模型 Agent、强化学习后训练、RLHF、DPO、GRPO、RLVR 等前沿方向,欢迎学习我最新上线的精品课程:
课程围绕 Agent 架构、强化学习基础、Reward 设计、策略优化、工具调用、多轮任务执行、Agentic Workflow 以及前沿论文与实战案例展开,帮助你建立从理论到应用的完整知识体系。
Agent RL 正在成为大模型能力提升与智能体系统演进中的重要方向。未来的 Agent 不只是会调用工具,而是要能规划任务、评估结果、修正策略,并在复杂环境中持续优化自己的行为。
现在系统学习 Agent RL,提前进入下一阶段 AI 应用开发的核心赛道。
🌟 关注“唐国梁TGLTommy”,一起持续追踪 AI 技术演进背后的长期趋势。