AI技能训练新范式:像调参一样优化Agent技能
把 AI 智能体当员工,把「技能」当训练手册——SkillOpt / SkillGrad 让技能像参数一样被训练
录
- 把 AI 智能体当员工,把「技能」当训练手册——SkillOpt / SkillGrad 让技能像参数一样被训练
- @[TOC]( 录 )
- 一、什么是「技能」(Agent Skill)?
- 关键设计:三级渐进披露(Progressive Disclosure)
- 技能 ≠ 工具(Tool)≠ 提示词(Prompt)
- 二、技能有什么用?为什么必要?
- 三、技能怎么自动优化?——从"手写 prompt"到"训练 skill"的范式跃迁
- ① SkillOpt(Microsoft Research,2026-05)
- ② SkillGrad(Wang et al., 2026-06)
- SkillOpt vs SkillGrad 一图流
- 四、开源包一览
- 五、工作流举例:用 SkillGrad 训练一份 xxxx VOC 技能
- 步骤 0 · 准备数据集
- 步骤 1 · 一次 iteration 的 4 个 LLM 调用
- ▶ Call 1 · **Executor**(前向传播)
- ▶ Call 2 · **Diagnoser**(backward / 文本梯度)
- ▶ Call 3 · **Momentum Agent**(动量累积)
- ▶ Call 4 · **Patcher**(layer-aware 参数更新)
- 步骤 2 · **Validation Gate**(早停 / 拒绝)
- 步骤 3 · Epoch 结束:Slow/Meta 更新
- 步骤 4 · 部署
- 训练一次要几百个 LLM 调用吗?
- 六、优势总结(决策者视角)
- 七、一句话收尾
- 参考链接(可直接点开)
录
- 把 AI 智能体当员工,把「技能」当训练手册——SkillOpt / SkillGrad 让技能像参数一样被训练
- @[TOC]( 录 )
- 一、什么是「技能」(Agent Skill)?
- 关键设计:三级渐进披露(Progressive Disclosure)
- 技能 ≠ 工具(Tool)≠ 提示词(Prompt)
- 二、技能有什么用?为什么必要?
- 三、技能怎么自动优化?——从"手写 prompt"到"训练 skill"的范式跃迁
- ① SkillOpt(Microsoft Research,2026-05)
- ② SkillGrad(Wang et al., 2026-06)
- SkillOpt vs SkillGrad 一图流
- 四、开源包一览
- 五、工作流举例:用 SkillGrad 训练一份 xxxx VOC 技能
- 步骤 0 · 准备数据集
- 步骤 1 · 一次 iteration 的 4 个 LLM 调用
- ▶ Call 1 · **Executor**(前向传播)
- ▶ Call 2 · **Diagnoser**(backward / 文本梯度)
- ▶ Call 3 · **Momentum Agent**(动量累积)
- ▶ Call 4 · **Patcher**(layer-aware 参数更新)
- 步骤 2 · **Validation Gate**(早停 / 拒绝)
- 步骤 3 · Epoch 结束:Slow/Meta 更新
- 步骤 4 · 部署
- 训练一次要几百个 LLM 调用吗?
- 六、优势总结(决策者视角)
- 七、一句话收尾
- 参考链接(可直接点开)
一、什么是「技能」(Agent Skill)?
技能 = 一个装着SKILL.md的文件夹——里面写着"遇到 X 类任务时该怎么办、按什么步骤、用哪几个脚本"。它是 Anthropic 2025-10 首次落地、2025-12 开源,随后 Microsoft/Google 全线采纳的开放规范(agentskills.io)。
一个最小技能长这样:
xxxx_voc_online/ ├── SKILL.md # 唯一必需:YAML 元数据 + 过程知识 ├── scripts/ # 可选:可执行代码 │ ├── download_source.py │ ├── run_report.py │ ├── gen_profiles.py │ └── write_manifest.py ├── profiles/ # 可选:数据/配置 │ ├── xxxx_us_weekly.json │ └── xxxx_us_monthly.json └── requirements.txtSKILL.md头部:
--- name: