SkillOpt
不改模型权重,把 skill 文档当可训练状态,用 rollout-反思-编辑-验证门控循环自动优化
微软 Research 出品的文本空间优化器:把 agent 的 `best_skill.md` 当作可训练状态,冻结目标模型不动,用另一个 optimizer 模型分析 rollout 轨迹、提出有界的增/删/改编辑,只有通过 held-out 验证门控的候选编辑才会被接受。训练循环镜像深度学习范式——rollout 对应前向传播、反思对应反向传播、文本学习率控制每步编辑量、慢更新和 meta skill 提供跨 epoch 记忆。部署产物是一份紧凑的 skill 文档(通常 300–2,000 token),对推理零额外开销。支持 OpenAI、Azure、Anthropic Claude、Qwen、MiniMax 等后端,以及 Codex CLI 和 Claude Code CLI 两种 agentic harness。内置 SearchQA、DocVQA、ALFWorld、LiveMath、SpreadsheetBench、OfficeQA 六种 benchmark。另含 SkillOpt-Sleep 预览版,可将训练循环用于本地 coding agent 的夜间自我进化。
社区实测
将 skill 文档作为可训练参数、用深度学习式优化循环自动改进的思路,在 52/52 基准上得到验证,且被 Hermes Agent 团队独立复现了相同结论。
- 将 agent skill 文档作为可训练参数进行自动迭代优化,替代手工调试
- 在不修改模型权重的前提下提升 agent 表现,零推理开销
- 优化后的 skill 文档可在不同模型规模和执行环境中迁移复用
- 优化过程依赖单独的优化模型分析执行轨迹,增加了系统复杂度
- 编辑仅在验证集性能明确提升时才被接受,优化策略偏保守
SkillOpt: A Text-Space Optimizer for Self-Evolving Agent SkillsMicrosoft's open-source SkillOpt automatically upgrades AI agent skills without touching model weightsMicrosoft SkillOpt: 52 Out of 52 Wins with the Skill Optimizer That Trains the Document, Not the ModelMicrosoft just open-sourced SkillOpt! A framework for training agent ...
截至 2026-06-18
pip install skillopt git clone https://github.com/microsoft/SkillOpt.git && cd SkillOpt && pip install -e .