工具 / SkillOpt

SkillOpt

  • agent
  • skill
  • framework

不改模型权重,把 skill 文档当可训练状态,用 rollout-反思-编辑-验证门控循环自动优化

微软 Research 出品的文本空间优化器:把 agent 的 `best_skill.md` 当作可训练状态,冻结目标模型不动,用另一个 optimizer 模型分析 rollout 轨迹、提出有界的增/删/改编辑,只有通过 held-out 验证门控的候选编辑才会被接受。训练循环镜像深度学习范式——rollout 对应前向传播、反思对应反向传播、文本学习率控制每步编辑量、慢更新和 meta skill 提供跨 epoch 记忆。部署产物是一份紧凑的 skill 文档(通常 300–2,000 token),对推理零额外开销。支持 OpenAI、Azure、Anthropic Claude、Qwen、MiniMax 等后端,以及 Codex CLI 和 Claude Code CLI 两种 agentic harness。内置 SearchQA、DocVQA、ALFWorld、LiveMath、SpreadsheetBench、OfficeQA 六种 benchmark。另含 SkillOpt-Sleep 预览版,可将训练循环用于本地 coding agent 的夜间自我进化。

社区实测

将 skill 文档作为可训练参数、用深度学习式优化循环自动改进的思路,在 52/52 基准上得到验证,且被 Hermes Agent 团队独立复现了相同结论。

  • 将 agent skill 文档作为可训练参数进行自动迭代优化,替代手工调试
  • 在不修改模型权重的前提下提升 agent 表现,零推理开销
  • 优化后的 skill 文档可在不同模型规模和执行环境中迁移复用
  • 优化过程依赖单独的优化模型分析执行轨迹,增加了系统复杂度
  • 编辑仅在验证集性能明确提升时才被接受,优化策略偏保守

截至 2026-06-18

pip install skillopt

← 返回工具列表