microsoft/SkillOpt

SkillOpt is a text-space optimizer that trains reusable natural-language skills for frozen LLM agents through trajectory-driven edits, validation-gated updates, and deployable best_skill.md artifacts.

解決的問題

SkillOpt 解決了代理技能不一致且依賴手工製作的問題。大多數 AI 代理的技能要麼是手動編寫的,要麼是由 LLM 一次性生成的,這往往無法根據回饋在時間推移中實現可靠的改進。SkillOpt 提供了一種系統化、可復現的方法來優化這些技能,而無需修改底層模型的權重。

工作原理

SkillOpt 將技能文件(一個 Markdown 檔案)視為凍結 LLM 的「可訓練狀態」。它使用一個獨立的優化器模型,透過訓練迴圈(rollout、reflection、aggregation、selection 和 update)來迭代改進該文件。

核心機制包括:

  • Validation Gates:只有當候選編輯能嚴格提高預留驗證分數時,才會接受對技能文件的編輯。
  • Optimization Parameters:將 epoch、batch size 和 learning rate 等深度學習概念應用於文本編輯。
  • SkillOpt-Sleep:一個離線引擎,在「睡眠」期間收集過去的對話、重放任務並整合經過驗證的技能。
  • Zero Overhead:由於最終輸出只是一個精簡的 Markdown 檔案 (best_skill.md),因此在實際部署期間不需要額外的模型呼叫。

適用對象

專為構建 AI 代理(例如使用 Claude Code、Codex 或 Copilot 的開發者)而設計,這些開發者希望在不同的基準測試和測試框架中自動升級其代理的能力與性能。

亮點

  • Model Agnostic:支援包括 OpenAI、Azure、Claude、Qwen 和 MiniMax 在內的各種後端。
  • High Performance:在多個基準測試中證明了在 GPT-5.5 上具有顯著的準確度提升(高達 +24.8 分)。
  • Transferable:優化後的技能可以在不同的模型規模和執行框架之間遷移。
  • Offline Evolution:包含用於本地編碼代理的夜間自我進化引擎。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案