SkillOpt: ディープラーニング最適化原理を使用してスキルドキュメントを最適化する自己進化型エージェントスキルのためのエグゼクティブ戦略

SkillOpt: ディープラーニング最適化原理を使用してスキルドキュメントを最適化する自己進化型エージェントスキルのためのエグゼクティブ戦略

何を解決するか

SkillOptは、エージェントスキルを改善する体系的かつ再現可能な方法の欠如に対処します。現在、ほとんどのエージェントスキルは手作業で作成されたり、一度のパスで生成されたりしており、フィードバックに基づいて時間とともに信頼性を持って改善することはしばしば失敗します。SkillOptは、スキルドキュメント自体をトレーニング可能な状態として扱い、基礎となるモデルの重みを変更することなくエージェントが能力を進化させることを可能にします。

どのように機能するか

SkillOptは、テキスト形式のスキルドキュメントにディープラーニング最適化原理を適用します。スコア付きロールアウトを分析し、スキルドキュメントに境界編集(テキストの追加、削除、または置換)を行う別のオプティマイザーモデルを使用します。安定性と進歩を確保するため、検証ゲートを採用し、ホールドアウト検証スコアを厳密に改善する場合のみ候補編集を受け入れます。このプロセスには、テキスト学習率予算、却下編集バッファ、およびエポックごとの更新が含まれます。最終出力は、凍結されたターゲットモデルとともに推論中に使用されるコンパクトな best_skill.md ファイルであり、デプロイ時に追加のレイテンシーやモデル呼び出しを発生させません。

対象者

これは、Claude Code、Codex、またはCopilotなどを使用するAIエージェントの開発者を対象としており、高コストなモデルファインチューニングを行わずに、特定のベンチマークやタスク全体でエージェントのパフォーマンスを体系的に最適化したいと考えている方に適しています。

ハイライト

  • ウェイトフリー最適化: モデルの重みではなくスキルドキュメントを最適化することで、エージェントのパフォーマンスを向上します。
  • 厳格なトレーニングループ: ロールアウト、反省、集約、選択、更新、評価の完全なサイクルを実装します。
  • SkillOpt-Sleep: 過去のセッションを収集、採掘、再生して検証済みスキルを統合する夜間のオフラインエンジンです。
  • 広範な互換性: OpenAI、Azure、Claude、Qwen、MiniMaxなどの複数のバックエンドをサポートし、さまざまな実行ハーネスと統合します。
  • ゼロ推論オーバーヘッド: 最適化されたスキルは静的なテキストファイルであるため、デプロイ時に追加の計算は必要ありません。

Sources