AutoSynthData: エンタープライズエージェント向けトレーニングデータ生成
ServiceNow CoreAIは、モデルの一般的な能力とエンタープライズ環境の特定要件とのギャップを埋めるために設計されたシステム、AutoSynthDataを開発しました。ターゲットモデルの失敗と、より強力な教師モデルの成功を活用することで、AutoSynthDataはステートフルなエンタープライズ環境におけるエージェントのパフォーマンスを向上させるための合成トレーニングタスクを自動的に生成し、検証します。
有用なエージェンティックタスクのためのフレームワーク
効果的なトレーニングデータを生成するために、AutoSynthDataはタスクをシステム仕様、ユーザープロンプト、検証器からなる三つ組として定義します。各コンポーネントは、トレーニングシグナルが高品質であることを保証するために特定の基準を満たす必要があります:
- システム仕様: 制約、指示、環境ポリシーを定義します。環境のツールと状態と互換性がある必要があります。
- ユーザープロンプト: 目標と制約を指定します。トレーニングに有用であるためには、プロンプトは実行可能(環境で解決可能)、現実的(実際のユーザーリクエストに類似)、困難(エージェントの現在の弱点を露呈する)である必要があります。
- 検証器: 成功を決定します。有効な検証器は、プロンプトと仕様と一貫性があり、健全(失敗を拒否)で、完全(すべての有効なソリューションを受け入れる)である必要があります。
AutoSynthDataパイプラインの概要
AutoSynthDataは、能力ギャップを特定し、ターゲットを絞った合成データで埋めるクローズドループシステムとして動作します。プロセスは以下の主要な段階に従います:
- ギャップ特定: ターゲットモデルは診断タスクを使用して評価されます。失敗のパターンは、より強力な教師モデルの成功した軌跡とともに分析されます。
- 能力仕様: 調査結果は、元のプロンプトや軌跡を提供せずに、必要なワークフロー、ツール、成功基準を説明する「能力仕様カード」に凝縮されます。
- タスク生成: ジェネレーターはこれらのカードを使用して、新しく多様なタスクを作成します。これは2つのフェーズで発生します:
- ターゲットフェーズ: 能力仕様に基づいて、精選された例のコアセットを作成します。
- 増殖フェーズ: 受け入れられたターゲットサンプルの新しいバリエーションを作成してデータセットを拡張し、ドリフトを制限しながらスケールを増やします。
- 検証と修復: すべての候補タスクは、ソルバー評価、ポジティブ検証(ソリューションが機能することを確認)、ネガティブ検証(検証器が誤った結果を拒否することを確認)を含む厳格な品質管理ループを受けます。
- 批評と修復: 失敗した候補は、すぐに破棄されるのではなく、診断とターゲットを絞った修復のために批評家に送られます。
データセットの品質とバッチ管理
高品質な合成データには、冗長性を回避しカバレッジを確保するために、サンプルレベルとバッチレベルの両方の検証が必要です。
サンプルレベルの検証
候補は難易度に基づいて優先順位付けされます:システムは、ターゲットモデルが3回の試行のうち最大1回で解決するが、より強力なソルバーが3回のうち少なくとも2回で解決するタスクを優先します。
バッチレベルのレビュー
メタレビュープロセスは、受け入れられたサンプルと拒否されたサンプルを調べて、過剰に表現されたタスクファミリーや欠落している能力次元を特定します。その後、コントローラーは生成戦略を調整して、生成予算内で多様性のバランスを取り、冗長性を減らします。
EnterpriseOps Gymでの実験結果
ServiceNowは、EnterpriseOps Gymベンチマークを使用して、2つの異なるドメインにわたってAutoSynthDataをテストし、ターゲットモデルとしてGemma-4-26B-A4B-itを使用しました。
ハイブリッドドメイン
教師としてQwen3.8-27Bを使用して、AutoSynthDataは18時間で2,000の合成サンプルを生成しました。このデータでGemmaをファインチューニングした結果、平均Pass@1が7.2パーセントポイント増加(相対改善35%)し、検証器の成功率が63.01%から68.55%に向上しました。これにより、ターゲットモデルと参照モデル間の元のPass@1ギャップの59%が埋められました。
ITSMドメイン
教師としてDeepSeek-V4.1-Flashを使用して、システムは66時間で1,994の合成サンプルを生成しました。その結果、平均Pass@1が**18.77%から27.18%**に増加しました。
トレーニングフロンティアの前進
AutoSynthDataは、合成データ生成をターゲットモデルの能力境界でのタスクの検索として扱います。モデルが改善するにつれて有用なトレーニング分布が変化するため、パイプラインは反復的に設計されています。ポストトレーニング後、モデルは再評価され、残りの失敗が次の生成ラウンドを導きます。これらの実験は教師ありファインチューニング(SFT)に焦点を当てていましたが、ServiceNowは、このメカニズムが現在のポリシーに挑戦するタスクを生成することで強化学習(RL)を同様にサポートできると述べています。