AutoSynthData:為企業代理生成訓練資料

ServiceNow CoreAI 發展了 AutoSynthData,一個旨在彌補模型通用能力與企業環境特定需求之間差距的系統。透過利用目標模型的失敗與更強大教師模型的成功,AutoSynthData 自動生成並驗證合成訓練任務,以提升代理在有狀態企業環境中的表現。

有用的代理任務框架

為了生成有效的訓練資料,AutoSynthData 將任務定義為包含系統規格、使用者提示和驗證器的三元組。每個元件都必須符合特定標準,以確保訓練信號品質高:

  • 系統規格: 定義限制、指示和環境政策。必須與環境的工具和狀態相容。
  • 使用者提示: 指定目標和限制。為訓練有用,提示必須是 可行的(可在環境中解決)、現實的(類似實際使用者請求),以及 困難的(暴露代理當前的弱點)。
  • 驗證器: 判定成功。有效的驗證器必須與提示和規格 一致、健全(拒絕失敗),以及 完整(接受所有有效解)。

AutoSynthData 管道概覽

AutoSynthData 作為一個封閉迴路系統運作,識別能力缺口並以針對性的合成資料填補。該過程遵循以下主要階段:

  1. 缺口識別: 使用診斷任務評估目標模型。分析失敗模式,並與更強大教師模型的成功軌跡進行對比。
  2. 能力規格化: 將發現結果濃縮為「能力規格卡」,描述所需的流程、工具和成功標準,但不提供原始提示或軌跡。
  3. 任務生成: 生成器使用這些卡片創建新且多樣化的任務。此過程分為兩個階段:
    • 目標階段: 基於能力規格創建一組經過審核的核心範例。
    • 擴增階段: 透過創建已接受目標樣本的新變體來擴展資料集,以增加規模同時限制偏移。
  4. 驗證與修復: 每個候選任務都會經過嚴格的品質控制迴路,包括求解器評估、正向驗證(確認解決方案有效)和負向驗證(確認驗證器拒絕錯誤結果)。
  5. 批判與修復: 失敗的候選任務會送至批判者進行診斷與針對性修復,而非立即丟棄。

資料集品質與批次管理

高品質的合成資料需要在樣本層級和批次層級都進行驗證,以避免重複並確保覆蓋範圍。

樣本層級驗證

候選任務根據難度優先排序:系統偏好目標模型在三輪試驗中最多只解決一輪,但更強大的求解器至少解決兩輪的任務。

批次層級審查

一個元審查流程會檢視已接受與被拒絕的樣本,以識別過度代表的任務家族或遺漏的能力維度。控制器隨後調整生成策略,以在生成預算內平衡多樣性並減少重複。

企業運維實驗室中的實驗結果

ServiceNow 使用 EnterpriseOps Gym 基準,在兩個不同領域中測試了 AutoSynthData,目標模型為 Gemma-4-26B-A4B-it。

混合領域

使用 Qwen3.8-27B 作為教師模型,AutoSynthData 在 18 小時內生成了 2,000 個合成樣本。在該資料上微調 Gemma 後,平均 Pass@1 提升了 7.2 個百分點(相對提升 35%),驗證器成功率從 63.01% 提升至 68.55%。這彌補了原始 Pass@1 差距的 59%。

ITSM 領域

使用 DeepSeek-V4.1-Flash 作為教師模型,系統在 66 小時內生成了 1,994 個合成樣本。這導致平均 Pass@1 從 18.77% 提升至 27.18%。

推動訓練邊界

AutoSynthData 將合成資料生成視為在目標模型能力邊界上搜尋任務。由於有用的訓練分佈會隨著模型改進而改變,因此該管道設計為迭代式。在後訓練階段,模型會重新評估,剩餘的失敗將引導下一輪生成。雖然這些實驗專注於監督微調(SFT),但 ServiceNow 指出,此機制同樣可支援強化學習(RL),透過生成挑戰當前策略的任務來實現。

Sources