AutoSynthData: 엔터프라이즈 에이전트를 위한 학습 데이터 생성

ServiceNow CoreAI는 모델의 일반적인 능력과 엔터프라이즈 환경의 특정 요구 사이의 격차를 해소하기 위해 설계된 시스템인 AutoSynthData를 개발했습니다. 대상 모델의 실패와 더 강력한 교사 모델의 성공을 활용하여, AutoSynthData는 상태 저장 엔터프라이즈 환경에서 에이전트 성능을 개선하기 위해 합성 학습 작업을 자동으로 생성하고 검증합니다.

유용한 에이전트 작업을 위한 프레임워크

효과적인 학습 데이터를 생성하기 위해, AutoSynthData는 작업을 시스템 사양, 사용자 프롬프트, 검증기로 구성된 삼중항으로 정의합니다. 각 구성 요소는 학습 신호의 높은 품질을 보장하기 위해 특정 기준을 충족해야 합니다:

  • 시스템 사양: 제약 조건, 지침 및 환경 정책을 정의합니다. 환경의 도구 및 상태와 호환되어야 합니다.
  • 사용자 프롬프트: 목표와 제약 조건을 지정합니다. 학습에 유용하려면 프롬프트는 실현 가능해야 하며(환경에서 해결 가능), 현실적이어야 하고(실제 사용자 요청과 유사), 어려워야 합니다(에이전트의 현재 약점을 노출).
  • 검증기: 성공 여부를 결정합니다. 유효한 검증기는 프롬프트 및 사양과 일관되어야 하며, 건전해야 하고(실패를 거부), 완전해야 합니다(모든 유효한 솔루션을 수용).

AutoSynthData 파이프라인 개요

AutoSynthData는 능력 격차를 식별하고 목표된 합성 데이터로 이를 채우는 폐쇄 루프 시스템으로 작동합니다. 프로세스는 다음 주요 단계를 따릅니다:

  1. 격차 식별: 대상 모델은 진단 작업을 사용하여 평가됩니다. 실패 패턴은 더 강력한 교사 모델의 성공적인 궤적과 함께 분석됩니다.
  2. 능력 사양: 발견 사항은 원래 프롬프트나 궤적을 제공하지 않고 필요한 워크플로, 도구 및 성공 기준을 설명하는 "능력 사양 카드"로 요약됩니다.
  3. 작업 생성: 생성기는 이러한 카드를 사용하여 새롭고 다양한 작업을 만듭니다. 이는 두 단계로 발생합니다:
    • 대상 단계: 능력 사양을 기반으로 검증된 예제의 핵심 세트를 만듭니다.
    • 증식 단계: 허용된 대상 샘플의 새로운 변형을 만들어 데이터 세트를 확장하여 드리프트를 제한하면서 규모를 늘립니다.
  4. 검증 및 수리: 모든 후보 작업은 솔버 평가, 긍정적 검증(솔루션이 작동하는지 확인), 부정적 검증(검증기가 잘못된 결과를 거부하는지 확인)을 포함한 엄격한 품질 관리 루프를 거칩니다.
  5. 비평 및 수리: 실패한 후보는 즉시 폐기되지 않고 진단 및 목표된 수리를 위해 비평가에게 보내집니다.

데이터 세트 품질 및 배치 관리

고품질 합성 데이터는 중복을 피하고 적용 범위를 보장하기 위해 샘플 수준 및 배치 수준 검증이 모두 필요합니다.

샘플 수준 검증

후보는 난이도에 따라 우선 순위가 지정됩니다: 시스템은 대상 모델이 세 번의 시도 중 최대 한 번만 해결하지만 더 강력한 솔버가 세 번 중 두 번 이상 해결하는 작업을 선호합니다.

배치 수준 검토

메타 검토 프로세스는 허용 및 거부된 샘플을 검사하여 과대 표현된 작업 패밀리 또는 누락된 능력 차원을 식별합니다. 그런 다음 컨트롤러는 생성 전략을 조정하여 생성 예산 내에서 다양성의 균형을 맞추고 중복을 줄입니다.

EnterpriseOps Gym의 실험 결과

ServiceNow는 두 가지 다른 도메인에서 EnterpriseOps Gym 벤치마크를 사용하여 AutoSynthData를 테스트했으며, 대상 모델로 Gemma-4-26B-A4B-it을 사용했습니다.

하이브리드 도메인

교사로 Qwen3.8-27B를 사용하여 AutoSynthData는 18시간 만에 2,000개의 합성 샘플을 생성했습니다. 이 데이터로 Gemma를 미세 조정한 결과 평균 Pass@1이 7.2퍼센트 포인트 증가(상대적 개선 35%)했고 검증기 성공률이 63.01%에서 68.55%로 증가했습니다. 이는 대상 모델과 참조 모델 간의 원래 Pass@1 격차의 59%를 줄였습니다.

ITSM 도메인

교사로 DeepSeek-V4.1-Flash를 사용하여 시스템은 66시간 만에 1,994개의 합성 샘플을 생성했습니다. 그 결과 평균 Pass@1이 18.77%에서 27.18%로 증가했습니다.

훈련 경계 이동

AutoSynthData는 합성 데이터 생성을 대상 모델의 능력 경계에서 작업을 검색하는 것으로 취급합니다. 유용한 훈련 분포는 모델이 개선됨에 따라 이동하므로 파이프라인은 반복적으로 설계되었습니다. 사후 훈련 후 모델은 재평가되고 남은 실패는 다음 생성 라운드를 안내합니다. 이러한 실험은 지도 미세 조정(SFT)에 초점을 맞추었지만, ServiceNow는 이 메커니즘이 현재 정책에 도전하는 작업을 생성하여 강화 학습(RL)을 유사하게 지원할 수 있다고 언급합니다.

Sources