SyGra: LLM 및 SLM 데이터 생성을 위한 로우코드 프레임워크

SyGra는 로우코드/노코드 프레임워크로, 대형 언어 모델(LLM)과 소형 언어 모델(SLM)을 위한 데이터셋의 생성, 변환 및 정렬을 간소화하도록 설계되었습니다. 복잡한 엔지니어링 스크립트 작성 대신 프롬프트 엔지니어링에 집중함으로써, SyGra는 팀이 모델 훈련 및 정렬에 필요한 고품질 도메인 특화 데이터를 신속하게 생성할 수 있게 합니다.

핵심 기능 및 해결된 데이터 과제

SyGra는 데이터 준비 파이프라인의 일반적인 병목 현상을 해결하기 위해 여러 복잡한 시나리오에 대한 유연한 워크플로를 제공합니다:

  • Dataset Transformation and Augmentation: 기존 지식 베이스를 Q&A 형식으로 변환하고, 단순 데이터셋을 복잡한 추론 작업으로 변환하며, 얕은 질문을 심층적이고 다중 턴 또는 추론이 많이 필요한 질문으로 확장합니다.
  • Model Alignment Data: Supervised Fine-Tuning (SFT) 데이터셋에서 Direct Preference Optimization (DPO)에 필요한 선호 쌍을 생성합니다.
  • **Domain-Specific Curation: 도메인 특화 중간 훈련을 위한 방대한 코퍼스를 필터링 및 큐레이션하고, 품질 필터링을 통해 저품질 샘플을 자동으로 제거합니다.
  • Multimodal and Cross-Language Processing: PDF와 이미지를 Q&A 시스템용 구조화된 문서로 변환하고, 데이터셋을 다양한 언어(예: 독일어에서 영어)로 번역하거나 적용합니다.
  • Context Optimization: 작은 컨텍스트 청크를 Retrieval-Augmented Generation (RAG) 파이프라인에 최적화된 대규모 컨텍스트 데이터셋으로 확장합니다.
  • Reasoning Enhancement: 모델을 더 나은 "thinking tokens"으로 유도하여 단계별 문제 해결 능력을 향상시킵니다.

기술 아키텍처 및 통합

SyGra는 Python 라이브러리와 포괄적인 프레임워크 모두로 구현되어 기존 머신러닝 워크플로에 직접 통합할 수 있습니다.

주요 기술 특징

  • Inference Backend Support: 프레임워크는 vLLM, Hugging Face TGI, Triton, Ollama 등 여러 추론 백엔드와 원활하게 작동합니다.
  • Low-Code Interface: 플러그 앤 플레이 방식의 데이터셋 생성을 제공하여 무거운 엔지니어링 작업 필요성을 줄입니다.
  • Flexible Generation: 시스템은 단순 Q&A 생성부터 복잡한 DPO 및 다언어 작업에 이르기까지 다양한 사용 사례에 맞게 설계되었습니다.

모델 개발에 미치는 영향

데이터 큐레이션 및 변환의 무거운 작업을 자동화함으로써, SyGra는 수동 작업을 줄이고 AI 모델 개발 주기를 가속화하는 것을 목표로 합니다. 프레임워크는 개발 팀에 네 가지 주요 이점을 제공합니다:

  1. Accelerated Alignment: SFT, DPO, RAG 파이프라인을 위한 데이터 준비를 빠르게 수행합니다.
  2. Engineering Efficiency: 플러그 앤 플레이 워크플로를 통해 맞춤 스크립트 작성에 소요되는 시간을 줄입니다.
  3. Increased Robustness: 더 나은 데이터 다양성과 구조를 통해 도메인 특화 및 복잡한 작업에서 모델 성능이 향상됩니다.
  4. Reduced Manual Curation: 수동 데이터 정리 및 라벨링에 드는 오버헤드를 낮춥니다.

Sources