nolabs-ai/deepfabric
Generate High-Quality Synthetics, Train, Measure, and Evaluate in a Single Pipeline
What it solves
DeepFabric은 언어 모델, 특히 도구 호출(tool-calling) 및 추론과 같은 에이전트적 행동을 위한 고품질의 다양하고 다양한 합성 학습 데이터를 생성하는 문제를 해결합니다. 데이터셋이 시뮬레이션된 출력이 아닌 실제 도구 실행 결과에 기반하고 도메인에 고정되어 있도록 보장함으로써 모델의 과적합(overfitting)과 환각(hallucinations)을 방지합니다.
How it works
이 시스템은 고유한 주제 그래프 생성 알고리즘을 사용하여 도메인을 매핑하고 중복 없이 하위 주제를 포괄적으로 커버하도록 보장합니다. 그런 다음 ReAct (Reason-Act-Observe) 루프를 사용하여 학습 샘플을 생성합니다. 정확성을 보장하기 위해, Spin Framework와 통합되어 격리된 WebAssembly 샌드박스에서 도구를 실행합니다. 즉, 모델의 "의사 관찰(observations)"은 가상 파일 시스템의 실제 상태 변화에 기반합니다. 생성된 데이터는 Hugging Face로 내보낼 수 있으며 TRL, Unsloth, 또는 Axolotl과 같은 학습 프레임워크와 함께 사용할 수 있습니다. 마지막으로, 미세 조정된 모델의 도구 선택 및 매개변수 정확도를 보지 못한 작업(unseen tasks)에서 테스트하기 위한 내장된 평가 엔진을 포함합니다.
Who it’s for
이것은 LLM을 에이전트로 작동하도록 미세 조정하는 개발자와 AI 연구자, 특히 모델에게 도구 사용법, 엄격한 스키마 준수, 특정 도메인에서의 복잡한 계획 수행 방법을 가르쳐야 하는 사람들을 위해 설계되었습니다.
Highlights
Topic Graph Generation: 주제 그래프 생성. 그래프와 트리를 사용하여 100% 주제 커버리지와 중복된 샘플 방지를 보장합니다.
Real Tool Execution: 실제 도구 실행. WebAssembly (Spin)와 통합되어 환각된 시뮬레이션 대신 실제적인 도구 호출 추적(traces)을 제공합니다.
MCP Support: MCP 지원. Model Context Protocol (MCP) 서버 스키마에서 도구 정의를를 임포트할 수 있습니다.
Integrated Evaluation: 통합된 평가. 도구 선택 정확도, 매개변수 정확도, 실행 성공률을 측정하기 위한 전용 엔진을 제공합니다.
Training Pipeline Integration: 학습 파이프라인 통합. Hugging Face 및 인기 있는 SFT (Supervised Fine-Tuning) 프레임워크와 직접 호환됩니다.