bespokelabsai/curator
Synthetic data curation for post-training and structured data extraction
What it solves
Bespoke Curator는 합성 데이터 파이프라인 생성을 단순화하도록 설계된 Python 라이브러리입니다. 모델 파인튜닝, 디스틸레이션, 구조화된 데이터 추출과 같은 포스트 트레이닝 작업을 위해 고품질 데이터 세트를 생성·큐레이션·확장하는 어려움을 해결합니다.
How it works
Curator는 병렬 처리, 재시도 및 캐싱을 포함한 대량 추론의 복잡성을 처리하는 고수준 curator.LLM 클래스를 제공합니다. 사용자는 입력 처리를 위해 prompt 메서드를 정의하고, 구조화된 출력(Pydantic 사용)을 처리하기 위해 parse 메서드를 정의합니다. OpenAI, Anthropic, Gemini, vLLM, Ollama 등 다양한 추론 백엔드를 지원합니다. 비용 절감을 위해 다양한 공급자의 배치 API를 기본적으로 지원합니다.
Who it’s for
대규모 합성 데이터 세트를 생성하여 추론 모델을 학습하거나 LLM을 파인튜닝(예: LoRA)하거나 비구조화 텍스트에서 구조화된 정보를 추출해야 하는 AI 연구자 및 개발자를 위한 것입니다.
Highlights
- Scalable Bulk Inference: 비동기 작업 및 장애 복구를 위한 성능 최적화가 내장되어 있습니다.
- Structured Outputs: Pydantic 기반 구조화 데이터 생성에 대한 일류 지원.
- Batch Mode: OpenAI, Anthropic, Gemini 등과 통합하여 토큰 비용을 최대 50% 절감.
- Fine-Tuning Integration: Tinker SDK를 통한 LoRA 파인튜닝 직접 파이프라인 및 Fireworks AI에서 관리되는 SFT 제공.
- Code Execution: Ray, Docker, e2b 등 백엔드를 사용해 생성된 코드를 실행할 수 있습니다.
- Data Monitoring: 실시간으로 데이터 생성을 모니터링할 수 있는 뷰어 포함.