bespokelabsai/curator
Synthetic data curation for post-training and structured data extraction
What it solves
Bespoke Curator は、合成データパイプラインの作成をシンプルにすることを目的とした Python ライブラリです。モデルのファインチューニング、蒸留、構造化データ抽出といったポストトレーニングタスク向けに、高品質なデータセットを生成・キュレート・スケールすることの難しさに対処します。
How it works
Curator は、並列処理、リトライ、キャッシュを含むバルク推論の複雑さを処理する高レベルの curator.LLM クラスを提供します。ユーザーは入力処理用に prompt メソッド、構造化出力(Pydantic 経由)を処理する parse メソッドを定義します。OpenAI、Anthropic、Gemini、vLLM、Ollama など、幅広い推論バックエンドをサポートしています。コスト削減のため、各プロバイダーのバッチ API も組み込みでサポートしています。
Who it’s for
大規模な合成データセットを生成して推論モデルのトレーニングや LLM のファインチューニング(例: LoRA)を行う、または非構造化テキストから構造化情報を抽出したい AI 研究者や開発者向けです。
Highlights
- Scalable Bulk Inference: 非同期操作と障害復旧のためのパフォーマンス最適化が組み込まれています。
- Structured Outputs: Pydantic ベースの構造化データ生成を第一級にサポート。
- Batch Mode: OpenAI、Anthropic、Gemini などと統合し、トークンコストを最大 50% 削減。
- Fine-Tuning Integration: Tinker SDK を介した LoRA ファインチューニングへの直接パイプライン、Fireworks AI 上のマネージド SFT を提供。
- Code Execution: Ray、Docker、e2b などのバックエンドで生成コードを実行可能。
- Data Monitoring: データ生成をリアルタイムで監視できるビューアを搭載。