bespokelabsai/curator

Synthetic data curation for post-training and structured data extraction

What it solves

Bespoke Curator 是一個設計用來簡化合成資料管道建立的 Python 函式庫。它解決了在後訓練任務(如模型微調、蒸餾與結構化資料抽取)中產生、策劃與擴展高品質資料集的困難。

How it works

Curator 提供高階的 curator.LLM 類別,處理批量推論的複雜性,包括平行處理、重試與快取。使用者定義 prompt 方法來處理輸入,並定義 parse 方法以處理結構化輸出(透過 Pydantic)。它支援多種推論後端,包括 OpenAI、Anthropic、Gemini、vLLM 與 Ollama。為降低成本,內建支援各供應商的批次 API。

Who it’s for

此函式庫適用於需要產生大規模合成資料集以訓練推理模型、微調 LLM(例如透過 LoRA)或從非結構化文字中抽取結構化資訊的 AI 研究者與開發者。

Highlights

  • Scalable Bulk Inference: 內建非同步操作與故障復原的效能最佳化。
  • Structured Outputs: 首屈一指的 Pydantic 結構化資料生成支援。
  • Batch Mode: 與 OpenAI、Anthropic、Gemini 等整合,可將代幣成本降低最高 50%。
  • Fine-Tuning Integration: 直接透過 Tinker SDK 與 Fireworks AI 的受管 SFT,將管道連結至 LoRA 微調。
  • Code Execution: 能使用 Ray、Docker 或 e2b 等後端執行產生的程式碼。
  • Data Monitoring: 包含即時監控資料生成的檢視器。