bespokelabsai/curator

Synthetic data curation for post-training and structured data extraction

What it solves

Bespoke Curator 是一个设计用来简化合成数据管道创建的 Python 库。它解决了在后训练任务(如模型微调、蒸馏和结构化数据抽取)中生成、策划和扩展高质量数据集的困难。

How it works

Curator 提供高级的 curator.LLM 类,处理批量推理的复杂性,包括并行、重试和缓存。用户定义 prompt 方法进行输入处理,并定义 parse 方法处理结构化输出(通过 Pydantic)。它支持多种推理后端,包括 OpenAI、Anthropic、Gemini、vLLM 和 Ollama。为降低成本,内置对各种供应商批量 API 的支持。

Who it’s for

它面向需要生成大规模合成数据集以训练推理模型、微调 LLM(例如通过 LoRA)或从非结构化文本中提取结构化信息的 AI 研究者和开发者。

Highlights

  • Scalable Bulk Inference: 内置异步操作和故障恢复的性能优化。
  • Structured Outputs: 对基于 Pydantic 的结构化数据生成提供一流支持。
  • Batch Mode: 与 OpenAI、Anthropic、Gemini 等集成,可将 token 成本降低最高 50%。
  • Fine-Tuning Integration: 通过 Tinker SDK 直接将管道连接到 LoRA 微调,并在 Fireworks AI 上进行受管 SFT。
  • Code Execution: 能使用 Ray、Docker 或 e2b 等后端运行生成的代码。
  • Data Monitoring: 包含实时监控数据生成的查看器。