bespokelabsai/curator
Synthetic data curation for post-training and structured data extraction
What it solves
Bespoke Curator 是一个设计用来简化合成数据管道创建的 Python 库。它解决了在后训练任务(如模型微调、蒸馏和结构化数据抽取)中生成、策划和扩展高质量数据集的困难。
How it works
Curator 提供高级的 curator.LLM 类,处理批量推理的复杂性,包括并行、重试和缓存。用户定义 prompt 方法进行输入处理,并定义 parse 方法处理结构化输出(通过 Pydantic)。它支持多种推理后端,包括 OpenAI、Anthropic、Gemini、vLLM 和 Ollama。为降低成本,内置对各种供应商批量 API 的支持。
Who it’s for
它面向需要生成大规模合成数据集以训练推理模型、微调 LLM(例如通过 LoRA)或从非结构化文本中提取结构化信息的 AI 研究者和开发者。
Highlights
- Scalable Bulk Inference: 内置异步操作和故障恢复的性能优化。
- Structured Outputs: 对基于 Pydantic 的结构化数据生成提供一流支持。
- Batch Mode: 与 OpenAI、Anthropic、Gemini 等集成,可将 token 成本降低最高 50%。
- Fine-Tuning Integration: 通过 Tinker SDK 直接将管道连接到 LoRA 微调,并在 Fireworks AI 上进行受管 SFT。
- Code Execution: 能使用 Ray、Docker 或 e2b 等后端运行生成的代码。
- Data Monitoring: 包含实时监控数据生成的查看器。