argilla-io/distilabel

Distilabel is a framework for synthetic data and AI feedback for engineers who need fast, reliable and scalable pipelines based on verified research papers.

解决的问题

Distilabel 提供了一个程序化框架,用于生成合成数据和 AI 反馈,以提高 AI 模型的质量。它解决了在不完全依赖昂贵的人工标注的情况下,为微调 LLM、预测性 NLP 任务(如分类和提取)以及生成式场景(如指令遵循和对话生成)创建高质量、多样化数据集的挑战。

工作原理

该框架允许工程师构建可扩展、容错的流水线,根据经过验证的研究方法进行数据合成和评判。它使用统一的 API 来集成来自任何 LLM 提供商(例如 OpenAI、Anthropic、Cohere、Mistral、Vertex AI 以及通过 vLLM 或 Ollama 进行的本地模型)的 AI 反馈。它还支持通过 Outlines 和 Instructor 等工具进行结构化生成,并可以使用 Ray 来扩展分布式流水线。

适用对象

需要为训练或改进 LLM 及其他 NLP 模型创建大规模合成数据集的 AI 工程师和研究人员,特别是那些专注于通过提高数据质量来提升模型性能的人员。

亮点

  • 广泛的 LLM 集成:支持包括专有 API 和本地推理引擎在内的多种提供商。
  • 可扩展的流水线:内置对 Ray 的支持,用于分发数据生成和 AI 反馈任务。
  • 可扩展的合成:能够进行大规模的数据合成,正如 1M OpenHermesPreference 数据集所证明的那样。
  • 研究驱动:旨在实现经过验证的研究论文中的方法,用于生成和评判数据。
  • 数据过滤:能够通过使用 AI 反馈从现有数据集中过滤掉低质量数据,从而提高模型性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目