NVIDIA-NeMo/DataDesigner

🎨 NeMo Data Designer: Generate high-quality synthetic data from scratch or from seed data.

解决的问题

它简化了生产级合成数据集的创建,超越了基础的 LLM 提示词工程,通过验证和评分来确保数据的多样性、统计准确性和高质量。

工作原理

Data Designer 使用一个灵活的框架,用户可以使用各种方法定义列:统计采样器、基于 LLM 的生成或种子数据集。它支持感知依赖关系的生成,以维持字段之间的关系,并采用异步引擎通过重叠独立列来优化性能。该系统包含内置的验证器(Python、SQL 和远程)以及 LLM-as-a-judge 评分,以确保输出符合质量标准。

适用对象

需要高质量、结构化合成数据用于 AI 模型训练或测试的开发人员和研究人员,以及使用编码代理(coding agents)来自动执行数据集模式设计和生成的开发者。

亮点

  • 多样化的生成方法:结合了统计采样器、LLM 和种子数据。
  • 感知依赖关系的生成:控制不同数据字段之间的关系。
  • 质量保证:集成了 Python、SQL 和自定义验证器,以及 LLM-as-a-judge 评分。
  • 性能优化:用于更快执行流水线的单元级异步引擎。
  • 代理集成:包含用于自动化设计和生成过程的编码代理技能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目