Hugging Face 数据共建倡议

概览

在开源机器学习社区的支持下,Hugging Face 与 Argilla 发起了 Data Is Better Together(DIBT)倡议,以实现有影响力的数据集的集体创建。该项目旨在突破以英语为中心的数据局限,推动社区驱动的数据策划,并提供开发者和领域专家独立构建高质量数据集所需的工具。

社区驱动的数据集成果

DIBT 倡议聚焦于两个主要的社区项目,以提升提示质量和多语言评估:

提示排序项目

该倡议成功创建了一个包含 10,000 条提示的 数据集,涵盖合成和人工生成的条目,并按质量进行排序。此工作吸引了超过 385 名参与者,并发布了 DIBT/10k_prompts_ranked 数据集。该数据集用于提示排序任务和合成数据生成,已被用于开发包括 SPIN 在内的新模型。

多语言提示评估项目(MPEP)

为了解决开源大型语言模型(LLM)缺乏语言特定基准的问题,MPEP 项目旨在构建多语言排行榜。项目从 DIBT/10k_prompts_ranked 数据集中挑选了 500 条高质量提示进行多语言翻译。该工作取得了以下进展:

  • 超过 18 位语言负责人已建立翻译空间。
  • 已完成包括荷兰语、俄语和西班牙语在内的翻译,其他语言仍在进行中。
  • 在 Discord 上组建了专门的数据集构建者社区。

数据集创建指南与工具

作为 “cookbook” 工作的一部分,DIBT 提供了指南和工具,帮助社区独立构建专门化的数据集。这些资源聚焦于三个关键领域:

  • Domain-Specific Datasets:帮助工程师和领域专家协作,快速启动针对特定领域的数据集创建。
  • DPO/ORPO Datasets:提供构建 Direct Preference Optimization(DPO)风格数据集的指导,适用于不同语言、领域和任务。
  • KTO Datasets:提供工具和说明,帮助社区创建 Kahneman‑Tversky Optimization(KTO)数据集。

关键洞察与经验教训

通过 DIBT 倡议,Hugging Face 与 Argilla 发现了关于开源数据协作的若干关键结论:

  • Community Demand:社区对集体构建数据集表现出极大热情和强烈意愿。
  • Data Inequality:现存的不平等仍然存在,导致某些语言、领域和任务在开源基准中代表性不足,需要更具包容性的方式来确保全面评估。
  • Tooling Availability:用于高效社区协作构建数据集的必要工具已经就绪,可在社区规模上加以利用。

如何贡献

对 DIBT 倡议的贡献正在持续进行。用户可通过遵循特定 cookbook 项目的 README 指引、分享自己的数据集和成果,或贡献新的指南和工具来参与。相关协作在 Hugging Face Discord 服务器的 #data-is-better-together 频道进行。

Sources