Hugging Face 与 Argilla 实现社区协同数据集构建

Hugging Face 与 Argilla 发起了一项倡议,旨在让开源社区能够协同构建高质量的数据集,降低非技术贡献者的参与门槛。此举旨在解决许多语言、领域和特定任务缺乏高质量训练、评估和基准数据的问题。

通过 Argilla 与 Hugging Face Spaces 进行协同数据集构建

协同数据集构建使没有机器学习或编程技能的个人也能直接为开源机器学习的发展做出贡献。通过利用简化的技术工作流,社区可以在多种数据类型上协作,包括:

  • 特定语言聊天数据集:为代表性不足的语言创建数据。
  • 特定领域基准:为专业领域开发评估集。
  • 偏好数据集:收集来自多元参与者的排名。
  • 特定任务数据集:构建针对特定机器学习任务的数据。

技术实现与工作流

协同数据标注的主要技术障碍历来是难以搭建高效的标注任务。通过将 Argilla——一个用于创建大语言模型(LLM)和特定任务数据集的开源工具——与 Hugging Face Spaces(用于托管机器学习演示和应用的平台)相结合,这一问题得以解决。

Argilla 现在支持通过 Hugging Face 账户对托管在 Spaces 上的实例进行身份验证。此集成使用户能够在几秒钟内开始参与标注任务,显著降低了社区参与的阻力。

概念验证:10k_prompts_ranked 数据集

为测试此工作流,Hugging Face 与 Argilla 开展了名为“Data is Better Together”的实验,专注于构建提示排名的偏好数据集。结果展示了社区驱动方法的高效性:

  • 贡献者数量:有 350 名社区贡献者参与了数据标注。
  • 数据量:在几天内收集了超过 11,000 条提示评分。
  • 成果:发布了 10k_prompts_ranked 数据集,包含 10,000 条提示及用户对提示质量的评分。

社区群体支持

Hugging Face 与 Argilla 正在招募首批社区数据集构建者,以推广此模型。对该群体参与者的支持包括:

  • 基础设施:帮助创建带有 Hugging Face 身份验证的 Argilla Space,包括 Hugging Face 提供的免费持久存储和增强的 CPU 空间。
  • 可见性:由 Argilla 与 Hugging Face 共同放大宣传和推广力度。
  • 协作:获取专属群体社区渠道的访问权限。

项目范围与限制

该倡议主要聚焦于文本数据集,尤其是针对当前在开源生态系统中代表性不足的语言、领域和任务的项目。虽然该计划对多模态数据集的想法持开放态度,但在首批群体中对其的支持可能有限。标注任务可以配置为完全向公众开放,或仅限特定 Hugging Face Hub 组织的成员参与。

Sources