Argilla 2.4 发布说明 / 新功能

Argilla 2.4 使用户能够在无需编写代码的情况下准备 AI 数据集,方法是直接将 Hugging Face Hub 中的数据集导入 Argilla 的 UI。此更新简化了收集用于微调和评估的人类反馈的过程,使不熟悉 Python 的领域专家也能民主化地创建数据集。

在 Hugging Face Hub 上的无代码数据集准备

Argilla 2.4 允许用户从 Hugging Face Hub 导入任何公开数据集——该平台目前拥有超过 230,000 个数据集——以作为 AI 项目的基础。通过使用 Argilla UI,开发者和领域专家可以定义问题并收集人类反馈,而无需使用 Python SDK。

此功能旨在支持以下关键使用场景:

  • 社区贡献: 用户可以将开放数据集导入公共 Argilla Space,并共享 URL,以收集更广泛社区的反馈。
  • 新数据集创建: 用户可以将 CSV 上传到 Hub,并将其导入 Argilla Space,以从头开始标注。
  • 数据集策划: 可以将现有的 Hub 数据集导入 Argilla Spaces,专门用于模型微调或评估的策划。
  • 数据集改进: 用户可以导入现有的 Hub 数据集,提供反馈并改进它们,以惠及社区。

技术工作流与实现

要使用这些功能,用户必须先部署 Argilla,推荐的方法是在 Hugging Face Spaces 上部署。默认部署包含 Hugging Face OAuth,如果 Space 为公开,则允许任何 Hub 用户贡献标注。

导入过程遵循以下步骤:

  1. 数据集选择: 用户登录后,在首页使用 "Import dataset from Hugging Face" 按钮,提供仓库 ID 或选择示例数据集。
  2. 配置: Argilla 会根据数据集的特征自动建议初始配置。用户随后可以添加问题(如标签、评分、排名或文本),或移除不必要的字段(如文本、聊天或图像)。
  3. 数据集创建: 配置完成且实时显示更改后,用户点击 "Create dataset" 完成导入。

在此功能的首个版本中,Hub 数据集必须是公开的。对私有数据集的支持目前是未来开发的需求。

与 Hugging Face 生态系统的集成

虽然无代码 UI 简化了导入流程,但 Argilla Python SDK 仍可供需要高级定制的用户使用。Argilla 是一个开源、以数据为中心的工具,集成了 Hugging Face Hub,旨在促进 AI 开发者与领域专家之间的协作,以构建高质量的数据集。

Sources