Hugging Face 数据集中心搜索功能更新

Hugging Face 为 Dataset Hub 推出了四个全新搜索过滤器,以改进研究人员和工程师发现并探索平台上超过 180,000 个公共数据集的方式。这些更新解决了数据集可发现性和可视化的挑战,使用户能够找到符合特定技术需求的用于训练和评估 AI 模型的数据。

按模态过滤

用户现在可以根据数据集所包含的数据类型进行过滤。模态会由 Hub 根据文件扩展名和内容自动检测。支持的模态过滤器包括:

  • 文本
  • 图像
  • 音频
  • 表格
  • 时间序列
  • 3D
  • 视频
  • 地理空间

这些过滤器支持多选,允许用户查找包含多种模态的数据集,例如文本和图像结合的数据。

按数据集规模过滤

Dataset Hub 现在允许用户通过指定最小和最大行数来搜索数据集。此功能使得从小规模数据集到用于 LLM 预训练的大规模数据集的发现皆可实现。

行数在所有支持格式的数据集中均可获取。对于元数据中未明确包含行数的数据集,Hugging Face 会基于数据集前 5GB 的内容估算总行数。

按数据格式过滤

用户现在可以按存储格式过滤数据集,这对于确定数据是否需要针对特定用例重新格式化至关重要。Hub 强调不同格式各有权衡:

  • Parquet: 提供高效的过滤、分析以及高压缩率,尽管访问单行需要解码整个行组。
  • WebDataset: 针对高速数据流优化,尽管缺少诸如每文件行数等元数据,这可能影响多节点训练的分配。
  • 其他格式: 常见格式包括 JSON Lines、CSV 和原始文本文件。

按库兼容性过滤

Dataset Hub 现在加入了用于加载和准备数据的库和工具的过滤器,例如 Pandas、Dask 和 ‚‚ Datasets 库。兼容性由数据集的格式和规模决定(例如,Dask 会列在大型 JSON Lines 数据集上,因为它们会超出 Pandas 的内存限制)。

为简化集成,Hugging Face 提供了使用这些支持工具加载数据集的代码片段。

组合搜索过滤器

所有四个新过滤器——模态、规模、格式和库——可以相互组合,也可以与现有的过滤器(如语言、任务和许可证)一起使用。与文本搜索栏配合使用时,这些组合过滤器能够实现高度特定的数据集发现。

Sources