面向研究者的 Hugging Face Hub 数据集共享
Hugging Face Hub 提供一个集中平台,用于托管和共享机器学习数据集,通过集成的探索工具、广泛的库支持和强大的安全控制,使研究者能够最大化其工作的影响。此基础设施被谷歌、英伟达、NASA 和斯坦福等主要机构使用。
大规模数据集托管和流式传输
Hugging Face Hub 支持 TB 级数据集,具有高每文件和每仓库限制。为了方便计算资源有限的研究者访问, Datasets 库启用数据集流式传输,使用户能够在不下载整个仓库的情况下处理数据。
目前,Xet 团队正在开发一个后端更新,以将每文件限制从 50 GB 提高到 500 GB,同时提高存储和传输效率。
集成数据探索工具
Hub 包含几个内置工具,使用户能够在浏览器中直接与数据交互,而无需本地下载:
数据集查看器
数据集查看器支持多种模态(音频、图像、视频)和文件格式,包括 CSV、JSON 和 Parquet。它具有:
- 全文搜索:文本列会自动可搜索,使用户能够查找特定条目(例如,在 Arxiver 数据集中搜索特定作者)。
- 排序:用户可以通过点击列标题对数据进行排序,以识别最相关的示例。
SQL 控制台
SQL 控制台是一个基于浏览器的交互式编辑器,使用完整的 DuckDB 语法。它允许用户单击查询数据集,并共享或嵌入得到的查询结果。它支持正则表达式、JSON、列表和嵌入的高级函数。
第三方库集成
在 Hub 上托管的数据集即时与广泛使用的开源数据工具兼容。许多这些库允许使用 hf:// 协议仅用一行代码加载或流式传输数据集。支持的库包括:
| Library | Description | 2024 Monthly PyPi Downloads |
|---|---|---|
| Pandas | Python 数据分析工具包 | 258M |
| Spark | 分布式大规模数据处理 | 29M |
| Datasets | 用于音频、CV 和 NLP 数据集的库 | 17M |
| Dask | 并行和分布式计算 | 12M |
| Polars | 基于 OLAP 查询引擎的 DataFrame 库 | 8.5M |
| DuckDB | 进程内 SQL OLAP 数据库 | 6M |
| WebDataset | 大数据集的 I/O 管道 | 871K |
| Argilla | AI 工程师的协作工具 | 400k |
安全和访问控制
为了保护敏感数据,Hub 提供三种主要访问级别:
- 公开:所有用户开放访问。
- 私有:访问仅限于所有者及其组织。
- 受控:通过自动批准(需要姓名/电子邮件并同意条款)或手动批准(需要所有者审查)来管理访问。
此外,平台采用多种安全扫描器来保护用户:
- 恶意软件扫描:在每次提交和访问时检查文件。
- 密钥扫描:阻止包含硬编码环境变量或密钥的数据集。
- Pickle 扫描:审查 pickle 文件中 PyTorch 权重的导入。
- ProtectAI:使用 Guardian 技术阻止 pickle 和 Keras 文件中的漏洞利用。
社区覆盖和可见性
拥有超过 500 万活跃构建者,Hub 通过以下方式促进研究的可重复性和协作:
- 参与工具:内置讨论标签和组织级别的多个数据集分组。
- 可发现性:SEO 优化的 URL 以及数据集、相关模型、研究论文和演示之间的清晰关联。
- 文档:可自定义的 README 文件,支持学术引用和详细描述。