Hugging Face 收购 XetHub 以升级 Hub 存储和协作

TL;DR

Hugging Face 宣布收购 XetHub,这是一家位于西雅图的初创公司,构建了针对 TB 级 AI 数据集和模型的 Git 规模存储和版本管理,实现了更高效的协作,并为 Hub 上的万亿参数模型支持铺平了道路。

我们在 Hugging Face 的共同目标

“XetHub 团队将帮助我们通过将 Hub 仓库的存储后端切换到我们自研的、更好的 LFS 版本,开启 HF 数据集和模型未来 5 年的增长。” – Julien Chaumond, HF CTO

Hugging Face 于 2020 年在 Git LFS 上构建了最初的 Hub,因为这对早期增长而言是务实的选择。公司现在计划用 XetHub 的优化存储和版本系统取代 Git LFS,该系统专为现代 AI 工作流中常见的极大文件而设计。

未来使用案例示例 🔥

  • 对大型 Parquet 文件的增量更新 – 向 10 GB 的 Parquet 文件添加单行目前需要重新上传整个文件。XetHub 的分块存储和去重功能将只上传受影响的块,从而大幅降低带宽和延迟。
  • 对 GGUF 模型头的细粒度更新 – 在 Llama 3.1 405B GGUF 仓库中更新单个元数据字段,今后只需上传几千字节,而不是整个多 GB 的模型文件。
  • 扩展到万亿参数模型 – 随着类似新发布的 BigLlama‑3.1‑1T 模型的出现,预计 XetHub 的技术将使社区和企业用户能够在前所未有的规模下存储、版本化并协作处理数据集和模型。
  • 提升对大型资产的协作 – XetHub 将提供工具帮助团队了解数据集和模型的演变,支持可重复性和协同实验。

当前 Hub 统计数据 🤯

  • 仓库: 130 万模型,45 万数据集,68 万 spaces
  • 存储: LFS 中 12 PB(≈2.8 亿文件)以及 Git(非 LFS)中 7.3 TB
  • 流量: 每日 10 亿请求和每日 6 PB CloudFront 带宽

这些数字展示了 Hub 当前的运行规模以及对存储后端的压力。

创始人视角

“我已经在 AI/ML 领域工作了超过 15 年……XetHub 的目标是让机器学习团队像软件团队一样运作,通过将 Git 文件存储扩展到 TB 级,顺畅实现实验和可重复性,并提供可视化能力以了解数据集和模型的演变。” – Yucheng Low (@ylow), XetHub 联合创始人

Low 讲述了他在 Apple(超过 100 PB)扩展数据管道的经验,并创立 XetHub 将这些经验带给更广泛的 AI 社区。此次收购使 XetHub 的使命与 Hugging Face 在大规模简化 AI 协作的目标保持一致。

招聘公告

Hugging Face 基础设施团队正在积极招聘希望构建和扩展开源 AI 协作平台的工程师。鼓励感兴趣的候选人申请。


在 Hugging Face 上关注 XetHub 团队 hf.co/xet-team.

Sources