Hugging Face 儲存桶發布

Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,專為中間機器學習產物而設計。這個新儲存層讓開發者能管理高吞吐量資料——例如檢查點、優化器狀態與已處理的分片——而無需 Git 版控的負擔。

透過 Xet 優化機器學習產物的儲存

儲存桶由 Xet 提供動力,Xet 是一種基於區塊的儲存後端,能在檔案之間去除重複內容。與將檔案視為單一巨型 Blob 的傳統物件儲存不同,Xet 會將內容切割成區塊,使系統能跳過已在 Hub 上存在的位元組。

此架構對於機器學習工作負載特別有益,因為相關產物常常有大量重疊,例如:

  • 連續檢查點: 大部分模型保持不變。
  • 已處理資料集: 通常與原始資料集大致相似。
  • 代理追蹤: 以及其衍生的摘要。

對於企業客戶而言,這種效率也會轉化為成本優勢,因為計費是根據去重後的儲存佔用量,從而降低頻寬使用量與總計費儲存空間。

為高吞吐量運算進行預熱

為了降低分散式訓練與大規模流水線的延遲,Hugging Face 引入了「預熱」功能。此功能允許使用者宣告所需資料的位置,將熱資料移動至靠近雲端提供者與運算所在區域。

透過減少每次讀取時跨區域拉取資料的需求,預熱可提升訓練叢集與多區域流水線設定的吞吐量。Hugging Face 目前正與 AWS 與 GCP 合作提供此功能,未來還將支援更多提供者。

整合與程式化存取

儲存桶透過多種介面整合至 Hugging Face 生態系統,讓它們能以非版本化的容器形式,於使用者或組織的命名空間下管理。

CLI 與 Python API

使用者可以透過 hf CLI 或 huggingface_hub Python 函式庫(自 v1.5.0 起提供)管理儲存桶。主要操作包括:

  • 建立: hf buckets create [name] --private
  • 同步: hf buckets sync [local_dir] [hf_path]
  • 檢查: hf buckets list [bucket_name] -h

透過 fsspec 的檔案系統整合

透過 HfFileSystem,儲存桶相容於 fsspec 標準。這使得可直接使用 hf:// 路徑與 pandas、Polars、Dask 等資料庫整合。例如,CSV 可直接讀入 pandas DataFrame 而無需本機下載:pd.read_csv("hf://buckets/username/my-training-bucket/results.csv")

JavaScript 支援

儲存桶支援亦可透過 @huggingface/hub 函式庫(自 v2.10.5 起)在 Node.js 服務與 Web 應用程式中使用。

工作流程:從可變儲存到版本化倉庫

儲存桶作為動態產物的工作層。當產物變成穩定的可交付項目時,預期的工作流程是將其從儲存桶移至版本化的模型或資料集倉庫。Hugging Face 計畫實作儲存桶與倉庫之間的直接傳輸,以簡化最終檢查點權重或已處理分片升級為官方 Hub 發布的流程。

可用性與定價

儲存桶已納入現有的 Hub 儲存方案。免費帳號包含初始儲存空間,而 PRO 與 Enterprise 計畫則提供更高上限.

SUMMARY: Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。

TITLE: Hugging Face 儲存桶發布

Sources