Hugging Face 與 NVIDIA 推出訓練叢集即服務

Hugging Face 與 NVIDIA 已推出 Training Cluster as a Service,這是一項協作計畫,旨在讓全球的研究機構、大學與公司都能使用大型 GPU 叢集。此服務旨在彌補運算資源的差距,讓組織能夠針對訓練執行期間,申請並支付高效能 GPU 容量。

按需 GPU 叢集可及性

Training Cluster as a Service 提供彈性的 AI 計算採購模式,使 Hugging Face 上的 250,000 家組織皆能根據即時需求申請特定規模的 GPU 叢集。其主要目標是透過消除取得龐大運算資源的財務與後勤障礙,促進各領域基礎模型的開發。

技術架構與工作流程

此服務透過以下元件,將 NVIDIA 的基礎設施與 Hugging Face 的開發者生態系統整合:

  • NVIDIA Cloud Partners: 提供最新加速運算硬體(包括 NVIDIA Hopper 與 NVIDIA GB200)的實體容量,位於各區域資料中心。
  • NVIDIA DGX Cloud: 作為這些區域資源的集中管理層。
  • NVIDIA DGX Cloud Lepton: 於 GTC Paris 公布的工具,為研究人員提供已配置基礎設施的存取,並管理訓練執行的排程與監控。
  • Hugging Face Libraries: 使用開源函式庫與開發者資源來啟動與管理訓練工作負載。

當透過 hf.co/training-cluster 提交請求後,Hugging Face 與 NVIDIA 會合作根據組織對規模、區域與期間的需求,尋找、報價並配置叢集。

真實世界的研究應用

已有多家組織利用 Training Cluster as a Service 推進專門的 AI 研究:

  • TIGEM(Telethon Institute of Genomics and Medicine): 使用此服務預測致病變異的影響,並探索罕見遺傳疾病的藥物再定位。
  • Numina: 一個非營利組織,打造用於數學推理的開源 AI,提供像 DeepMind 的 AlphaProof 這類封閉模型的開放替代方案。
  • Mirror Physics: 一家新創公司,於大規模下開發高保真化學模型,應用於化學與材料科學。

更廣泛的 NVIDIA 與 Hugging Face 整合

除了訓練叢集服務外,合作還包括在 GTC Paris 公布的其他多項技術整合:

  • NVIDIA NIM: NVIDIA AI 客戶現在可使用 NVIDIA Inference Microservices(NIM)部署超過 100,000 個 Hugging Face 模型。
  • NVIDIA Cosmos Predict-2: 讓 Hugging Face 使用者能構建自訂的實體 AI 模型。
  • NVIDIA Isaac GR00T N1.5: 現已在 Hugging Face 上提供,用於驅動類人機器人的開發。

Sources