PersiaML/PERSIA

High performance distributed framework for training deep learning recommendation models based on PyTorch.

解決的問題

PERSIA 解決了訓練超出單一設備記憶體容量的超大型深度學習推薦模型的挑戰。它能在一般硬體上訓練最多達 100 兆參數的模型,克服傳統訓練系統在規模與效率上的瓶頸。

工作原理

這是一個基於 PyTorch 的系統,利用混合加速技術提供並行推薦訓練環境。透過利用異質並行化,它能將推薦模型擴展至多個硬體元件上,以處理極端參數數量,同時維持高效率與穩健性。

適用對象

專注於大規模推薦系統、特別是需要在一般硬體上進行分散式訓練的資料集與模型的機器學習工程師與研究人員。

核心亮點

  • 極致規模:可訓練最多達 100 兆參數的模型。
  • PyTorch 整合:首個專為大規模推薦訓練設計的公開 PyTorch 系統。
  • 基於 PyTorch:建構於 PyTorch 之上,使研究人員更容易融入相同生態系。
  • 產業驗證:已在快手(Kuaishou)生產環境中驗證,支援日活用戶(DAU)達一億級別。
  • 高效能:相比現有推薦訓練系統展現出顯著的性能優勢。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案