NVIDIA/aistore

AIStore: scalable storage for AI applications

解決的問題

AIStore (AIS) 解決了 AI 與機器學習工作負載中常見的儲存瓶頸。它提供一個高效率、可擴展的分散式儲存堆疊,能在多個雲端後端與本地叢集之間處理龐大資料集,而不會像將遠端資料視為單純快取時常見的效能下降問題。

運作方式

AIS 作為一個彈性叢集的儲存節點與閘道運作,可部署於裸金屬 Linux 機器或 Kubernetes 上。它使用統一名稱空間來管理獨立叢集間的資料,並支援原生 HTTP 基礎 API 與 S3 相容 API。系統具備「Get-Batch」功能,可單一呼叫取得整個訓練批次,減少 ML 管道的額外負荷。同時支援 ETL 離載,讓資料轉換可直接在儲存節點上執行,降低資料移動成本。

適用對象

專為需要管理拍字節級資料集,並確保高吞吐量資料傳送到訓練叢集的 AI 研究人員、資料科學家與 ML 工程師設計。

主要特色

  • 多雲存取: 無縫管理 AWS S3、GCS、Azure 與 OCI 之間的內容。
  • 線性擴展: 隨著叢集節點數量增加,性能保持一致。
  • Get-Batch: 以 TAR 或其他序列化格式,一次操作取得多個物件,專為 ML 管道優化。
  • ETL 離載: 在資料附近執行 I/O 密集型轉換,支援內嵌或批次處理。
  • 彈性部署: 可在單一 Linux VM 到拍字節級 Kubernetes 叢集的任何環境中運行。
  • 原生 PyTorch 整合: 提供專為 PyTorch 工作流程設計的資料集、取樣器與資料載入器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案