facebookresearch/fairseq2

FAIR Sequence Modeling Toolkit 2

解決的問題

fairseq2 是一個專為研究人員設計的序列建模工具包,用於訓練自訂的內容生成模型。它以更模組化、可擴展的架構取代原始的 fairseq 框架,讓研究人員無需分叉整個程式庫,即可維護自己的專案程式碼庫。

如何運作

提供清晰的 API 與模組化設計哲學。該工具包與現代 PyTorch 工具(包括 torch.compile 和 PyTorch FSDP)整合,支援高效率訓練。其基於 C++ 的串流資料管道可實現高吞吐量,特別支援語音與影片解碼。

適用對象

專注於序列建模與內容生成的 AI 研究人員,尤其是處理大型模型(70B+ 參數)與多樣模態(如文字、語音、影片)的研究者。

主要亮點

  • 可擴展訓練:支援使用 DDP、FSDP 和張量平行的多 GPU 與多節點訓練,適用於超過 70B 參數的模型。
  • 可擴展架構:使用 setuptools 擴展機制註冊新模型、最佳化器與排程器,無需分叉程式庫。
  • 原生 vLLM 支援:支援 vLLM,同時提供內建的取樣與束搜尋產生器。
  • 整合配方:提供官方的指令微調與偏好優化配方。
  • 資產管理:使用程式化資產卡實現對模型、資料集與分詞器的版本化存取。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案