facebookresearch/fairseq2
FAIR Sequence Modeling Toolkit 2
What it solves
fairseq2 是一個序列建模工具組,專為研究人員設計,用來訓練自訂的內容生成模型。它以乾淨、模組化的 API 以及可擴充的架構取代了原本的 fairseq,讓研究人員能獨立維護自己的專案程式碼庫,而不必依賴單一巨集框架。
How it works
它利用現代的 PyTorch 工具,包括 torch.compile 與 PyTorch FSDP,提供高效能的訓練與推論。工具組內含以 C++ 撰寫的串流式資料管線 API,具備高吞吐量,特別支援語音與影片解碼。亦提供結構化的 API 以確保設定的可決定性,並提供程式化的資產卡,讓模型、資料集與 tokenizer 能以版本控制方式存取。
Who it’s for
適合從事序列建模與內容生成的 AI 研究人員與開發者,尤其是需要在多 GPU 與多節點環境下擴展至 70B+ 參數模型的使用者。
Highlights
- Scalable Training: 支援使用 DDP、FSDP 與張量平行的多 GPU 與多節點訓練,適用於極大型模型。
- Extensible Architecture: 透過 setuptools 擴充機制註冊新模型、最佳化器與訓練器,無需 fork 程式庫。
- litre-Integrated Inference: 原生支援 vLLM,內建抽樣與束搜索產生器。
- Specialized Recipes: 官方提供指令微調與偏好最佳化的專屬配方。
- High-Throughput Data: 基於 C++ 的串流資料管線,能有效處理語音與影片資料。