allenai/OLMo-core
PyTorch building blocks for the OLMo ecosystem
解決的問題
OLMo-core 為開發、訓練以及在 OLMo 系列大語言模型上進行推理提供了基礎構建模組與訓練基礎設施。透過提供官方腳本並與優化的硬體核心整合,它簡化了訓練高性能模型的過程。
工作原理
該函式庫作為核心建模與訓練框架。它與多個高性能後端整合以優化記憶體與速度,包括 FlashAttention、TransformerEngine、用於 fused-linear loss 的 Liger-Kernel 以及用於 float8 訓練的 torchao。它還透過 grouped_gemm 支援混合專家 (MoE) 模型。使用者可以使用 torchrun 或 Beaker CLI 透過官方腳本啟動訓練,並透過 Hugging Face Transformers、vLLM 或函式庫內建的生成工具執行推理。
適用對象
本專案專為從頭開始訓練大規模語言模型,或繼續現有 OLMo 檢查點訓練(退火)的 AI 研究人員與工程師設計。
亮點
- 官方訓練腳本:包含適用於 OLMo-2 與 OLMo-3 模型系列的即用型腳本。
- 硬體優化:支援 float8 訓練與低記憶體 fused-linear loss。
- 靈活的推理:與 vLLM 及 Hugging Face Transformers 等業界標準工具相容。
- MoE 支援:包含無丟棄混合專家 (mixture-of-experts) 模型的功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案