allenai/OLMo-core
PyTorch building blocks for the OLMo ecosystem
解决的问题
OLMo-core 为开发、训练和在 OLMo 系列大语言模型上进行推理提供了基础构建模块和训练基础设施。通过提供官方脚本并与优化的硬件内核集成,它简化了训练高性能模型的过程。
工作原理
该库作为一个核心建模和训练框架。它与多个高性能后端集成以优化内存和速度,包括 FlashAttention、TransformerEngine、用于 fused-linear loss 的 Liger-Kernel 以及用于 float8 训练的 torchao。它还通过 grouped_gemm 支持混合专家 (MoE) 模型。用户可以使用 torchrun 或 Beaker CLI 通过官方脚本启动训练,并通过 Hugging Face Transformers、vLLM 或库自带的内置生成工具执行推理。
适用对象
本项目专为从头开始训练大规模语言模型或继续现有 OLMo 检查点训练(退火)的 AI 研究人员和工程师设计。
亮点
- 官方训练脚本:包括适用于 OLMo-2 和 OLMo-3 模型系列的即用型脚本。
- 硬件优化:支持 float8 训练和低内存 fused-linear loss。
- 灵活的推理:与 vLLM 和 Hugging Face Transformers 等行业标准工具兼容。
- MoE 支持:包含无丢弃混合专家 (mixture-of-experts) 模型的功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目