ServiceNow/Fast-LLM
Accelerating your LLM training to full speed! Made with ❤️ by ServiceNow Research
解决的问题
Fast-LLM 旨在加速大语言模型(LLMs)的训练,显著减少从 1B 到 70B+ 参数模型训练所需的时间和成本。它解决了在大型 GPU 集群上训练超大规模模型时面临的可扩展性和内存效率挑战。
工作原理
基于 PyTorch 和 Triton 构建,该库使用经过微调的内核和先进的并行技术以最大化吞吐量。它实现了 3D 并行(数据并行、张量并行和流水线并行)、序列长度并行,以及 ZeRO-1、2 和 3 用于内存优化。同时支持混合精度训练和梯度累积,以处理大批次数据。
适用人群
需要使用高性能计算集群(如 Slurm 或 Kubernetes)从零开始训练大规模生成式 AI 模型,或对其进行微调的 AI 研究团队和实践者。
主要亮点
- 高吞吐量:实现显著加速,例如在 H100 上训练 Mistral-7B 时达到 9,800 tokens/s。
- 可扩展性:支持跨多个节点和 GPU 的分布式训练,并提供全面的并行选项。
- 灵活性:兼容常见的 GPT 类架构,并包含高效的无丢弃专家混合(MoE)实现。
- 易用性:提供预构建的 Docker 镜像、基于 YAML 的配置文件,以及与 Hugging Face Transformers 的无缝集成。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目