ServiceNow/Fast-LLM

Accelerating your LLM training to full speed! Made with ❤️ by ServiceNow Research

解决的问题

Fast-LLM 旨在加速大语言模型(LLMs)的训练,显著减少从 1B 到 70B+ 参数模型训练所需的时间和成本。它解决了在大型 GPU 集群上训练超大规模模型时面临的可扩展性和内存效率挑战。

工作原理

基于 PyTorch 和 Triton 构建,该库使用经过微调的内核和先进的并行技术以最大化吞吐量。它实现了 3D 并行(数据并行、张量并行和流水线并行)、序列长度并行,以及 ZeRO-1、2 和 3 用于内存优化。同时支持混合精度训练和梯度累积,以处理大批次数据。

适用人群

需要使用高性能计算集群(如 Slurm 或 Kubernetes)从零开始训练大规模生成式 AI 模型,或对其进行微调的 AI 研究团队和实践者。

主要亮点

  • 高吞吐量:实现显著加速,例如在 H100 上训练 Mistral-7B 时达到 9,800 tokens/s。
  • 可扩展性:支持跨多个节点和 GPU 的分布式训练,并提供全面的并行选项。
  • 灵活性:兼容常见的 GPT 类架构,并包含高效的无丢弃专家混合(MoE)实现。
  • 易用性:提供预构建的 Docker 镜像、基于 YAML 的配置文件,以及与 Hugging Face Transformers 的无缝集成。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目