theaniketgiri/create-llm

The fastest way to build and start training your own LLM. CLI tool that scaffolds production-ready PyTorch training projects in seconds. Like create-next-app but for language models.

解决的问题

create-llm 是一个 CLI 工具,旨在消除从零开始训练自定义大型语言模型(LLM)时涉及的样板代码和复杂性。它提供标准化的项目结构和预配置的模板,使用户能够从一个空白文件夹在几秒钟内转变为生产就绪的训练管道。

工作原理

该工具会生成一个完整的基于 PyTorch 的训练环境。用户可根据自己的硬件和数据可用性,从四个合适大小的模板中进行选择:

  • NANO (~1M 参数):适用于学习和快速的 CPU 测试。
  • TINY (~6M 参数):适用于在 CPU 或基础 GPU 上进行原型设计。
  • SMALL (~100M 参数):适用于生产级别的领域特定模型。
  • BASE (~1B 参数):适用于研究级别的高质量模型。

项目生成后,包含用于训练分词器(BPE、WordPiece、Unigram)、数据预处理、带 TensorBoard 监控的训练、评估、文本生成以及部署到 Hugging Face 或 Replicate 的脚本。

适用人群

面向希望在不手动设置架构、数据流水线和训练循环的情况下训练自己的语言模型的开发者和研究人员。特别适合希望从小型实验开始并逐步扩展到更大模型的用户。

主要亮点

  • 一键设置:使用 npx create-llm 快速生成完整的项目结构。
  • 集成工具包:包含从分词器训练到用于测试训练模型的交互式聊天界面的全部内容。
  • 智能默认值:自动处理词汇量检测、序列长度不匹配问题,并提供过拟合警告。
  • Docker 支持:提供完整的 Docker 和 Docker Compose 设置,无需本地安装 Node.js 或 Python 即可运行整个管道。
  • 插件系统:可选集成 WandB 实验追踪和 Hugging Face 模型共享功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目