theaniketgiri/create-llm

The fastest way to build and start training your own LLM. CLI tool that scaffolds production-ready PyTorch training projects in seconds. Like create-next-app but for language models.

解決的問題

create-llm 是一個 CLI 工具,旨在消除從零開始訓練自訂大型語言模型(LLM)時所涉及的重複程式碼與複雜性。它提供標準化的專案結構與預先設定的範本,讓使用者能從空白資料夾在數秒內轉換為生產就緒的訓練流程。

工作原理

該工具會建立一個完整的 PyTorch 基礎訓練環境。使用者可根據自身硬體與資料可用性,從四種合適大小的範本中選擇:

  • NANO (~1M 參數):適用於學習與快速的 CPU 測試。
  • TINY (~6M 參數):適用於在 CPU 或基礎 GPU 上進行原型設計。
  • SMALL (~100M 參數):適用於生產級的領域特定模型。
  • BASE (~1B 參數):適用於研究級的高品質模型。

專案建立後,包含用於訓練分詞器(BPE、WordPiece、Unigram)、資料預處理、帶 TensorBoard 監控的訓練、評估、文字生成,以及部署至 Hugging Face 或 Replicate 的指令碼。

適用對象

針對希望在不手動設定架構、資料流程與訓練迴圈的情況下訓練自己語言模型的開發者與研究人員。特別適合希望從小型實驗開始,逐步擴展至更大模型的使用者。

主要特色

  • 一鍵設定:使用 npx create-llm 快速生成完整的專案結構。
  • 整合工具包:包含從分詞器訓練到用於測試訓練模型的互動式聊天介面的全部內容。
  • 智慧預設值:自動處理詞彙大小偵測、序列長度不匹配問題,並提供過擬合警告。
  • Docker 支援:提供完整的 Docker 與 Docker Compose 設定,無需在本機安裝 Node.js 或 Python 即可執行整個流程。
  • 外掛系統:可選整合 WandB 實驗追蹤與 Hugging Face 模型分享功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案