theaniketgiri/create-llm

The fastest way to build and start training your own LLM. CLI tool that scaffolds production-ready PyTorch training projects in seconds. Like create-next-app but for language models.

해결하는 문제

create-llm는 자체 대규모 언어 모델(LLM)을 처음부터 훈련할 때 발생하는 반복 작업과 복잡성을 제거하기 위해 설계된 CLI 도구입니다. 표준화된 프로젝트 구조와 사전 구성된 템플릿을 제공하여, 빈 폴더에서 수초 만에 프로덕션 준비된 훈련 파이프라인으로 전환할 수 있습니다.

작동 방식

이 도구는 완전한 PyTorch 기반 훈련 환경을 스텁으로 생성합니다. 사용자의 하드웨어와 데이터 가용성에 따라 네 가지 적절한 크기의 템플릿 중에서 선택할 수 있습니다:

  • NANO (~1M 파라미터): 학습 및 빠른 CPU 테스트에 적합합니다.
  • TINY (~6M 파라미터): CPU 또는 기본 GPU에서 프로토타이핑에 적합합니다.
  • SMALL (~100M 파라미터): 프로덕션 수준의 도메인 특화 모델에 적합합니다.
  • BASE (~1B 파라미터): 연구용 고품질 모델에 적합합니다.

스켈레톤화된 후, 프로젝트에는 BPE, WordPiece, Unigram을 사용한 토크나이저 훈련, 데이터 전처리, TensorBoard 모니터링을 통한 훈련, 평가, 텍스트 생성, Hugging Face 또는 Replicate로의 배포를 위한 스크립트가 포함됩니다.

대상 사용자

아키텍처, 데이터 파이프라인, 훈련 루프를 수동으로 설정하지 않고도 자체 언어 모델을 훈련하고 싶은 개발자 및 연구자를 대상으로 합니다. 특히 소규모 실험부터 시작하여 더 큰 모델로 확장하고자 하는 사용자에게 특히 유용합니다.

주요 특징

  • 원클릭 설정: npx create-llm을 사용하여 빠르게 전체 프로젝트 구조를 생성할 수 있습니다.
  • 통합 툴킷: 토크나이저 훈련부터 훈련된 모델을 테스트할 수 있는 인터랙티브 챗 인터페이스까지 모든 것이 포함되어 있습니다.
  • 스마트 기본값: 어휘 크기 자동 감지, 시퀀스 길이 불일치 처리, 오버피팅 경고를 자동으로 제공합니다.
  • Docker 지원: 로컬 Node.js 또는 Python 설치 없이 전체 파이프라인을 실행할 수 있는 완전한 Docker 및 Docker Compose 설정을 제공합니다.
  • 플러그인 시스템: WandB를 통한 실험 추적 및 Hugging Face를 통한 모델 공유와의 옵션 통합이 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트