hiyouga/LlamaFactory

Unified Efficient Fine-Tuning of 100+ LLMs & VLMs (ACL 2024)

LlamaFactory – 수십 개의 LLM을 원클릭으로 파인튜닝

개요 – LlamaFactory는 100개 이상의 대규모 언어 모델(LLM)을 사실상 코드 없이 파인튜닝, 평가, 제공할 수 있는 오픈소스 Python 툴킷입니다. 명령줄 인터페이스 Gradio 기반 웹 UI(LlamaBoard)가 함께 제공되어 로컬 또는 클라우드(Colab, SageMaker, AMD/Ascend GPU 등)에서 실험을 실행할 수 있습니다.

중요성 – 최신 LLM을 학습하거나 적용하려면 일반적으로 분산 학습, 양자화, 옵티마이저 기술에 대한 깊은 지식이 필요합니다. LlamaFactory는 최첨단 방법(LoRA, QLoRA, FlashAttention-2, GaLore, BAdam, ORPO, DPO, PPO, KTO 등)을 대량으로 번들로 제공하며 간단한 YAML 구성으로 선택할 수 있게 합니다. 그 결과 "제로 코드" 워크플로우이면서도 최신 연구에 접근할 수 있습니다.


핵심 기능

카테고리 수행 가능 작업
모델 지원 LLaMA-1/2/3/4, LLaVA, Mistral, Mixtral-MoE, Qwen 2/3/2.5-VL, DeepSeek, Gemma 3, GLM-4, Phi-4, InternLM, MiniCPM-o, PaliGemma 등
학습 패러다임 전체 파라미터, 프리즈 튜닝, 8비트/4비트/2비트 QLoRA, LoRA+, LongLoRA, DoRA, 블록 확장, 지속 사전 학습, 지도 파인튜닝, 멀티모달(이미지/비디오/오디오) 파인튜닝, 보상 모델링, PPO/DPO/ORPO/KTO, EasyR1을 통한 강화 학습
옵티마이저 및 기법 GaLore, BAdam, APOLLO, Adam-mini, Muon, OFT/OFTv2, NEFTune, rsLoRA, RoPE 스케일링, FlashAttention-2, Unsloth, Liger-Kernel, KTransformers, SGLang/vLLM 추론 백엔드
하드웨어 지원 NVIDIA GPU, AMD ROCm, Ascend NPU, Intel Gaudi, SageMaker HyperPod, Docker 컨테이너, Colab 노트북
모니터링 TensorBoard, Weights & Biases, MLflow, SwanLab, 내장 LlamaBoard UI
배포 OpenAI 호환 REST API, Gradio UI, 고처리량 서빙을 위한 vLLM 또는 SGLang 워커
데이터 처리 내장 데이터셋 로더, 데이터 중심 파이프라인(DataFlow, DataFlex), 오염 방지를 위한 자동 패킹

일반적인 워크플로우(빠른 시작)

  1. 설치pip install llamafactory 또는 Docker 이미지 hiyouga/llamafactory를 풀합니다.
  2. 데이터 준비 – 학습 세트를 폴더에 배치하거나 제공된 예제(도구 사용용 glaive_toolcall_en 등)를 사용합니다. LlamaFactory는 ModelScope/Modelers Hub에서도 다운로드할 수 있습니다.
  3. 구성 생성 – 짧은 YAML 파일에서 모델, 데이터셋, 튜닝 방법(예: lora), 양자화 비트, 특수 기법(use_unsloth: true)을 선택합니다.
  4. 실행llamafactory train path/to/config.yaml(CLI) 또는 llamafactory gui로 GUI를 시작하고 몇 번의 클릭으로 작업을 시작합니다.
  5. 추적 – 메트릭이 LlamaBoard에 표시됩니다. 선택적으로 로그를 WandB/MLflow/SwanLab에 푸시합니다.
  6. 제공 – 학습 후 llamafactory serve path/to/ckpt.yaml을 실행하여 OpenAI 스타일 엔드포인트 또는 Gradio 채팅 인터페이스를 노출합니다.

누가 사용해야 하나요?

  • 연구자 – 상용구 학습 루프를 작성하지 않고 새로운 파인튜닝 레시피를 프로토타입해야 하는 사람.
  • 제품 팀 – 공개 LLM(예: Llama 3, Qwen 3)을 도메인 특화 코퍼스에 빠르게 적응시키려는 팀.
  • 교육자 및 학생 – RL-HF, 선호 학습, 멀티모달 LLM 실습을 위한 즉시 사용 가능한 환경을 찾는 사람.
  • 운영 엔지니어 – 클라우드 GPU, SageMaker 또는 온프레미스 NPU 클러스터에서 실행할 수 있는 컨테이너화되고 재현 가능한 파이프라인을 선호하는 사람.

설치 및 배포 옵션

  • Pippip install llamafactory(llamafactory CLI 추가).
  • Dockerdocker pull hiyouga/llamafactory 후 GPU 디바이스를 마운트하여 실행.
  • Colab / DSW – README에 링크된 즉시 사용 가능한 노트북으로 무료 티어 실험 가능.
  • vLLM / SGLang – 서빙 구성에서 infer_backend: vllm(또는 sglang)을 설정하면 추론 속도가 최대 2~3배 빨라집니다.

커뮤니티 및 생태계

  • 스타 및 활동 – >1k GitHub 스타, CI 테스트, 빈번한 릴리스.
  • 업계 채택 – Amazon, NVIDIA, Alibaba Cloud에서 프로덕션 파인튜닝에 사용.
  • 지원 채널 – Discord, WeChat 그룹, 공식 블로그, 증가하는 튜토리얼 목록.
  • 인용 – 학술적 크레딧을 위해 논문 "LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models"(arXiv)가 제공됩니다.

TL;DR

LlamaFactory는 다양한 하드웨어 백엔드에서 다양한 LLM을 파인튜닝하기 위한 포괄적인 제로 코드 플랫폼입니다. 최신 학습 기법을 번들로 제공하고 CLI와 사용자 친화적인 GUI를 모두 제공하며 실험 추적을 지원하고 결과 모델을 제공하기 위한 OpenAI 호환 API를 즉시 시작할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트