huggingface/finetrainers
Scalable and memory-optimized training of diffusion models
What it solves
Finetrainers 는 텍스트‑투‑비디오와 텍스트‑투‑이미지 생성에 특화된 확산 모델을 학습하고 파인튜닝하는 접근 가능한 방법을 제공합니다. 대규모 생성 모델을 특정 스타일이나 작업에 맞게 조정하는 과정을 단순화하고, 일반적으로 비디오 모델 학습에 수반되는 높은 메모리 요구 사항을 관리합니다.
How it works
이 라이브러리는 학습 효율성을 높이기 위해 다양한 학습 알고리즘과 최적화를 구현합니다. LoRA (Low‑Rank Adaptation)와 풀‑랭크 파인튜닝, 조건 제어 학습을 모두 지원합니다. VRAM 사용량을 줄이기 위해 메모리 효율적인 단일 GPU 학습, 가짜 FP8 가중치 캐스팅, 여러 어텐션 백엔드(flash, flex, sage, xformers 등)를 활용합니다. 또한 데이터셋 형식 자동 감지, 다중 해상도 버킷팅, 대규모 데이터셋을 위한 조건 및 잠재 변수 사전 계산 등 복잡한 데이터 파이프라인을 처리합니다.
Who it’s for
확산 모델을 다루는 개발자와 연구자를 위해 설계되었으며, LTX-Video, HunyuanVideo, CogVideoX, Wan, CogView4, Flux 와 같은 모델을 파인튜닝하기 위한 표준화되고 메모리 효율적인 프레임워크를 제공합니다.
Highlights
- Broad Model Support: Compatible with leading video and image diffusion models including LTX-Video, HunyuanVideo, and CogVideoX.
- Memory Optimizations: Supports FP8 training and gradient checkpointing to enable training on consumer-grade hardware (e.g., LTX-Video LoRA training starting at 5 GB VRAM).
- Distributed Training: Integrated support for DDP, FSDP-2, HSDP, and CP.
- Flexible Data Handling: Supports combined image/video datasets and chainable local or remote datasets.