huggingface/finetrainers

Scalable and memory-optimized training of diffusion models

What it solves

Finetrainers は、テキストから動画およびテキストから画像生成を対象とした拡散モデルのトレーニングとファインチューニングを、誰でも利用しやすい方法で提供します。大規模生成モデルを特定のスタイルやタスクに適応させるプロセスを簡素化し、動画モデルのトレーニングに伴う高いメモリ要件を管理します。

How it works

このライブラリは、トレーニングを効率化するためのさまざまなアルゴリズムと最適化を実装しています。LoRA(Low-Rank Adaptation)とフルランクのファインチューニング、条件制御トレーニングの両方をサポートします。VRAM 使用量を削減するために、メモリ効率の高い単一 GPU トレーニング、偽 FP8 重みキャスト、複数のアテンションバックエンド(flash、flex、sage、xformers など)を利用します。また、データセット形式の自動検出、マルチ解像度バケッティング、大規模データセット向けの条件と潜在変数の事前計算など、複雑なデータパイプラインも処理します。

Who it’s for

拡散モデルを扱う開発者や研究者向けに設計されており、LTX-Video、HunyuanVideo、CogVideoX、Wan、CogView4、Flux などのモデルをファインチューニングするための標準化されたメモリ効率の高いフレームワークを提供します。

Highlights

  • Broad Model Support: Compatible with leading video and image diffusion models including LTX-Video, HunyuanVideo, and CogVideoX.
  • Memory Optimizations: Supports FP8 training and gradient checkpointing to enable training on consumer-grade hardware (e.g., LTX-Video LoRA training starting at 5 GB VRAM).
  • Distributed Training: Integrated support for DDP, FSDP-2, HSDP, and CP.
  • Flexible Data Handling: Supports combined image/video datasets and chainable local or remote datasets.