ostris/ai-toolkit
The ultimate training toolkit for finetuning diffusion models
解決する課題
AI Toolkit は、コンシューマ向けハードウェアでも拡散モデルの訓練を手軽に行えるよう設計されたオールインワンの訓練スイートです。画像、動画、音声モデルのファインチューニングプロセスを簡素化し、データセットの準備からモデルの保存までを網羅する包括的なツールセットを提供します。
仕組み
このツールキットは、コマンドラインインターフェース (CLI) とウェブベースのグラフィカルユーザーインターフェース (GUI) の両方を提供し、訓練ジョブを管理します。ユーザーは YAML ファイルで訓練実行を設定でき、モデルタイプ、ネットワーク設定(LoRA や LoKr など)やデータセットパスを指定します。システムは画像のリサイズとアスペクト比バケティングを自動で処理し、手動でのトリミングが不要になります。
対象者
自分のハードウェアや RunPod、Modal といったクラウドプロバイダー上で、FLUX、SDXL、Wan 2.1 などの拡散モデルをファインチューニングしたい AI アーティスト、開発者、研究者向けです。
ハイライト
- 幅広いモデルサポート:FLUX ファミリー、SDXL、Wan 2.1 を含む、画像、指示/編集、動画、音声の拡散モデルを多数サポート。
- 柔軟な訓練方法:LoRA と LoKr の訓練をサポートし、
only_if_containsとignore_if_containsフィルタで特定のレイヤーを対象または除外可能。 - ユーザーフレンドリーなインターフェース:ジョブの開始・停止・モニタリングを行うウェブ UI を提供し、オプションで認証を設定して安全なリモートアクセスを実現。
- ハードウェアへのアクセシビリティ:コンシューマ向け GPU に最適化され、クラウド GPU プロバイダーとの統合も容易。
- 簡素化されたデータセット処理:画像のダウンサンプリングとアスペクト比バケティングを自動で管理し、様々な比率に対応。