bghira/SimpleTuner

A general fine-tuning kit geared toward image/video/audio diffusion models.

解決的問題

SimpleTuner 簡化了大規模生成模型的微調過程。它提供了一個統一且易於使用的訓練管道,用於訓練影像、影片和音訊模型,減少對複雜手動設定與調校的需求,同時支援大量現代模型架構。

如何運作

SimpleTuner 作為一個全面的訓練框架,整合了多種優化技術與硬體加速。它支援使用 DeepSpeed 和 FSDP2 在多個 GPU 上進行分散式訓練,以提升記憶體效率,並提供直覺的 Web UI 來管理訓練生命週期。系統可處理從小型資料集到數十億筆樣本的各種資料集,並可直接從 S3 等雲端儲存中進行訓練。

適用對象

專為希望在無需精通底層訓練程式碼的情況下微調生成模型的 AI 研究人員、開發者與藝術家設計。也適用於需要多使用者編排、角色基礎存取控制與工作排程管理之企業團隊。

主要特色

  • 廣泛的模型支援:相容大量架構,包括 Flux、Stable Diffusion、Hunyuan Video 及多種音訊生成模型。
  • 多模態能力:單一管道支援影像、影片與音訊生成模型的訓練。
  • 企業級編排:包含工作節點編排、SSO 整合與團隊環境下的細粒度角色存取控制。
  • 記憶體優化:支援量化(int8/fp8/nf4)與梯度檢查點,使許多模型可在消費級 GPU(16G–24G)上訓練。
  • 進階訓練工具:支援如寬高比桶、LoRA 的概念滑桿與 TREAD 的令牌級丟棄等功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案