huggingface/diffusers

🤗 Diffusers: State-of-the-art diffusion models for image, video, and audio generation in PyTorch.

What it solves

Diffusers 是一個函式庫,旨在提供簡易存取最先進的預訓練擴散模型,以產生影像、音訊與 3D 分子結構。它簡化了執行推論(產生內容)與訓練自訂擴散模型的流程,提供一套以可用性與可客製化為優先的模組化工具箱,而非嚴格的抽象層。

How it works

此函式庫圍繞三個核心元件構建:

  • Diffusion Pipelines:高階 API,讓使用者只需幾行程式碼即可執行複雜的推論任務。
  • Noise Schedulers:可互換的元件,控制擴散速度與輸出品質。
  • Pretrained Models:模組化的建構塊,可與 Scheduler 結合,打造自訂的端對端擴散系統。

Who it’s for

此函式庫適合想要使用預訓練擴散模型執行文字轉影像、影像轉影像、修補與超解析等任務的開發者與研究者,也適合想要從頭訓練或微調自己的擴散模型的人。

Highlights

  • Broad Modality Support:支援影像、音訊與 3D 分子結構生成。
  • Extensive Model Hub:可透過 Hugging Face Hub 存取超過 30,000 個 checkpoint。
  • Modular Architecture:允許使用者交換 Scheduler 與模型,以微調系統行為。
  • Optimization:提供降低記憶體使用與提升推論速度的指南與工具。
  • Wide Adoption:已被超過 14,000 個其他 GitHub 倉庫使用。