huggingface/diffusers

🤗 Diffusers: State-of-the-art diffusion models for image, video, and audio generation in PyTorch.

What it solves

Diffusers 是一个库,旨在提供简易访问最先进的预训练扩散模型,以生成图像、音频和 3D 分子结构。它简化了运行推理(生成内容)和训练自定义扩散模型的过程,提供一个以可用性和可定制性为优先的模块化工具箱,而非严格的抽象层。

How it works

该库围绕三个核心组件构建:

  • Diffusion Pipelines:高级 API,允许用户只用几行代码即可执行复杂的推理任务。
  • Noise Schedulers:可互换的组件,控制扩散速度和输出质量。
  • Pretrained Models:模块化的构建块,可与调度器结合创建自定义端到端扩散系统。

Who it’s for

它面向希望使用预训练扩散模型进行文本到图像、图像到图像、修复和超分辨率等任务的开发者和研究者,也适用于想从头训练或微调自己扩散模型的人。

Highlights

  • Broad Modality Support:支持图像、音频和 3D 分子结构生成。
  • Extensive Model Hub:通过 Hugging Face Hub 访问超过 30,000 个 checkpoint。
  • Modular Architecture:允许用户交换调度器和模型,以微调系统行为。
  • Optimization:包含降低内存消耗和提升推理速度的指南与工具。
  • Wide Adoption:已被超过 14,000 个其他 GitHub 仓库使用。