Hugging Face Diffusers 首周年概览
Hugging Face 已庆祝 🤗 Diffusers 库的第一周年,该库的创建旨在 democratize access to diffusion models(使扩散模型的访问民主化)。该库已经从一个基本的文本到图像工具发展成为一个模块化工具箱,使用户能够自定义组件或使用预构建的管道来完成广泛的生成式 AI 任务。
在逼真度和模型支持方面的进展
🤗 Diffusers 已集成高保真模型以提高图像质量并减少常见的如解剖错误之类的伪影。
- DeepFloyd IF: 一个在像素级别直接运行的模块化扩散模型,利用大型语言模型进行文本编码,具有 3x 上采样过程以获得更高分辨率。
- Stable Diffusion XL (SDXL): 一个来自 Stability AI 的模型,其参数数量显著多于 Stable Diffusion 2。它使用基础模型来遵循提示,并使用专门的细化模型来处理高频内容和细节。
扩展到视频、3D 和音频
除了静态图像,该库已将其功能扩展到多种模态:
- Video Generation: 支持包括 VideoFusion 和 Text2Video-Zero 的文本到视频管道。
- 3D Asset Generation: 集成了 OpenAI 的 Shap-E 模型,该模型编码 3D-文本对以通过
ShapEPipeline和ShapEImg2ImgPipeline生成用于建筑、室内设计和视频游戏的资产。 - Audio Support: 该库除了视觉内容外,还添加了对音频生成的支持。
推理优化与速度
为了应对扩散模型的迭代和耗时特性,🤗 Diffusers 已实施了多种速度和内存优化:
- Consistency Models: 集成 OpenAI 的 Consistency Models 使得生成速度显著提升;例如,使用
ConsistencyModelPipeline在现代 CPU 上可以在 3/4 秒内生成一个 256x256 的图像。 - PyTorch 2.0 Integration: 一流地支持
torch.compile()和scaled_dot_product_attention()(SDPA)可将推理延迟降低超过一倍。 - Hardware and Format Support: 该库支持 ONNX、Core ML 以及用于 Apple Silicon 的
mpsPyTorch 设备。 - Memory Management: 诸如切片注意力、前馈分块、VAE 平铺以及 CPU/模型卸载等技术使得在消费级 GPU 上进行推理成为可能。
参数高效的微调与训练
🤗 Diffusers 通过实施低秩适应(LoRA)降低了微调大型模型的门槛。LoRA 允许在消耗更少内存的情况下进行更快的微调,并生成易于共享的轻量级权重。该库还支持其他个性化技术,包括 DreamBooth、文本反演和自定义扩散。
伦理、安全与内容完整性
为了促进负责任的 AI 使用,Hugging Face 已引入多种安全机制:
- Safety Checker: 一个
safety_checker组件,在推理过程中标记不适当或 NSFW 内容。 - Invisible Watermarking: SDXL 模型包含一个不可见水印,以帮助区分 AI 生成的图像与人类创建的内容,从而减少虚假信息的风险。
- Ethical Charter: 所有开发均受库文档中提供的正式伦理章程的指导。
社区与生态系统集成
该库在开源项目和商业产品中都获得了广泛采用。
开源亮点
社区贡献促成了 Lama Cleaner(修复)、Grounded-SAM(可控图像编辑)和 Stable-Dreamfusion(文本到 3D)等工具的开发。开发者们赞赏该库相比研究代码具有专业的实现,一位贡献者指出:
‘‘ 🤗 Diffusers 的实现通常不仅仅是来自研究实验室的代码... 🤗 Diffusers 对我来说非常易用,我可以在几个小时内 hack 我的想法。’‘
商业应用
公司们正在使用 🤗 Diffusers 为各种服务提供动力,包括 PlaiDay(协作 AI)、Previs One(电影分镜脚本)、Zust.AI(产品摄影)、Dashtoon(视觉内容创作)、Virtual Staging AI(室内设计)和 Hexo.AI(个性化营销)。
关键技术贡献摘要
超过 300 名贡献者向代码库添加了关键特性,包括:
- Model Editing: 一个用于编辑模型隐含假设的管道。
- LDM3D: 一个专门用于 3D 图像的扩散模型。
- DPMSolver: 显著提高推理速度的改进。
- Custom Diffusion: 一种使用少量主题图像进行个性化图像生成的技术。