Hugging Face 艺术 AI 工具通讯 第 1 期
Hugging Face 推出了一份专注于创意 AI 的月度通讯,标志着从 2024 年的基础突破向 2025 年更多模态的未来过渡。第一期总结了图像生成架构的转变以及开源视频、音频和 3D 生成工具的快速增长。
图像生成:向 Diffusion Transformers (DiT) 的转变
开源图像生成已经达到一个点,在文本到图像生成、编辑和受控生成方面直接与闭源模型竞争。2024 年的主要技术演进是从传统的 Unet-based 架构过渡到 Diffusion Transformers (DiT) 并采用流匹配目标。
技术演进与关键模型
高斯流匹配提供了一种网络输出的向量场参数化,与之前的扩散模型方法不同。这一架构转变最初由 Stability AI 通过 Stable Diffusion 3 宣布,随后是第一个开源的 DiT 模型 HunyuanDiT。随后的版本包括 AuraFlow、Flux.1 和 Stable Diffusion 3.5 继续了这一趋势。
Flux.1 [dev] 被认为是一个关键版本,在各基准测试上实现了最先进的性能,超越了诸如 Midjourney v6.0 和 DALL·E 3 (HD) 等闭源模型。
个性化与零样本技术
虽然早期的个性化依赖于如 Textual Inversion、DreamBooth 和 LoRA 等微调方法,但 2024 年出现了零样本技术的激增。这些技术允许在不进行进一步优化的情况下,从单张参考图像生成高质量肖像。此类别的关键工具包括:
- IP adapter FaceID
- InstantID
- Photomaker
目前,许多个性化和受控生成工具仍然基于 Stable Diffusion XL (SDXL),因为其组件的语义角色相比更新的 DiT 架构更易被理解。识别这些角色在 DiTs 中预计将成为 2025 年的主要焦点。
视频和音频生成进展
虽然视频生成在成熟度方面落后于图像生成,但 2024 年在能力上实现了显著飞跃,这在很大程度上受到 OpenAI 的 Sora 所设定期望的影响。
开源视频模型
几个开源视频模型已经出现,包括 CogVideoX、Mochi、Allegro、LTX Video 和 HunyuanVideo。然而,这些模型在运动质量、一致性和高计算需求方面面临挑战,这通常需要进行内存优化和量化以在本地硬件上使用。
音乐和音频突破
音频生成已经从简单的音效发展到包含歌词的完整歌曲。2024 年的显著发布包括用于文本转语音的 OuteTTS 和 IndicParlerTTS,以及用于语音识别的 OpenAI Whisper large v3 turbo。2025 年 1 月已经发布了几个新模型:
- Text-to-Speech: Kokoro, LLasa TTS, and OuteTTS 0.3.
- Music: JASCO and YuE.
YuE 被突出为一个高性能的开源音乐基础模型,用于完整歌曲生成,在 Apache 2.0 许可证下实现了与闭源模型如 Suno 竞争的结果。
社区驱动的创意工具
开源生态系统基于现有管道产生了几种专门的工具:
- Flux Fine-tuning: 主要由 ostris 的 AI-toolkit 启用。
- Face to All: 将 Instant ID 与 ControlNet 深度约束和 SDXL LoRAs 结合,以实现无需训练的风格化肖像。
- Flux Style Shaping: 使用 Flux [dev] Redux 和 Flux [dev] Depth 进行风格转移和光学幻觉。
- 3D Generation: TRELLIS 为 3D 资产创建设定了高标准,随后是 2025 年 1 月的发布,包括 Hunyuan 3D-2、SPAR3D 和 DiffSplat。
- Other Utilities: 其他实用工具:IC-Light 用于一致的重新照明,Live Portrait 和 Face Poke 用于为静态肖像添加动画,以及 Diffusers Image Outpaint 使用 SDXL Fill Pipeline 扩展图像。
2025 年展望
Hugging Face 预计 2025 年将是开源在视频、运动和音频模态上赶上闭源的一年。随着图像生成达到自然平台,预计焦点将转向更高效的计算、量化以及多模态的集成。