Hugging Face 藝術 AI 工具通訊第 1 期
Hugging Face 推出了專為創意 AI 打造的月度通訊,標誌著從 2024 年的基礎突破向 2025 年更具多模態特性的未來轉型。第一期總結了圖像生成架構的轉變,以及開源影片、音訊和 3D 生成工具的快速成長。
圖像生成:向擴散 Transformer (DiT) 的轉型
開源圖像生成已達到在文本生成圖像、編輯和受控生成方面能與閉源模型直接競爭的水平。2024 年的主要技術演進是從傳統的 Unet 架構轉向擴散 Transformer (DiT),並採用了流匹配 (flow matching) 目標。
技術演進與關鍵模型
高斯流匹配 (Gaussian flow matching) 提供了一種與先前擴散模型方法不同的網絡輸出向量場參數化。這種架構轉變最初由 Stability AI 透過 Stable Diffusion 3 發表,隨後出現了第一個開源 DiT 模型 HunyuanDiT。隨後的發佈包括 AuraFlow、Flux.1 和 Stable Diffusion 3.5,延續了這一趨勢。
Flux.1 [dev] 被視為一個關鍵的發佈,在多項基準測試中實現了超越 Midjourney v6.0 和 DALL·E 3 (HD) 等閉源模型的頂尖性能。
個性化與零樣本 (Zero-Shot) 技術
雖然早期的個性化依賴於 Textual Inversion、DreamBooth 和 LoRA 等微調方法,但 2024 年見證了「零樣本」技術的激增。這些技術允許從單張參考圖像生成高品質肖像,而無需進一步優化。此類別中的關鍵工具包括:
- IP adapter FaceID
- InstantID
- Photomaker
目前,許多個性化和受控生成工具仍基於 Stable Diffusion XL (SDXL),因為其組件的語義角色比新興的 DiT 架構更容易被理解。在 DiT 中識別這些角色預計將成為 2025 年的主要重點。
影片與音訊生成進展
雖然影片生成在成熟度方面落後於圖像生成,但受 OpenAI Sora 設定的預期影響,2024 年在能力方面實現了重大飛躍。
開源影片模型
已出現多個開源影片模型,包括 CogVideoX、Mochi、Allegro、LTX Video 和 HunyuanVideo。然而,這些模型在動作品質、連貫性和高計算需求方面面臨挑戰,通常需要在本地硬體使用時進行記憶體優化和量化。
音訊與音樂突破
音訊生成已從簡單的音效演進到帶有歌詞的完整歌曲。2024 年值得關注的發佈包括用於文本轉語音的 OuteTTS 和 IndicParlerTTS,以及用於語音識別的 OpenAI Whisper large v3 turbo。2025 年 1 月已經發佈了數個新模型:
- 文本轉語音 (Text-to-Speech): Kokoro, LLasa TTS, 和 OuteTTS 0.3。
- 音樂: JASCO 和 YuE。
YuE 被強調為一個用於生成完整歌曲的高性能開源音樂基礎模型,在 Apache 2.0 授權下實現了與 Suno 等閉源模型競爭的結果。
社群驅動的創意工具
開源生態系統基於現有流水線產出了一些專業工具:
- Flux Fine-tuning: 主要由 ostris 的 AI-toolkit 提供支持。
- Face to All: 將 Instant ID 與 ControlNet 深度約束和 SDXL LoRAs 結合,用於無需訓練的風格化肖像。
- Flux Style Shaping: 利用 Flux [dev] Redux 和 Flux [dev] Depth 進行風格遷移和錯視效果。
- 3D 生成: TRELLIS 為 3D 資產創建建立了高標準,隨後是 2025 年 1 月發佈的 Hunyuan 3D-2、SPAR3D 和 DiffSplat。
- 其他實用工具: 用於一致性重新打光的 IC-Light,用於動畫化靜態肖像的 Live Portrait 和 Face Poke,以及使用 SDXL Fill Pipeline 擴展圖像的 Diffusers Image Outpaint。
2025 年展望
Hugging Face 預期 2025 年將是開源在影片、動作和音訊模態上追趕的一年。隨著圖像生成達到自然平台期,重點預計將轉向更高效的計算、量化以及多模態的整合。