Hugging Face AI Tools アートニュースレター 第1号

Hugging FaceはクリエイティブAIに特化した月刊ニュースレターを導入し、2024年の基礎的ブレイクスルーから2025年のよりマルチモーダルな未来への移行を示しています。最初の号では、画像生成アーキテクチャのシフトとオープンソースのビデオ、オーディオ、3D生成ツールの急速な成長をまとめています。

画像生成: Diffusion Transformers (DiT) へのシフト

オープンソースの画像生成は、テキストから画像への生成、編集、制御された生成においてクローズドソースモデルと直接競合できる点に達しています。2024年の主要な技術的進化は、従来のUnetベースアーキテクチャからDiffusion Transformers (DiT)への移行と、フローマッチング目的の採用でした。

技術的進化と主要モデル

ガウスフローマッチングは、ネットワーク出力のベクトル場パラメトリゼーションを提供し、以前の拡散モデル手法とは異なります。このアーキテクチャのシフトは、まずStability AIによってStable Diffusion 3で発表され、続いて最初のオープンソースDiTモデルであるHunyuanDiTが続きました。その後のAuraFlow、Flux.1、Stable Diffusion 3.5などのリリースもこの傾向を継続しています。

Flux.1 [dev]は、さまざまなベンチマークでMidjourney v6.0やDALL·E 3 (HD)などのクローズドソースモデルを上回る最先端のパフォーマンスを達成した重要なリリースとして注目されています。

パーソナライゼーションとゼロショット技法

初期のパーソナライゼーションは、Textual Inversion、DreamBooth、LoRAなどのファインチューニング方法に依存していましたが、2024年には「ゼロショット」技法が急増しました。これらは、さらに最適化を行わずに単一の参照画像から高品質なポートレート生成を可能にします。このカテゴリの主要ツールは以下の通りです:

  • IP adapter FaceID
  • InstantID
  • Photomaker

現在、多くのパーソナライゼーションと制御生成ツールは、そのコンポーネントのセマンティックな役割が新しいDiTアーキテクチャよりもよく理解されているため、Stable Diffusion XL (SDXL)ベースのままです。これらの役割をDiT内で特定することは、2025年の主要な焦点となることが期待されています。

ビデオとオーディオ生成の進展

ビデオ生成は画像生成に比べて成熟度では遅れをとっていますが、2024年はOpenAIのSoraが設定した期待により大きな飛躍を遂げました。

オープンビデオモデル

CogVideoX、Mochi、Allegro、LTX Video、HunyuanVideoなどのいくつかのオープンソースビデオモデルが登場しました。ただし、これらのモデルは動画の品質、一貫性、高い計算要件において課題に直面しており、ローカルハードウェアでの使用にはメモリ最適化と量子化がしばしば必要となります。

オーディオと音楽のブレークスルー

オーディオ生成は単純な効果音から歌詞付きのフルソングへと進化しました。2024年の注目すべきリリースには、テキスト読み上げ向けのOuteTTSとIndicParlerTTS、音声認識向けのOpenAIのWhisper large v3 turboがあります。2025年1月にはすでにいくつかの新しいモデルがリリースされています:

  • テキスト読み上げ: Kokoro, LLasa TTS,およびOuteTTS 0.3。
  • 音楽: JASCOとYuE。

YuEは、Apache 2.0ライセンスの下でSunoなどのクローズドソースモデルと競合する結果を出すフルソング生成のための高性能なオープンソース音楽ファウンデーションモデルとして強調されています。

コミュニティ主導のクリエイティブツール

オープンソースエコシステムは、既存のパイプラインに基づいていくつかの専門ツールを生み出しました:

  • Flux Fine-tuning: ostrisによるAI-toolkitによって主に可能になりました。
  • Face to All: Instant IDとControlNetの深度制約およびSDXL LoRAsを組み合わせ、トレーニング不要のスタイライズドポートレートを実現します。
  • Flux Style Shaping: Flux [dev] ReduxとFlux [dev] Depthを利用してスタイル転送と光学的錯覚を行います。
  • 3D Generation: TRELLISは3Dアセット作成の高い基準を確立し、2025年1月のリリースであるHunyuan 3D-2、SPAR3D、DiffSplatがこれに続きました。
  • その他のユーティリティ: IC-Lightによる一貫した再照明、Live PortraitとFace Pokeによる静止ポートレートのアニメーション、およびDiffusers Image OutpaintによるSDXL Fill Pipelineを使用した画像の拡張。

2025年の展望

Hugging Faceは、2025年がオープンソースがビデオ、動き、オーディオのモダリティで追いつく年になると予測しています。画像生成が自然な plateau に達すると、焦点はより効率的なコンピューティング、量子化、および複数のモダリティの統合にシフトすると見込まれています。

Sources