Hugging Face AI Tools for Art 뉴스레터 제1호

Hugging Face는 창의적인 AI를 위한 월간 뉴스레터를 출시하며, 2024년의 기초적인 돌파구에서 2025년의 더욱 멀티모달한 미래로의 전환을 알렸습니다. 첫 번째 호에서는 이미지 생성 아키텍처의 변화와 오픈 소스 비디오, 오디오 및 3D 생성 도구의 급격한 성장을 요약합니다.

이미지 생성: Diffusion Transformers (DiT)로의 전환

오픈 소스 이미지 생성은 텍스트-이미지 생성, 편집 및 제어된 생성 분야에서 폐쇄형 모델과 직접 경쟁할 수 있는 수준에 도달했습니다. 2024년의 주요 기술적 진화는 전통적인 Unet 기반 아키텍처에서 Diffusion Transformers (DiT)로의 전환과 flow matching 목적 함수의 채택이었습니다.

기술적 진화 및 주요 모델

Gaussian flow matching은 이전의 확산 모델(diffusion model) 방식과는 다른 네트워크 출력의 벡터장 매개변수화를 제공합니다. 이러한 아키텍처 변화는 Stability AI가 Stable Diffusion 3를 통해 처음 발표했으며, 이후 첫 번째 오픈 소스 DiT 모델인 HunyuanDiT가 뒤를 이었습니다. AuraFlow, Flux.1, Stable Diffusion 3.5를 포함한 후속 릴리스들이 이러한 추세를 이어갔습니다.

Flux.1 [dev]는 중요한 릴리스로 주목받고 있으며, 다양한 벤치마크에서 Midjourney v6.0 및 DALL·E 3 (HD)와 같은 폐쇄형 모델을 능가하는 최첨단 성능을 달성했습니다.

개인화 및 Zero-Shot 기술

초기 개인화 기술이 Textual Inversion, DreamBooth, LoRA와 같은 미세 조정(fine-tuning) 방식에 의존했던 반면, 2024년에는 "zero-shot" 기술이 급증했습니다. 이러한 기술은 추가적인 최적화 없이 단일 참조 이미지만으로 고품질의 초상화를 생성할 수 있게 해줍니다. 이 카테고리의 주요 도구는 다음과 같습니다:

  • IP adapter FaceID
  • InstantID
  • Photomaker

현재 많은 개인화 및 제어된 생성 도구들은 Stable Diffusion XL (SDXL)을 기반으로 유지되고 있는데, 이는 새로운 DiT 아키텍처보다 SDXL 구성 요소의 의미적 역할이 더 잘 이해되어 있기 때문입니다. DiT 내에서 이러한 역할을 식별하는 것이 2025년의 주요 초점이 될 것으로 예상됩니다.

비디오 및 오디오 생성의 진전

비디오 생성은 성숙도 측면에서 이미지 생성보다 뒤처져 있지만, 2024년은 OpenAI의 Sora가 설정한 기대치에 힘입어 역량 면에서 큰 도약을 이룬 해였습니다.

오픈 비디오 모델

CogVideoX, Mochi, Allegro, LTX Video, HunyuanVideo를 포함한 여러 오픈 소스 비디오 모델이 등장했습니다. 그러나 이러한 모델들은 움직임의 품질, 일관성 및 높은 계산 요구 사항이라는 과제에 직면해 있으며, 이는 로컬 하드웨어 사용을 위한 메모리 최적화 및 양자화(quantization)를 필요로 하는 경우가 많습니다.

오디오 및 음악의 혁신

오디오 생성은 단순한 효과음에서 가사가 포함된 전체 곡으로 진화했습니다. 2024년의 주목할 만한 릴리스로는 텍스트-음성 변환을 위한 OuteTTS 및 IndicParlerTTS, 음성 인식을 위한 OpenAI의 Whisper large v3 turbo가 있습니다. 2025년 1월에는 이미 다음과 같은 여러 신규 모델이 출시되었습니다:

  • Text-to-Speech: Kokoro, LLasa TTS, OuteTTS 0.3.
  • Music: JASCO 및 YuE.

YuE는 전체 곡 생성을 위한 고성능 오픈 소스 음악 파운데이션 모델로 강조되며, Apache 2.0 라이선스 하에 Suno와 같은 폐쇄형 모델과 경쟁할 만한 결과를 보여줍니다.

커뮤니티 주도 크리에이티브 도구

오픈 소스 생태계는 기존 파이프라인을 기반으로 한 여러 전문 도구를 탄생시켰습니다:

  • Flux Fine-tuning: 주로 ostris의 AI-toolkit에 의해 가능해졌습니다.
  • Face to All: 학습이 필요 없는 스타일화된 초상화를 위해 Instant ID를 ControlNet 깊이 제약 및 SDXL LoRA와 결합합니다.
  • Flux Style Shaping: 스타일 전이 및 착시 효과를 위해 Flux [dev] Redux 및 Flux [dev] Depth를 활용합니다.
  • 3D Generation: TRELLIS가 3D 에셋 생성의 높은 기준을 세웠으며, 이어 2025년 1월에 Hunyuan 3D-2, SPAR3D, DiffSplat 등이 출시되었습니다.
  • 기타 유틸리티: 일관된 재조명을 위한 IC-Light, 정지된 초상화를 애니메이션화하는 Live Portrait 및 Face Poke, 그리고 SDXL Fill 파이프라인을 사용하여 이미지를 확장하는 Diffusers Image Outpaint가 있습니다.

2025년 전망

Hugging Face는 2025년이 비디오, 움직임 및 오디오 모달리티 분야에서 오픈 소스가 따라잡는 해가 될 것으로 예상합니다. 이미지 생성이 자연스러운 정체기에 도달함에 따라, 초점은 더욱 효율적인 컴퓨팅, 양자화 및 다중 모달리티 통합으로 이동할 것으로 보입니다.

Sources