Hugging Face Diffusers 첫 번째 주년 개요

Hugging Face는 🤗 Diffusers 라이브러리의 첫 번째 주년을 기념했으며, 이 라이브러리는 diffusion 모델에 대한 접근을 민주화하기 위해 만들어졌습니다. 라이브러리는 기본적인 텍스트-이미지 도구에서 사용자가 구성 요소를 맞춤 설정하거나 사전 구축된 파이프라인을 사용하여 다양한 생성형 AI 작업을 수행할 수 있는 모듈형 툴박스로 진화했습니다.

사진실감 및 모델 지원의 발전

🤗 Diffusers는 이미지 품질을 향상시키고 해부학적 오류와 같은 일반적인 아티팩트를 줄이기 위해 고충실도 모델을 통합했습니다.

  • DeepFloyd IF: 픽셀 수준에서 직접 작동하고 텍스트 인코딩에 대형 언어 모델을 활용하는 모듈형 확산 모델로, 더 높은 해상도를 위한 3x 업스케일링 프로세스를 특징으로 합니다.
  • Stable Diffusion XL (SDXL): Stability AI의 모델로, Stable Diffusion 2보다 훨씬 많은 매개변수를 가지고 있습니다. 프롬프트 준수를 위한 기본 모델과 고주파 콘텐츠 및 세부 사항을 위한 특화된 리파이너 모델을 사용합니다.

비디오, 3D, 오디오로의 확장

정적 이미지를 넘어, 라이브러리는 여러 모달리티로 기능을 확장했습니다:

  • Video Generation: VideoFusion 및 Text2Video-Zero와 같은 텍스트-비디오 파이프라인 지원을 포함합니다.
  • 3D Asset Generation: OpenAI의 Shap-E 모델을 통합했는데, 이 모델은 3D-텍스트 쌍을 인코딩하여 ShapEPipelineShapEImg2ImgPipeline을 통해 건축, 인테리어 디자인, 비디오 게임용 자산을 생성합니다.
  • Audio Support: 라이브러리는 시각 콘텐츠 외에도 오디오 생성 지원을 추가했습니다.

추론 최적화 및 속도

확산 모델의 반복적이고 시간 소모적인 특성을 해결하기 위해, 🤗 Diffusers는 여러 속도 및 메모리 최적화를 구현했습니다:

  • Consistency Models: OpenAI의 Consistency Models 통합을 통해 생성 속도가 크게 향상됩니다; 예를 들어, 현대 CPU에서 ConsistencyModelPipeline을 사용하여 256x256 이미지를 3/4초 만에 생성할 수 있습니다.
  • PyTorch 2.0 Integration: torch.compile()scaled_dot_product_attention() (SDPA)에 대한 일급 지원을 통해 추론 지연 시간을 두 배 이상 줄일 수 있습니다.
  • Hardware and Format Support: 라이브러리는 Apple Silicon용 ONNX, Core ML, 그리고 mps PyTorch 디바이스를 지원합니다.
  • Memory Management: 슬라이스드 어텐션, 피드-포워드 청킹, VAE 타일링, CPU/모델 오프로딩과 같은 기술 덕분에 소비자 GPU에서도 추론이 가능합니다.

매개변수 효율적인 파인튜닝 및 훈련

🤗 Diffusers는 Low-Rank Adaptation(LoRA) 구현을 통해 대형 모델의 파인튜닝 장벽을 낮췄습니다. LoRA는 메모리 소비를 줄여 더 빠른 파인튜닝을 가능하게 하며, 쉽게 공유할 수 있는 가벼운 가중치를 생성합니다. 라이브러리는 또한 DreamBooth, 텍스트 반전, 커스텀 디퓨전과 같은 다른 개인화 기법을 지원합니다.

윤리, 안전, 및 콘텐츠 무결성

책임감 있는 AI 사용을 촉진하기 위해, Hugging Face는 여러 안전 메커니즘을 도입했습니다:

  • Safety Checker: 부적절하거나 NSFW 콘텐츠를 추론 중에 표시하는 safety_checker 구성 요소입니다.
  • Invisible Watermarking: SDXL 모델은 AI 생성 이미지와 인간 생성 콘텐츠를 구분하는 데 도움이 되는 투명 워터마크를 포함하여 허위 정보의 위험을 완화합니다.
  • Ethical Charter: 모든 개발은 라이브러리 문서에서 이용 가능한 공식 윤리 헌장에 따라 지도됩니다.

커뮤니티 및 생태계 통합

라이브러리는 오픈소스 프로젝트와 상용 제품 모두에서广泛 채택되었습니다.

오픈소스 하이라이트

커뮤니티 기여로 Lama Cleaner(인페인팅), Grounded-SAM(컨트롤 가능한 이미지 편집), Stable-Dreamfusion(텍스트-3D)와 같은 도구가 개발되었습니다. 개발자들은 연구 코드와 비교했을 때 라이브러리의 전문적인 구현을 칭찬했으며, 한 기여자는 다음과 같이 언급했습니다:

‘‘ 🤗 Diffusers 구현은 종종 연구소의 코드가 아닙니다... 🤗 Diffusers는 몇 시간 내에 내 아이디어를 해킹하기에 쉬웠습니다.’’

상용 응용

회사들은 PlaiDay(협업 AI), Previs One(시네마틱 스토리보딩), Zust.AI(제품 사진 촬영), Dashtoon(시각 콘텐츠 제작), Virtual Staging AI(인테리어 디자인), 그리고 Hexo.AI(개인화 마케팅)와 같은 다양한 서비스를 구동하기 위해 🤗 Diffusers를 활용하고 있습니다.

주요 기술 기여 요약

300명 이상의 기여자가 코드베이스에 중요한 기능을 추가했으며, 포함 사항은 다음과 같습니다:

  • Model Editing: 모델의 암묵적 가정을 편집하는 파이프라인입니다.
  • LDM3D: 3D 이미지를 위한 특화된 확산 모델입니다.
  • DPMSolver: 추론 속도를 크게 향상시키는 개선 사항입니다.
  • Custom Diffusion: 소수의 대상 이미지를 사용하여 개인화된 이미지 생성을 위한 기법입니다.

Sources