Hugging Face의 컴퓨터 비전 현황

Hugging Face는 8개의 핵심 컴퓨터 비전 작업, 3,000개 이상의 모델, 그리고 100개가 넘는 데이터셋을 지원하도록 생태계를 확장했습니다. 이 확장은 Transformer 기반 및 전통적인 컨볼루션 아키텍처 전반에 걸쳐 추론, 학습, 배포를 위한 표준화된 도구를 제공함으로써 컴퓨터 비전을 민주화합니다.

핵심 비전 작업 및 모델 지원

Hugging Face는 8개의 핵심 컴퓨터 비전 작업을 지원하며, 각 작업마다 Hub에 최소 10개의 모델 체크포인트가 제공됩니다:

  • 이미지 분류
  • 이미지 분할
  • (제로샷) 객체 탐지
  • 비디오 분류
  • 깊이 추정
  • 이미지-이미지 합성
  • 조건 없는 이미지 생성
  • 제로샷 이미지 분류

이러한 핵심 작업 외에도, 생태계는 이미지-텍스트(OCR 및 이미지 캡션), 텍스트-이미지, 문서 질문 응답, 시각 질문 응답과 같은 교차 비전-언어 작업을 지원합니다. 라이브러리는 ViT, Swin, DETR과 같은 Transformer 기반 모델뿐만 아니라 ResNet, ConvNeXt, RegNet과 같은 순수 컨볼루션 아키텍처 등 다양한 아키텍처를 지원합니다.

추론 및 학습 프레임워크

간소화된 추론을 위한 파이프라인

Hugging Face Pipelines는 7개의 비전 작업에 대한 추론을 수행하기 위한 표준화된 인터페이스를 제공합니다. 이를 통해 실무자는 기본 모델에 관계없이 일관된 API를 사용해 깊이 추정이나 시각 질문 응답과 같은 복잡한 작업을 구현할 수 있습니다.

학습 및 파인튜닝

Transformers 라이브러리의 Trainer API는 이미지 분류, 이미지 분할, 비디오 분류, 객체 탐지 및 깊이 추정을 원활하게 지원합니다. Trainer에서 지원되지 않는 작업의 경우에도 모델에 손실 계산이 포함되어 있으면 파인튜닝이 가능합니다.

연구 및 맞춤형 사전 학습을 지원하기 위해 Hugging Face는 자체 지도 사전 학습 전략(예: MAE) 및 대조 이미지-텍스트 사전 학습(예: CLIP)을 위한 예제 스크립트를 제공합니다.

생태계 통합 및 도구

데이터셋 및 증강

Hugging Face Hub에는 ImageNet-1k, LAION-400M, COYO-700M 등을 포함한 100개 이상의 비전 데이터셋이 호스팅됩니다. 이들은 datasets 라이브러리와 통합되어 손쉽게 로드할 수 있으며, Kornia 및 Albumentations와 같은 증강 라이브러리와도 호환됩니다.

특수 라이브러리: timm 및 Diffusers

  • timm (PyTorch Image Models): Hugging Face는 timm 라이브러리의 200개 이상의 모델을 Hub에 통합했습니다.
  • Diffusers: 이 모듈식 툴박스는 자연어 입력으로부터 이미지를 생성하는 작업(예: Stable Diffusion)과 같은 사전 학습된 디퓨전 모델을 제공합니다.

AutoTrain을 통한 코드 없는 학습

AutoTrain은 최첨단 모델 학습을 위한 코드 없는 솔루션을 제공합니다. 현재는 컴퓨터 비전의 이미지 분류에 초점을 맞추고 있지만, 공개 리더보드를 통한 자동 모델 평가도 가능하게 합니다.

제로샷 비전 모델

Hugging Face는 작업별 학습 데이터 없이 비전 작업을 수행할 수 있는 여러 모델을 지원합니다:

  • CLIP: 자연어 프롬프트를 사용한 제로샷 이미지 분류를 가능하게 합니다.
  • OWL-ViT: 언어 조건 제로샷 객체 탐지와 이미지 조건 일샷 객체 탐지를 지원합니다.
  • CLIPSeg: 언어 조건 제로샷 및 이미지 조건 일샷 이미지 분할을 제공합니다.
  • X-CLIP: 비디오 분류에 대한 제로샷 일반화를 가능하게 합니다.

기술 철학 및 배포

통합 사용자 경험

모달리티에 관계없이 Hugging Face는 일관된 설계 철학을 적용합니다. 비전 모델은 데이터 준비를 위해 전처리기(예: NLP 토크나이저와 유사)를 활용하여, from_pretrained()를 통한 다운로드부터 push_to_hub()를 통한 업로드까지의 워크플로우가 PyTorch와 TensorFlow 전반에 걸쳐 동일하게 유지되도록 합니다.

배포 옵션

비전 모델은 Hugging Face Inference Endpoints를 통해 배포할 수 있으며, 이는 이미지 분류, 객체 탐지, 이미지 분할을 기본적으로 지원합니다. 다른 작업을 위해서는 맞춤형 핸들러를 사용할 수 있습니다. 또한 생태계는 Kubernetes 또는 Vertex AI에서 TF Serving을 사용해 TensorFlow 비전 모델을 배포하는 가이드를 제공합니다.

Sources