기업용 기반 모델을 위한 Snorkel AI와 Hugging Face 통합

TL;DR

Snorkel AI와 Hugging Face가 파트너십을 맺어 Hugging Face Inference Endpoints를 Snorkel Flow 플랫폼에 통합했습니다. 이 협업을 통해 기업은 방대한 오픈소스 기반 모델 라이브러리에 손쉽게 접근하고, Snorkel의 데이터 중심 프로그래밍 라벨링을 활용해 특정 비즈니스 사용 사례에 맞게 모델을 조정할 수 있어, 대규모 모델을 호스팅하고 파인튜닝하는 비용과 복잡성을 크게 줄일 수 있습니다.

Snorkel Flow를 통한 기반 모델 맞춤화

Snorkel Flow는 기업이 반복적인 "감지 및 수정" 개발 프로세스를 통해 특정 프로덕션 사용 사례에 맞게 기반 모델을 맞춤화하도록 지원합니다. 이 워크플로우는 선택한 기반 모델이 기업 데이터에 대해 제공하는 "그대로 사용 가능한" 예측을 검토하는 단계에서 시작되며, 이는 초기 학습 라벨 역할을 합니다.

사용자는 모델의 오류 유형을 식별하고, 휴리스틱이나 프롬프트를 활용한 프로그래밍 라벨링으로 이를 수정합니다. 그런 다음 기본 기반 모델을 업데이트된 라벨로 파인튜닝하고 재평가합니다. 이 사이클은 모델이 배포에 필요한 품질에 도달할 때까지 반복됩니다.

Hugging Face 모델 및 인프라 통합

Snorkel AI는 Hugging Face를 활용해 150,000개가 넘는 오픈소스 모델에 대한 접근성을 제공하며, BioBERT, SciBERT와 같은 도메인 특화 모델도 포함합니다. 이 다양성 덕분에 사용자는 비즈니스 요구에 가장 적합한 기본 모델을 선택해 초기 예측과 파인튜닝을 빠르게 시작할 수 있습니다.

이 모델들의 인프라와 비용을 관리하기 위해 Snorkel AI는 Hugging Face Inference Endpoints를 사용합니다. 이 서비스는 다음과 같은 주요 기술적 장점을 제공합니다:

  • Rapid Deployment: 몇 번의 클릭만으로 모델 API를 생성해 즉시 사용할 수 있습니다.
  • Cost Efficiency: "일시 정지 및 재개" 기능을 통해 클라이언트가 필요할 때만 모델 API를 활성화하고, 사용하지 않을 때는 슬립 상태로 전환해 비용을 절감합니다.
  • Flexible Configuration: 클라우드 제공업체 선택 및 보안 수준 옵션을 제공해 기업 요구사항을 충족합니다.

AI 개발에 대한 기업 차원의 함의

이 파트너십은 기업이 기반 모델을 도입할 때 직면하는 주요 장벽—자체 호스팅 비용, 처음부터 모델을 학습할 리소스 부족, 그리고 거버넌스 없이 상용 모델을 프로덕션에 적용할 위험—을 해결합니다.

Snorkel의 자동 데이터 라벨링과 Hugging Face의 오픈소스 생태계를 결합함으로써, 기업은 수동 파인튜닝에 일반적으로 필요한 방대한 데이터셋 없이도 데이터 중심 AI 애플리케이션을 구축할 수 있습니다. Hugging Face 공동 설립자이자 CEO인 Clement Delangue는 다음과 같이 말했습니다:

"Snorkel AI와 Hugging Face Inference Endpoints를 통해 기업은 오픈소스를 핵심으로 하는 데이터 중심 AI 애플리케이션을 가속화할 수 있습니다."

이 통합은 조직이 고객 경험과 사용 사례에 맞춘 솔루션을 직접 제어하면서도 오픈소스 커뮤니티의 최신 발전을 활용할 수 있게 합니다.

Sources