갤러리, 도서관, 기록관 및 박물관을 위한 Hugging Face Hub
Hugging Face Hub란 무엇인가
Hugging Face Hub는 사람들이 머신러닝 모델, 데이터셋 및 데모를 공유하고 액세스할 수 있는 중앙 저장소입니다. 이곳에는 190,000개 이상의 머신러닝 모델, 33,000개의 데이터셋, 그리고 100,000개 이상의 머신러닝 애플리케이션 및 데모가 호스팅되어 있습니다. 이러한 리소스는 사전 학습된 언어 모델, 텍스트, 이미지 및 오디오 분류, 객체 탐지 및 생성 모델을 포함하여 광범위한 작업과 도메인을 다룹니다.
Hugging Face Hub에서 무엇을 찾을 수 있나요
Hub는 다양한 모달리티와 작업을 지원하는 머신러닝 모델, 데이터셋 및 Spaces에 대한 액세스를 제공합니다.
Models
Hub는 다양한 작업과 도메인을 다루는 머신러닝 모델에 대한 액세스를 제공합니다. 많은 머신러닝 라이브러리가 Hub와 통합되어 있어 사용자가 해당 라이브러리를 통해 모델을 직접 사용하거나 공유할 수 있습니다.
Datasets
Hub에는 30,000개 이상의 데이터셋이 호스팅되어 있습니다. 이러한 데이터셋은 텍스트, 이미지, 오디오 및 멀티모달 데이터셋을 포함하여 다양한 도메인과 모달리티를 다루며, 머신러닝 모델을 훈련하고 평가하는 데 매우 유용합니다.
Spaces
Hugging Face Spaces는 사용자가 머신러닝 데모와 애플리케이션을 호스팅할 수 있는 플랫폼입니다. Spaces는 모델 예측을 탐색하는 간단한 데모부터 더 복잡한 애플리케이션까지 다양합니다. 사용자는 Gradio 및 Streamlit 애플리케이션을 호스팅하거나 커스텀 Docker 이미지를 사용할 수 있으며, Docker 템플릿을 사용하여 Argilla 및 Label Studio와 같은 인기 도구의 호스팅 버전을 빠르게 생성할 수 있습니다.
Hub에서 관련 모델을 찾는 방법
사용자는 Hub를 작업(task) 및 언어로 필터링하여 자신의 목표에 맞는 공개 공유 모델을 찾을 수 있습니다.
예를 들어, 메타데이터가 최소한인 디지털화된 노르웨이 문서를 작업할 때, 개체명 인식(NER) 모델은 텍스트에 언급된 위치를 식별하는 데 도움이 될 수 있습니다. 사용자는 NER 모델을 포함하는 token-classification 작업으로 모델을 필터링한 다음, 언어를 Norwegian으로 추가 필터링하여 범위를 좁힐 수 있습니다. 이러한 모델 중 다수는 사용자가 자신의 데이터로 성능을 테스트할 수 있는 모델 위젯을 포함하고 있습니다. 모델을 선택한 후, 사용자는 "use in Transformers" 버튼을 클릭하여 Transformers 라이브러리로 모델을 로드하는 코드를 얻거나, "deploy" 버튼을 클릭하여 API를 통해 모델을 호스팅하는 옵션을 탐색할 수 있습니다.
단계별 안내: Hub에 GLAM 데이터셋 추가하기
Hub에 GLAM 데이터셋을 추가하는 작업은 코드를 작성하지 않고도 브라우저 인터페이스를 통해 수행할 수 있습니다.
새 데이터셋 저장소 만들기
첫 번째 단계는 Hub 우측 상단의 드롭다운 메뉴에서 "New Dataset" 버튼을 클릭하고, 저장소 이름을 선택하고, 선택적으로 소유 기관을 지정하고, 라이선스를 지정하는 것입니다.
파일 업로드
저장소를 만든 후, 사용자는 "Files" 탭 아래의 "Add file"을 클릭하고 업로드할 데이터 파일을 선택하여 단일 또는 여러 파일을 업로드할 수 있습니다. 파일이 선택되면 변경 사항을 커밋하여 업로드를 완료합니다.
메타데이터 추가
데이터셋을 검색 가능하게 만들려면 메타데이터를 추가하는 것이 중요합니다. 사용자는 Metadata UI 에디터를 사용하여 라이선스, 언어, 태그 및 기타 필드를 지정하여 메타데이터를 편집할 수 있습니다. 또한 사용자는 데이터셋 카드 역할을 하는 README.md 파일에 데이터셋의 구성, 강점 및 약점을 개략적으로 설명해야 합니다. Hub는 유용한 정보를 위한 프롬프트를 제공하는 템플릿 데이터셋 카드를 제공합니다.
데이터셋 미리보기
업로드 후 Hub는 데이터셋의 미리보기를 제공하여 사용자가 콘텐츠를 더 잘 이해할 수 있도록 돕습니다.
데이터셋 공유의 다른 방법
사용자는 특정 사용 사례에 적합할 수 있는 대안적인 접근 방식에 대해 데이터셋 문서를 참조할 수 있습니다.
GLAM 기관이 Hub를 사용해야 하는 이유
갤러리, 도서관, 기록관 및 박물관은 Hub에 기여할 몇 가지 동기를 가지고 있습니다.
- 새로운 관객에게 노출: Hub는 머신러닝 및 AI 분야에서 일하는 사람들의 중앙 목적지이므로, 컬렉션을 공유하면 이 관객들에게 노출되고 협업 기회가 열립니다.
- 커뮤니티: Hub의 커뮤니티 기능은 사용자가 질문을 하고 공유된 자료와 소통할 수 있게 하여, 사람들이 서로의 작업을 기반으로 발전시키고 해당 분야에서 머신러닝 사용의 장벽을 낮출 수 있게 합니다.
- 훈련 데이터의 다양성: 도메인 특화 데이터셋을 공유하면 GLAM 데이터에 대한 관련 훈련 데이터 부족 문제를 해결하는 데 도움이 되어, 실제 컬렉션에 대한 모델 성능을 향상시킵니다.
- 기후 변화: 훈련된 모델을 공유하면 노력의 중복을 줄일 수 있으며, 이는 결과적으로 머신러닝 모델 훈련과 관련된 탄소 발자국을 낮출 수 있습니다.
Hugging Face Hub의 활용 사례
여러 GLAM 관련 프로젝트가 이미 모델, 데이터셋 및 데모를 공유하기 위해 Hub를 사용하고 있습니다.
BigLAM
BigScience 프로젝트의 이니셔티브인 BigLAM은 접근성을 높이기 위해 30개 이상의 GLAM 관련 데이터셋을 Hub를 통해 사용할 수 있도록 했습니다.
Nasjonalbiblioteket AI Lab
노르웨이 국립도서관의 AI 랩은 Hub를 적극적으로 사용하여 약 120개의 모델, 23개의 데이터셋 및 6개의 머신러닝 데모를 공유하고 있습니다. 여기에는 국립도서관의 노르웨이어 텍스트로 훈련된 언어 모델과 사미(Sámi)어로 훈련된 Whisper 음성-텍스트 변환 모델이 포함됩니다.
Smithsonian Institution
Smithsonian은 아마존 어종을 식별하도록 훈련된 두 개의 머신러닝 모델을 보여주는 Hugging Face Spaces 호스팅 애플리케이션을 공유했습니다. 이 프로젝트는 아마존 어종 수의 더 정확한 측정을 위한 도구를 커뮤니티에 제공하는 것을 목표로 하며, Spaces 데모는 이러한 도구를 사용하려는 사람들의 장벽을 낮춰줍니다.
갤러리, 도서관, 기록관 및 박물관을 위한 Hub 기능
Hub에는 GLAM 기관에 특히 유용한 기능이 포함되어 있습니다.
- Organizations: 사용자는 Hub에 조직을 생성하여 기관의 유물을 전용 공간에 공유할 수 있습니다.
- Minting DOIs: Hub는 모델, 데이터셋 및 데모에 대해 디지털 객체 식별자(DOI)를 발행하는 것을 지원하여 저널, 컨퍼런스 및 후원자가 종종 요구하는 영구 식별자를 제공합니다.
- Usage tracking: 사용자는 데이터셋 및 모델의 월간 다운로드 통계 또는 총 누적 다운로드 수를 확인하여 영향력을 입증할 수 있습니다.
- Script-based dataset sharing: 데이터셋이 이미 다른 곳에 호스팅되어 있는 경우, 사용자는 데이터셋 로딩 스크립트를 사용하여 Hub를 통해 액세스를 제공할 수 있습니다.
- Model and dataset gating: Hub는 게이팅(gating)을 지원하여 소유자가 필요할 때 모델과 데이터셋에 액세스 제어를 추가할 수 있도록 합니다.
Hub 사용 중 도움이 필요하면 어떻게 하나요?
사용자는 Hub 문서, 데이터셋 공유 가이드 및 Transformers 모델 공유 가이드에서 자세한 정보를 찾을 수 있습니다. 지원이 필요한 경우 Hub는 사용자가 질문을 하고 지원을 받을 수 있는 토론 포럼과 Discord 커뮤니티를 제공합니다.