Hugging Face Summer 2021 Update
TL;DR
Hugging Face는 2021년 여름, ML 데모 호스팅을 위한 Spaces 도입, Hub에 TensorBoard 및 평가 지표 통합, 하드웨어 가속을 위한 Optimum 라이브러리 출시를 통해 생태계를 확장했습니다. 이러한 업데이트는 JAX/Flax 지원 확대 및 새로운 tokenizer-free 모델과 함께 최첨단 머신러닝 모델의 배포 및 공유 장벽을 낮추는 것을 목표로 합니다.
Hub Feature Enhancements
Spaces Beta
Spaces는 사용자 또는 조직 프로필에서 머신러닝 데모 애플리케이션을 직접 호스팅할 수 있는 무료 솔루션을 제공합니다. Gradio와 Streamlit SDK를 지원하여 사용자가 몇 분 만에 Python 기반 앱을 배포할 수 있습니다. 주요 기능은 다음과 같습니다:
- 보안 배포를 위한 Secret management
- 종속성 처리를 위한 Custom requirements
- GitHub repository를 통한 직접 관리
Model Visibility and Tracking
- TensorBoard Integration: Hub는 이제 TensorBoard trace가 포함된 모든 repository에 대해 무료 TensorBoard 인스턴스를 자동으로 실행하며, 공개 및 비공개 repo 모두를 지원합니다.
- Evaluation Metrics: 사용자는 이제 model card의
model-index섹션에 평가 지표를 나열할 수 있습니다. 이러한 지표는 커뮤니티의 비교를 용이하게 하기 위해 Papers With Code leaderboard와 자동으로 연결됩니다. - Social Features: 커뮤니티의 발견을 촉진하기 위해 모델, 데이터셋, Spaces에 대한 "like" 시스템이 구현되었습니다.
Interactive Browser Widgets
사용자가 브라우저 내에서 모델을 테스트할 수 있는 18개의 widget이 있습니다. 최근 추가된 항목은 다음과 같습니다:
- Sentence Transformers: Feature extraction 및 sentence similarity widget
- Audio Classification: 언어 식별, 거리 소음 감지, 명령 인식, 화자 식별 지원
- Computer Vision: Text-to-image, image classification, 및 object detection widget (예: Google의 ViT 및 Facebook AI의 DETR 지원)
- Structured Data: Scikit-learn classification을 위한 초기 데모
Open Source Library Updates
Transformers
The Transformers 라이브러리는 50,000개의 star와 30,000,000개의 download를 기록했습니다. 주요 업데이트는 다음과 같습니다:
- Framework Support: JAX/Flax는 이제 Hub에 5,000개 이상의 모델이 있는 세 번째 지원 framework입니다. TensorFlow 예제는 더 나은 견고함과 관용적인 사용을 위해 재작업되었습니다.
- Model Additions:
- DETR: End-to-end object detection 및 image segmentation
- ByT5 and CANINE: byte 또는 character에 직접적으로 작동하는 tokenizer-free 모델
- HuBERT: 감정 및 명령 인식을 위한 고급 audio task 성능
- LayoutLMv2 and LayoutXLM: 텍스트, 레이아웃, 시각적 데이터를 결합하여 문서 이미지를 파싱하는 모델
- BEiT: Self-supervised Vision Transformers
- RemBERT: zero-shot transfer에서 XLM-R을 능가하는 대규모 다국어 Transformer
- Splinter: 단 128개의 예시로 SQuAD에서 ~73% F1을 달성한 few-shot QA 모델
- Hub Integration:
TrainerAPI는 이제 checkpoint saving 과정에서 configuration, model, tokenizer 파일들을 Hub에 직접 push할 수 있습니다. 새로운transformers.onnxmodule은 모델을 ONNX로 내보내는 기능을 개선합니다.
Datasets
The Dataset Hub는 이제 1,400개의 공개 데이터셋을 호스팅합니다. 새로운 주요 항목은 Microsoft CodeXGlue(코딩 작업용), 그리고 C4 및 MC4와 같은 대규모 데이터셋입니다. 라이브러리는 이제 JAX, parquet 파일, remote files, 그리고 Automatic Speech Recognition과 같은 확장된 도메인을 지원합니다.
Ecosystem Integration
The Hub는 huggingface_hub 라이브러리를 통해 다른 ML 라이브러리와의 파트너십을 확장했습니다:
- spaCy: 모든 canonical pipeline은 공식 spaCy 조직에서 사용할 수 있으며, 단일 명령어로 명령어로 공유할 수 있습니다.
- Sentence Transformers: 200개 이상의 모델이 Hub에 있습니다.
- Other Libraries: Adapter Transformers 및 Speechbrain 모델에 대한 통합
Enterprise and Production Solutions
Hardware Acceleration and Optimum
Huggingging Face는 Intel, Qualcomm, 그리고 GraphCore와 파트너십을를 통해 생산성 성능을 위한 오픈소스 ML 최적화 툴킷인 Optimum을 출시했습니다.
Deployment and Inference
- Inference on SageMaker: AWS와의 새로운 통합을 통해 사용자는 Hub model page에서 직접 찾을 수 있는 코드 스니펫을 사용하여 SageMaker에서 Transformers 모델을 배포포할 수 있습니다.
- AutoNLP: no-code 웹 인터페이스를 통해 사용자가 브라우저에서 직접 자신의 데이터로 Transformers 모델을을 train, evaluate, 및 deploy할 수 있습니다.
- Inference API: 새로운 통합에는 Python 코드 주석을 위한 VSCode extension, 앱 자동화를 위한 Zapier connection, 그리고 zero-shot classification을 위한 Google Sheets script가 포함됩니다.
- Infinity: 곧 출시될 솔루션으로, 프라이빗 인프라에서의 고효율 배포를 위해 설계되었으며, GPU에서 BERT-like 모델에 대해 1ms latency, CPU에서 4-10ms latency를 보장합니다.
Research and Community Initiatives
BigScience and Collaborative Training
- BigScience: Jean Zay에서 13B English-only decoder 모델의 첫 번째 대규모 scale training을 완료했으며, 2차 단계에서는 2.5 million GPU hours의 예산산을 요청했습니다.
- DeDLOC: Yandex research와 협력하여 개발한 협업식 training method는 HPC cluster 없이도 접근 가능한 리소스(예: Colab, Kaggle)를 통해 대규모 네트워크를 학습시키기 수 있습니다 있습니다. 이는 sahajBERT(Bengali language model)를 학습시키는 데 사용되었습니다.
Academic Contributions
- NAACL Best Paper: "How Many Data Points is a Prompt Worth?" 논문은 Best Paper award를 받았으며, 이는 사람이 작성한 prompt가 수천 개의 supervised data points를 대체할 수 있음을 입증했습니다.
- EMNLP Papers: Datasets community library, prompt-based finetuning heuristics, 그리고 더 빠른 Transformers를 위한 block pruning(SQuAD에서 BERT보다 2.4x 더 빠르고 74% 더 작은 모델을 생성함)을 포함하여 4개의 논문문이 채택되었습니다.
Education
- Hugging Face Course: Transformers, Tokenizers, Datasets, Accelerate, 및 Hub에 대한 무료 온라인 코스를 출시했습니다.
- JAX/FLAX Sprint: 800명의 참가자가 참여한 커뮤니티 이벤트로, Dall-e mini, DietNerf, 및 CLIP RSIC를 포함하여 170개 이상의 모델, 22개 데이터셋, 및 38개 Spaces demo를 생성했습니다.
Sources
- OriginalSummer at Hugging Face
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch