Hugging Face, Hub 스토리지 및 협업을 업그레이드하기 위해 XetHub 인수
TL;DR
Hugging Face는 시애틀에 기반을 둔 스타트업 XetHub의 인수를 발표했습니다. XetHub는 테라바이트 규모 AI 데이터셋 및 모델을 위한 Git‑scale 스토리지와 버전 관리를 구축했으며, 보다 효율적인 협업을 가능하게 하고 Hub에서 트릴리언 파라미터 모델 지원을 위한 길을 열었습니다.
Hugging Face의 공동 목표
"XetHub 팀은 Hub 저장소의 백엔드로 자체적인, 더 나은 버전의 LFS로 전환함으로써 HF 데이터셋 및 모델의 향후 5년 성장 잠재력을 열어줄 것입니다." – Julien Chaumond, HF CTO
Hugging Face는 초기 성장에 실용적인 선택이었기 때문에 2020년에 원래 Hub를 Git LFS 위에 구축했습니다. 이제 회사는 Git LFS를 XetHub의 최적화된 스토리지 및 버전 관리 시스템으로 교체할 계획이며, 이는 현대 AI 워크플로우에서 흔히 볼 수 있는 매우 큰 파일을 위해 설계되었습니다.
향후 사용 사례 예시 🔥
- 대형 Parquet 파일에 대한 점진적 업데이트 – 현재 10 GB Parquet 파일에 한 행을 추가하려면 전체 파일을 다시 업로드해야 합니다. XetHub의 청크 기반 스토리지와 중복 제거 기능을 통해 영향을 받은 청크만 업로드할 수 있어 대역폭과 지연 시간이 크게 감소합니다.
- 세밀한 GGUF 모델 헤더 업데이트 – Llama 3.1 405B GGUF 저장소에서 단일 메타데이터 필드를 업데이트하면 전체 다중 기가바이트 모델 파일 대신 몇 킬로바이트만 업로드하면 됩니다.
- 트릴리언 파라미터 모델로 확장 – 새로 출시된 BigLlama‑3.1‑1T와 같은 모델이 등장함에 따라 XetHub 기술은 커뮤니티와 기업 사용자가 데이터셋 및 모델을 전례 없는 규모로 저장, 버전 관리 및 협업할 수 있게 할 것으로 기대됩니다.
- 대형 자산에 대한 협업 개선 – XetHub는 팀이 데이터셋 및 모델의 변화를 이해하도록 돕는 도구를 제공하여 재현성 및 협업 실험을 지원합니다.
현재 Hub 통계 🤯
- 저장소: 모델 1.3 M, 데이터셋 450 k, 스페이스 680 k
- 스토리지: LFS에 12 PB (≈280 M 파일) 및 Git에 7.3 TB (non‑LFS)
- 트래픽: 일일 요청 1 B 및 일일 CloudFront 대역폭 6 PB
설립자의 관점
"저는 AI/ML 분야에 15 년 이상 종사해 왔습니다… XetHub의 목표는 Git 파일 스토리지를 테라바이트 규모로 확장하여 ML 팀이 소프트웨어 팀처럼 운영하도록 하고, 실험과 재현성을 원활하게 지원하며, 데이터셋 및 모델이 어떻게 진화하는지 시각화할 수 있는 기능을 제공하는 것입니다." – Yucheng Low (@ylow), XetHub 공동 설립자
Low는 Apple에서 데이터 파이프라인을 100 PB 이상으로 확장한 경험과 XetHub를 설립해 이러한 교훈을 더 넓은 AI 커뮤니티에 전파한 이야기를 전합니다. 이번 인수는 XetHub의 사명을 Hugging Face의 대규모 AI 협업을 단순화하려는 목표와 일치시킵니다.
채용 공고
Hugging Face 인프라 팀은 오픈소스 AI 협업 플랫폼을 구축하고 확장할 엔지니어를 적극 모집하고 있습니다. 관심 있는 지원자는 지원을 권장합니다.
Hugging Face에서 XetHub 팀을 팔로우하세요 hf.co/xet-team.
Sources
- OriginalXetHub is joining Hugging Face!