Hugging Face의 오픈 소스 현황: 2026년 봄
오픈 소스 AI 생태계는 사용자, 모델, 데이터셋 저장소의 수가 거의 두 배로 증가하며 급격한 성장을 경험했습니다. 2025년 기준으로 Hugging Face는 1,300만 명의 사용자, 200만 개 이상의 공개 모델, 50만 개 이상의 공개 데이터셋을 보유하며, 미세 조정된 모델, 어댑터, 벤치마크 생성을 통해 수동적 소비에서 능동적 참여로의 전환을 나타내고 있습니다.
생태계 집중도 및 기업 도입
전반적인 성장에도 불구하고, 생태계는 여전히 고도로 집중되어 있습니다. 모델의 0.01%(가장 많이 다운로드된 상위 200개)가 전체 다운로드의 49.6%를 차지하는 반면, 모든 모델의 약 절반은 다운로드 횟수가 200회 미만입니다.
오픈 소스의 기업 도입이 증가하고 있으며, Fortune 500대 기업의 30% 이상이 현재 Hugging Face에서 인증된 계정을 유지하고 있습니다. Big Tech의 투자가 뚜렷하며, NVIDIA가 가장 강력한 기여자로 부상하고 있습니다. 보고서는 오픈 아티팩트(open artifacts)가 생성하는 다운스트림 가치가 종종 생산 비용을 초과하며, 조직에 독점적인 폐쇄형 시스템에 비해 더 큰 유연성과 더 낮은 비용을 제공한다고 언급합니다.
지리적 변화 및 중국 AI의 부상
중국은 월간 및 전체 모델 다운로드 수에서 미국을 추월했습니다. 지난 1년 동안 중국 모델은 전체 다운로드의 41%를 차지했습니다. 이러한 변화는 2025년 1월 DeepSeek의 R1 모델의 폭발적인 출시로 가속화되었으며, 이는 Baidu(2024년 출시 0건에서 2025년 100건 이상으로 증가), ByteDance, Tencent와 같은 조직의 오픈 릴리스를 급증하게 만들었습니다.
미국과 서유럽은 Meta와 Google 같은 대형 연구소들을 통해 기여를 지속하고 있지만, 중국 조직들의 저장소 성장 궤적은 훨씬 더 가파릅니다. 또한, 개인 및 비소속 개발자들의 다운로드 점유율은 2022년 이후 17%에서 39%로 상승했으며, 이들은 종종 양자화(quantization) 및 베이스 모델의 적응(adaptation)에 집중하고 있습니다.
국가 주권 및 AI 이니셔티브
오픈 웨이트(open weight) 모델은 국가 주권을 위한 도구로 점점 더 간주되고 있으며, 이는 정부가 국내 하드웨어에 AI를를 deploy할 수 있게 하고 로컬 데이터로 시스템을 미세 조정할 수 있게 합니다.
- South Korea: 2025년 중반, LG AI Research, SK Telecom, Naver Cloud, NC AI, Upstage를 포함한 국가 대표 기업들을 명명하며 National Sovereign AI Initiative를 출시했습니다.
- Europe: 스위스의 Swiss AI 이니셔티브와 다양한 EU 지원 프로젝트들이 유사한 목표를 우선시하며, 영국은 "public money, public code" 원칙을 따릅니다.
모델 인기 및 기술적 트렌드
인기 변화
커뮤니티의 관심은 주로 미국 개발 환경(Meta의 Llama 제품군)에서 국제적인 혼합 형태로 변화했습니다. 현재 중국의 DeepSeek-R1이 가장 많은 '좋아요'를 받은 모델 상위에 위치하고 있습니다.
파생 모델
Alibaba의 Qwen 제품군은 엄청난 채택을 보였이며, 113,000개 이상의 파생 모델(Qwen 태그를 단 모든 모델을 포함하면 200,000개 이상)이 출시되어 Google과 Meta의 파생 모델 합계를 능가했습니다.
접근성 및 모델 크기
비용과 지연 시간(latency)의 제약으로 인해 작은 모델이 대형 시스템보다 훨씬 높은 비율로 다운로드되고 배포포됩니다. 다운로드된 모델의 평균 크기는 2023년 827M 파라미터에서 2025년 20.8B로 증가했지만(MoE 및 양자화에 의해 주도됨), 중앙값 크기는 326M에서 406M 파라미터로 아주 미미하게 증가했습니다.
신흥 서브 커뮤니티
로보틱스
Hugging Face의 가장 빠르게 성장하는 서브 커뮤니티는 로보틱스입니다. 로보틱스 데이터셋은 2024년 1,145개에서 2025년 26,991개로 증가하여, 텍스트 생성 분야를 제치고 Hub의 가장 큰 데이터셋 카테고리 중 하나가 되었습니다. 주요 개발 사항은 LeRobot 라이브러리와 Learning to Drive (L2D) 멀티모달 데이터셋입니다.
AI for Science
오픈 모델은 단백질 구조 예측(protein folding), 분자 역학(molecular dynamics), 신약 개발에 점점 더 많이 적용되고 있습니다. While frontier AI 기업들이 전용 과학 팀을 보유하고 있지만, 현재 커뮤니티의 관심은 문헌 발견(literature discovery) 및 대규모 학제간 협력에 집중되어 있습니다.
컴퓨팅 및 하드웨어 최적화
개발은 크로스 하드웨어 호환성을 향하는 방향으로 이동하고 있습니다. NVIDIA GPU가 여전히 지배적이지만, AMD 하드웨어 지원이 확장되고 있으며, Hugging Face는 NVIDIA와 AMD 모두를 위한 커널 최적화를 위해 2025년에 Kernel Hub를 출시했습니다. 동시에, 중국 모델들은 외국 클라우드 인프라에 대한 의존도를 낮추기 위해 국내 칩 아키텍처에 대한 명시적인 지원을 포함하여 출시되고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch