matrixhub-ai/matrixhub

An Open-source, self-hosted AI model hub with Hugging Face compatibility, accelerating vLLM/SGLang performance.

What it solves

MatrixHub는 기업 규모의 추론을 위해 설계된 셀프 호스팅 AI 모델 레지스트리입니다. 이는 많은 GPU 노드에 모델을 배포할 때 발생하는 대역폭 병목 현상을 제거하고, 에어갭(air-gapped) 네트워크로 모델을 이동하는 보안 방법을 제공하며, 미세 조정된 가중치를 중앙 집중식으로 관리하여 개발 및 운영 환경 간의 일관성을 보장합니다.

How it works

이 서비스는 Hugging Face의 프라이빗 드롭인 대체재로 작동하며, 사용자가 HF_ENDPOINT를 프라이빗 인스턴스로 리다이렉션할 수 있도록 합니다. "pull-once, serve-all" 캐싱 메커니즘을 사용하여 배포를 가속화하고, NetLoader를 통해 P2P 배포 및 GPU로의 직접 가중치 스트리밍을 지원합니다. 기업 거버넌스를 위해 RBAC, LDAP/SSO 통합 및 멀티테넌시를 포함합니다.

Who it’s for

보안, 속도 및 GPU 클러스터에 대한 거버넌스를 위해 자체 모델 레지스트리를 호스팅해야 하는 대규모 기업의 인프라 엔지니어 및 ML 연구원.

Highlights

  • High-Performance Distribution: 100개 이상의 GPU 노드에 걸쳐 10Gbps 이상의 속도를 지원하며 네이티브 P2P 배포를 지원합니다.
  • Transparent Proxy: 코드 변경 없이 투명한 Hugging Face 프록시로 작동합니다.
  • Enterprise Security: RBAC, 멀티테넌시, 감사 로그 및 내장된 멀러웨어 스캔 기능을 제공합니다.
  • Cloud-Native: 공식 Helm 차트를 통한 Kubernetes 최적화 및 수평적 확장이 가능합니다.
  • Global Sync: 서로 다른 데이터 센터 간의 비동기식이며 재개 가능한 복제를 자동화합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트