JustVugg/colibri

Run frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦

해결하는 문제

Colibrì는 744B에서 2.8T 파라미터에 이르는 거대한 Mixture-of-Experts (MoE) 모델을 소비자용 및 이질적 하드웨어에서 실행할 수 있도록 설계된 고성능 추론 엔진입니다. 저장소, RAM, VRAM을 하나의 통합 메모리 계층으로 취급함으로써 하이퍼스케일러급 하드웨어가 필요 없으며, 빠른 메모리에 수용할 수 없는 모델도 수학적 동작을 변경하지 않고 디스크에서 스트리밍할 수 있습니다.

작동 방식

엔진은 VRAM, RAM, NVMe 저장소를 배치 계층으로 취급합니다. 모델의 밀도가 높은 부분(예: 어텐션, 임베딩 등)은 RAM에 영구적으로 유지되며, 수천 개의 라우팅된 전문가들은 디스크에 저장되어 필요 시 스트리밍됩니다.

주요 기술적 최적화:

  • Weight JIT: "라우팅 열기"를 추적하는 학습 캐시로 자주 사용되는 전문가를 빠른 메모리 계층에 고정합니다.
  • I/O 최적화: O_DIRECT를 사용해 페이지 캐시를 우회하고, 전문가의 배치 결합을 통해 읽기 호출을 줄이며, 한 레이어 앞선 전문가를 미리 불러오는 "PILOT" 스레드를 사용합니다.
  • 이중 SSD 스트라이핑: 두 개의 별도 SSD에서 동시에 가중치를 스트리밍하여 읽기 대역폭을 두 배로 늘립니다.
  • 이질적 실행: CPU, CUDA, Metal, Vulkan 백엔드를 통합한 단일 런타임을 지원합니다.
  • 압축된 상태: MLA KV 상태를 57배 작게 구현하여 메모리 오버헤드를 줄이고, 재시작 간에도 대화를 유지할 수 있습니다.

대상 사용자

자신의 하드웨어에서 프론티어 규모의 MoE 모델을 로컬로 실행하고자 하는 연구자 및 사용자, 그리고 LLM 추론의 소프트웨어/하드웨어 경계 최적화에 관심 있는 시스템 엔지니어를 위한 것입니다.

주요 특징

  • 거대 모델 지원: GLM-5.2 (744B) 및 Kimi K3 (2.8T)와 같은 모델을 실행 가능.
  • 의존성 없음: 런타임 시 BLAS나 Python이 필요 없는 순수 C로 작성된 단일 파일.
  • 하드웨어 독립성: 25GB 개발용 박스(디스크 스트리밍)부터 멀티 GPU 워크스테이션(전체 상주)까지 모든 환경에서 작동.
  • 시각화 도구: "Brain" 뷰(실시간 전문가 라우팅 시각화)와 "Atlas" 뷰(3D로 전문가 주제 유사성 매핑)를 포함한 웹 대시보드 제공.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트