JustVugg/colibri
Run frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦
解決的問題
Colibrì 是一個高效率的推論引擎,專為在消費級與異質硬體上執行大型混合專家(MoE)模型(參數範圍從 744B 到 2.8T)而設計。它透過將儲存裝置、RAM 與 VRAM 視為單一整合的記憶體階層,消除對超級規模資料中心級硬體的需求,讓原本無法放入快速記憶體的模型也能從磁碟流式載入,且不改變模型的數學行為。
工作原理
引擎將 VRAM、RAM 與 NVMe 儲存視為放置層級。模型的密集部分(如注意力與嵌入層)保留在 RAM 中,而數千個被路由的專家則儲存在磁碟上,並依需求即時流式傳輸。
關鍵技術優化包括:
- 權重 JIT:一個學習快取,透過追蹤「路由熱度」,將頻繁使用的專家固定在較快的記憶體層級中。
- I/O 優化:使用
O_DIRECT繞過頁快取,批次合併專家以減少讀取呼叫,並採用「PILOT」執行緒預先載入下一層的專家。 - 雙 SSD 條帶化:支援同時從兩個獨立 SSD 流式讀取權重,將讀取頻寬加倍。
- 異質執行:支援單一執行時跨 CPU、CUDA、Metal 與 Vulkan 後端。
- 壓縮狀態:實作 57 倍更小的 MLA KV 狀態,降低記憶體開銷,並支援跨重啟持續對話。
適用對象
專為希望在自有硬體上本地執行前沿規模 MoE 模型、而非依賴專有 API 的研究人員與使用者設計,也適合對 LLM 推論中軟體/硬體邊界優化感興趣的系統工程師。
核心亮點
- 超大模型支援:可執行 GLM-5.2(744B)與 Kimi K3(2.8T)等模型。
- 零依賴:純 C 寫成,單一檔案,執行時無需 BLAS 或 Python 依賴。
- 硬體無關:從 25GB 開發機(磁碟流式)到多 GPU 工作站(完全駐留)皆可運作。
- 視覺化工具:內建 Web 仪表板,提供「Brain」視圖(即時可視化專家路由)與「Atlas」視圖(3D 映射專家主題親和性)。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案