JustVugg/colibri

Run frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦

解决的问题

Colibrì 是一个高性能推理引擎,旨在在消费级和异构硬件上运行大规模混合专家(MoE)模型——参数规模从 744B 到 2.8T。它通过将存储、RAM 和 VRAM 视为单一统一的内存层次结构,消除了对超大规模数据中心级硬件的需求,使原本无法放入快速内存的模型也能从磁盘流式加载,而无需改变模型的数学行为。

工作原理

该引擎将 VRAM、RAM 和 NVMe 存储视为放置层级。模型的密集部分(如注意力机制和嵌入层)保留在 RAM 中,而数千个被路由的专家则存储在磁盘上,并按需流式加载。

关键技术优化包括:

  • 权重 JIT:一个学习缓存,通过追踪「路由热度」,将频繁使用的专家固定在更快的内存层级中。
  • I/O 优化:使用 O_DIRECT 绕过页缓存,批量合并专家以减少读取调用,并采用「PILOT」线程提前预取下一层次的专家。
  • 双 SSD 条带化:支持同时从两个独立 SSD 流式读取权重,将读取带宽翻倍。
  • 异构执行:支持单一运行时跨 CPU、CUDA、Metal 和 Vulkan 后端。
  • 压缩状态:实现 57 倍更小的 MLA KV 状态,降低内存开销,并支持跨重启持久化对话。

适用人群

专为希望在自有硬件上本地运行前沿规模 MoE 模型、而非依赖专有 API 的研究人员和用户设计,也适合对 LLM 推理中软件/硬件边界优化感兴趣的系统工程师。

核心亮点

  • 超大模型支持:可运行 GLM-5.2(744B)和 Kimi K3(2.8T)等模型。
  • 零依赖:纯 C 编写,单文件实现,运行时无需 BLAS 或 Python 依赖。
  • 硬件无关:从 25GB 开发机(磁盘流式)到多 GPU 工作站(完全驻留)均可运行。
  • 可视化工具:包含 Web 仪表板,提供「Brain」视图(实时可视化专家路由)和「Atlas」视图(3D 映射专家主题亲和性)。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目