JustVugg/colibri
Run frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦
何を解決するか
Colibrì は、744B から 2.8T パラメータの巨大な Mixture-of-Experts (MoE) モデルを、プロフェッショナルなハードウェアではなく、一般消費者向けのハードウェアで実行できる高パフォーマンスな推論エンジンです。ストレージ、RAM、VRAM を単一の統合メモリ階層として扱うことで、ハイパースケーラークラスのハードウェアを必要とせず、高速メモリに収まらないモデルをディスクからストリーミング可能にします。数学的な挙動を変更することなく、モデルの動作を維持します。
動作方法
エンジンは VRAM、RAM、NVMe ストレージを配置層として扱います。モデルの密度の高い部分(アテンションや埋め込みなど)は RAM に常駐し、数千のルーティングされたエキスパートはディスクに保存され、必要に応じてストリーミングされます。
主な技術的最適化:
- Weight JIT: 「ルーティング熱」を追跡する学習キャッシュで、頻繁に使用されるエキスパートを高速メモリ層に固定します。
- I/O 最適化:
O_DIRECTを使用してページキャッシュをバイパス、バッチ処理されたエキスパート結合で読み取り呼び出しを削減、1層先のエキスパートを事前読み込みする「PILOT」スレッドを採用。 - デュアル-SSD ストリッピング: 2つの別々の SSD から同時に重みをストリーミング可能で、読み取り帯域を2倍にします。
- 異種実行: CPU、CUDA、Metal、Vulkan バックエンドを統合した単一ランタイムをサポート。
- 圧縮状態: MLA KV 状態を 57 倍小さく実装し、メモリオーバーヘッドを削減、再起動間でも会話の継続を可能にします。
対象ユーザー
独自のハードウェア上でフロンティア規模の MoE モデルをローカルで実行したい研究者やユーザー、また LLM 推論におけるソフトウェア/ハードウェア境界の最適化に興味を持つシステムエンジニア向けに設計されています。
特徴
- 巨大モデル対応: GLM-5.2 (744B) や Kimi K3 (2.8T) などのモデルを実行可能。
- 依存関係ゼロ: ランタイム時に BLAS や Python を必要としない、単一ファイルの純粋 C 言語で記述。
- ハードウェア非依存: 25GB の開発用マシン(ディスクストリーミング)からマルチGPUワークステーション(完全常駐)まで対応。
- 視覚化ツール: Web ダッシュボードに「Brain」ビュー(リアルタイムでエキスパートルーティングを可視化)と「Atlas」ビュー(3Dでエキスパートのトピック親和性をマッピング)を搭載。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト