FlashML-org/FreeToken
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
解決的問題
FreeToken 設計用於在消費級硬體(如遊戲電腦與筆電)上以互動速度執行大型混合專家(MoE)模型(最多 290B+ 參數)。它將 GPU、CPU 和主機記憶體視為一個統一且可彈性擴展的推理平台,克服邊緣裝置的記憶體與頻寬限制。
工作原理
該引擎使用多種優化技術以最大化硬體效率:
- 頻寬自適應執行:採用 $q^\star$ 策略實現 CPU-GPU 協同執行,優化資料移動。
- 專家快取:使用全域 LRU(最近最少使用)專家快取與 FTW 快速權重格式,加速模型權重存取。
- 語意感知快取:利用語意錨點檢查點管理 KV 快取與遞迴狀態,防止在代理上下文編輯(如工具呼叫)時發生冗餘重計算。
- 彈性記憶體:執行時動態在專家快取與 KV 記憶體之間重新分配 VRAM,無需重新啟動。
- 量化支援:支援 MXFP4、NVFP4、FP8 與 BF16 等多種格式,以減少記憶體佔用。
適用對象
希望在 NVIDIA RTX 30、40 與 50 系列 GPU 上本地執行前沿規模的開源權重 MoE 模型,而無需依賴雲端基礎設施的開發者與 AI 愛好者。
主要亮點
- 邊緣原生執行時:專為消費級硬體優化,支援雙緩衝預填流式傳輸與圖相容執行。
- 廣泛模型支援:相容 DeepSeek-V4-Flash、Qwen3.6-35B-A3B 與 GLM-5.2 等模型。
- API 相容性:提供 Anthropic 與 OpenAI 相容 API,便於與 Claude Code 與 DeepSeek Harness 等編碼代理整合。
- 跨平台支援:提供 Windows 與 Linux 桌面應用或 CLI 版本。
相關
- 專案
- 專案
- 專案
- 專案