FlashML-org/FreeToken

FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.

解決的問題

FreeToken 設計用於在消費級硬體(如遊戲電腦與筆電)上以互動速度執行大型混合專家(MoE)模型(最多 290B+ 參數)。它將 GPU、CPU 和主機記憶體視為一個統一且可彈性擴展的推理平台,克服邊緣裝置的記憶體與頻寬限制。

工作原理

該引擎使用多種優化技術以最大化硬體效率:

  • 頻寬自適應執行:採用 $q^\star$ 策略實現 CPU-GPU 協同執行,優化資料移動。
  • 專家快取:使用全域 LRU(最近最少使用)專家快取與 FTW 快速權重格式,加速模型權重存取。
  • 語意感知快取:利用語意錨點檢查點管理 KV 快取與遞迴狀態,防止在代理上下文編輯(如工具呼叫)時發生冗餘重計算。
  • 彈性記憶體:執行時動態在專家快取與 KV 記憶體之間重新分配 VRAM,無需重新啟動。
  • 量化支援:支援 MXFP4、NVFP4、FP8 與 BF16 等多種格式,以減少記憶體佔用。

適用對象

希望在 NVIDIA RTX 30、40 與 50 系列 GPU 上本地執行前沿規模的開源權重 MoE 模型,而無需依賴雲端基礎設施的開發者與 AI 愛好者。

主要亮點

  • 邊緣原生執行時:專為消費級硬體優化,支援雙緩衝預填流式傳輸與圖相容執行。
  • 廣泛模型支援:相容 DeepSeek-V4-Flash、Qwen3.6-35B-A3B 與 GLM-5.2 等模型。
  • API 相容性:提供 Anthropic 與 OpenAI 相容 API,便於與 Claude Code 與 DeepSeek Harness 等編碼代理整合。
  • 跨平台支援:提供 Windows 與 Linux 桌面應用或 CLI 版本。

相關

  • 專案
  • 專案
  • 專案
  • 專案