FlashML-org/FreeToken

FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.

解决的问题

FreeToken 旨在在消费级硬件(如游戏电脑和笔记本电脑)上以交互式速度运行大规模混合专家(MoE)模型(最多 290B+ 参数)。它通过将 GPU、CPU 和主机内存视为一个统一且可弹性扩展的推理平台,克服了边缘设备的内存和带宽限制。

工作原理

该引擎使用多种优化技术以最大化硬件效率:

  • 带宽自适应执行:采用 $q^\star$ 策略实现 CPU-GPU 协同执行,优化数据移动。
  • 专家缓存:使用全局 LRU(最近最少使用)专家缓存和 FTW 快速权重格式,加速模型权重访问。
  • 语义感知缓存:利用语义锚点检查点管理 KV 缓存和递归状态,防止在代理上下文编辑(如工具调用)时发生冗余重计算。
  • 弹性内存:运行时动态在专家缓存和 KV 内存之间重新分配 VRAM,无需重启。
  • 量化支持:支持 MXFP4、NVFP4、FP8 和 BF16 等多种格式,以减少内存占用。

适用人群

希望在 NVIDIA RTX 30、40 和 50 系列 GPU 上本地运行前沿规模的开源权重 MoE 模型,而无需依赖云基础设施的开发者和 AI 爱好者。

主要亮点

  • 边缘原生运行时:专为消费级硬件优化,支持双缓冲预填充流式传输和图兼容执行。
  • 广泛模型支持:兼容 DeepSeek-V4-Flash、Qwen3.6-35B-A3B 和 GLM-5.2 等模型。
  • API 兼容性:提供 Anthropic 和 OpenAI 兼容 API,便于与 Claude Code 和 DeepSeek Harness 等编码代理集成。
  • 跨平台支持:提供 Windows 和 Linux 桌面应用或 CLI 版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目