FlashML-org/FreeToken
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
解决的问题
FreeToken 旨在在消费级硬件(如游戏电脑和笔记本电脑)上以交互式速度运行大规模混合专家(MoE)模型(最多 290B+ 参数)。它通过将 GPU、CPU 和主机内存视为一个统一且可弹性扩展的推理平台,克服了边缘设备的内存和带宽限制。
工作原理
该引擎使用多种优化技术以最大化硬件效率:
- 带宽自适应执行:采用 $q^\star$ 策略实现 CPU-GPU 协同执行,优化数据移动。
- 专家缓存:使用全局 LRU(最近最少使用)专家缓存和 FTW 快速权重格式,加速模型权重访问。
- 语义感知缓存:利用语义锚点检查点管理 KV 缓存和递归状态,防止在代理上下文编辑(如工具调用)时发生冗余重计算。
- 弹性内存:运行时动态在专家缓存和 KV 内存之间重新分配 VRAM,无需重启。
- 量化支持:支持 MXFP4、NVFP4、FP8 和 BF16 等多种格式,以减少内存占用。
适用人群
希望在 NVIDIA RTX 30、40 和 50 系列 GPU 上本地运行前沿规模的开源权重 MoE 模型,而无需依赖云基础设施的开发者和 AI 爱好者。
主要亮点
- 边缘原生运行时:专为消费级硬件优化,支持双缓冲预填充流式传输和图兼容执行。
- 广泛模型支持:兼容 DeepSeek-V4-Flash、Qwen3.6-35B-A3B 和 GLM-5.2 等模型。
- API 兼容性:提供 Anthropic 和 OpenAI 兼容 API,便于与 Claude Code 和 DeepSeek Harness 等编码代理集成。
- 跨平台支持:提供 Windows 和 Linux 桌面应用或 CLI 版本。
相关
- 项目
- 项目
- 项目
- 项目