ztxz16/fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。
解决的问题
fastllm 是一个高性能 LLM 推理库,专为在 VRAM 有限的硬件上运行大型模型(如 DeepSeek R1 671B)而设计。它通过使用自定义 C++ 操作符,移除了对 PyTorch 的依赖,从而能够在广泛的 GPU 和 CPU 上高效运行,包括旧硬件和专用 NPU。
工作原理
该库在 C++ 中实现了自己的低级操作符,并支持多种优化技术:
- 混合推理:可在 GPU 和 CPU(或多个 NUMA 节点)之间拆分模型执行,通过将 MoE(专家混合)层卸载到 CPU,实现在单个 GPU 上部署大型 MoE 模型。
- 灵活的量化:支持 FP8、INT8、INT4 和 AWQ 格式,可进行在线量化或导出为特定类型以实现更快加载。
- 张量并行:支持多 GPU 张量并行推理,包括奇数张卡(如 3、5、7)。
- 广泛的硬件支持:兼容 NVIDIA(M40 至 5090)、AMD(MI50、7900)以及多种国产 NPU(天数、木犀、昇腾)。
适用人群
- 希望在消费级或旧硬件上运行大型模型的开发者和研究人员。
- 需要在 Linux、Windows 或 Android 上部署轻量级、无 PyTorch 依赖的推理引擎的用户。
- 寻找易于使用的 CLI 工具来启动 LLM 服务器、WebUI 或本地聊天的用户。
主要亮点
- 低 VRAM 要求:当 VRAM > 10GB 时,可通过 CPU 卸载在单张显卡上运行完整的 DeepSeek R1 671B 模型。
- 无 PyTorch 依赖:采用自定义 C++ 实现,性能更优,移植性更强。
- 多样化的量化支持:支持任意 GPU 上的 FP8 推理和动态量化。
- 灵活的部署方式:包含 OpenAI 兼容 API 服务器、WebUI 和 TUI 部署向导。
- 跨平台支持:支持 NVIDIA、AMD 和多种 NPU,可编译为 Android 版本。
相关
- 项目
- 项目
- 项目
- 项目
- 项目