ztxz16/fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。
解決的問題
fastllm 是一個高性能 LLM 推論庫,專為在 VRAM 有限的硬體上執行大型模型(如 DeepSeek R1 671B)而設計。它透過使用自訂的 C++ 操作符,移除了對 PyTorch 的依賴,進而能在廣泛的 GPU 與 CPU 上高效執行,包括舊型硬體與專用 NPU。
工作原理
該庫在 C++ 中實作自己的底層操作符,並支援多種優化技術:
- 混合推論:可在 GPU 與 CPU(或多個 NUMA 節點)之間拆分模型執行,透過將 MoE(專家混合)層卸載至 CPU,實現在單一 GPU 上部署大型 MoE 模型。
- 彈性量化:支援 FP8、INT8、INT4 與 AWQ 格式,可進行線上量化或匯出為特定類型以加快載入速度。
- 張量平行:支援多 GPU 張量平行推論,包含奇數張卡(如 3、5、7)。
- 廣泛的硬體支援:相容 NVIDIA(M40 至 5090)、AMD(MI50、7900)以及多種國產 NPU(天數、木犀、昇騰)。
適用對象
- 希望在消費級或舊硬體上執行大型模型的開發者與研究人員。
- 需要在 Linux、Windows 或 Android 上部署輕量級、無 PyTorch 依賴的推論引擎的使用者。
- 尋找易用 CLI 工具來啟動 LLM 伺服器、WebUI 或本地聊天的使用者。
主要亮點
- 低 VRAM 要求:當 VRAM > 10GB 時,可透過 CPU 卸載在單張顯卡上執行完整的 DeepSeek R1 671B 模型。
- 無 PyTorch 依賴:採用自訂 C++ 實作,性能更佳,移植性更強。
- 多樣化量化:支援任意 GPU 上的 FP8 推論與動態量化。
- 彈性部署:包含 OpenAI 相容 API 伺服器、WebUI 與 TUI 部署精靈。
- 跨平台支援:支援 NVIDIA、AMD 與多種 NPU,可編譯為 Android 版本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案