ztxz16/fastllm

fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。

解決的問題

fastllm 是一個高性能 LLM 推論庫,專為在 VRAM 有限的硬體上執行大型模型(如 DeepSeek R1 671B)而設計。它透過使用自訂的 C++ 操作符,移除了對 PyTorch 的依賴,進而能在廣泛的 GPU 與 CPU 上高效執行,包括舊型硬體與專用 NPU。

工作原理

該庫在 C++ 中實作自己的底層操作符,並支援多種優化技術:

  • 混合推論:可在 GPU 與 CPU(或多個 NUMA 節點)之間拆分模型執行,透過將 MoE(專家混合)層卸載至 CPU,實現在單一 GPU 上部署大型 MoE 模型。
  • 彈性量化:支援 FP8、INT8、INT4 與 AWQ 格式,可進行線上量化或匯出為特定類型以加快載入速度。
  • 張量平行:支援多 GPU 張量平行推論,包含奇數張卡(如 3、5、7)。
  • 廣泛的硬體支援:相容 NVIDIA(M40 至 5090)、AMD(MI50、7900)以及多種國產 NPU(天數、木犀、昇騰)。

適用對象

  • 希望在消費級或舊硬體上執行大型模型的開發者與研究人員。
  • 需要在 Linux、Windows 或 Android 上部署輕量級、無 PyTorch 依賴的推論引擎的使用者。
  • 尋找易用 CLI 工具來啟動 LLM 伺服器、WebUI 或本地聊天的使用者。

主要亮點

  • 低 VRAM 要求:當 VRAM > 10GB 時,可透過 CPU 卸載在單張顯卡上執行完整的 DeepSeek R1 671B 模型。
  • 無 PyTorch 依賴:採用自訂 C++ 實作,性能更佳,移植性更強。
  • 多樣化量化:支援任意 GPU 上的 FP8 推論與動態量化。
  • 彈性部署:包含 OpenAI 相容 API 伺服器、WebUI 與 TUI 部署精靈。
  • 跨平台支援:支援 NVIDIA、AMD 與多種 NPU,可編譯為 Android 版本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案