ztxz16/fastllm

fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。

何を解決するか

fastllm は、VRAM が限られたハードウェア上で大規模モデル(DeepSeek R1 671B など)を実行できるように設計された高性能 LLM 推論ライブラリです。PyTorch に依存せず、カスタム C++ オペレータを使用することで、幅広い GPU および CPU(古いハードウェアや専用 NPU を含む)で効率的な実行が可能になります。

動作方法

このライブラリは独自の低レベルオペレータを C++ で実装し、以下の最適化技術をサポートしています:

  • ハイブリッド推論:GPU と CPU(または複数の NUMA ノード)の間でモデル実行を分割でき、MoE(エキスパートの混合)層を CPU にオフロードすることで、単一の GPU 上でも大規模な MoE モデルをデプロイできます。
  • 柔軟な量子化:FP8、INT8、INT4、AWQ 形式をサポートし、オンライン量子化や特定の形式へのモデルエクスポートにより、より高速な読み込みが可能になります。
  • テンソル並列:複数 GPU でのテンソル並列推論をサポートしており、3、5、7 などの奇数のカードにも対応しています。
  • 広範なハードウェア対応:NVIDIA(M40 から 5090)、AMD(MI50、7900)、およびさまざまな中国製 NPU(Tianshu、Muxi、Ascend)と互換性があります。

対象ユーザー

  • 消費者向けまたは古いハードウェア上で大規模モデルを実行したい開発者や研究者。
  • Linux、Windows、Android 上で軽量で PyTorch に依存しない推論エンジンが必要なユーザー。
  • LLM サーバー、WebUI、ローカルチャットを簡単に開始できる CLI ツールを探している人。

特徴

  • 低 VRAM 要求:VRAM > 10GB の場合、CPU オフロードにより単一カードで DeepSeek R1 671B モデル全体を実行可能。
  • PyTorch に依存しない:カスタム C++ 実装により、パフォーマンス向上と移植性の向上を実現。
  • 多様な量子化:あらゆる GPU で FP8 推論を可能にし、動的量子化もサポート。
  • 多様なデプロイ:OpenAI 互換 API サーバー、WebUI、TUI デプロイウィザードを含む。
  • クロスプラットフォーム:NVIDIA、AMD、さまざまな NPU をサポートし、Android 用にコンパイル可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト