ztxz16/fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。
何を解決するか
fastllm は、VRAM が限られたハードウェア上で大規模モデル(DeepSeek R1 671B など)を実行できるように設計された高性能 LLM 推論ライブラリです。PyTorch に依存せず、カスタム C++ オペレータを使用することで、幅広い GPU および CPU(古いハードウェアや専用 NPU を含む)で効率的な実行が可能になります。
動作方法
このライブラリは独自の低レベルオペレータを C++ で実装し、以下の最適化技術をサポートしています:
- ハイブリッド推論:GPU と CPU(または複数の NUMA ノード)の間でモデル実行を分割でき、MoE(エキスパートの混合)層を CPU にオフロードすることで、単一の GPU 上でも大規模な MoE モデルをデプロイできます。
- 柔軟な量子化:FP8、INT8、INT4、AWQ 形式をサポートし、オンライン量子化や特定の形式へのモデルエクスポートにより、より高速な読み込みが可能になります。
- テンソル並列:複数 GPU でのテンソル並列推論をサポートしており、3、5、7 などの奇数のカードにも対応しています。
- 広範なハードウェア対応:NVIDIA(M40 から 5090)、AMD(MI50、7900)、およびさまざまな中国製 NPU(Tianshu、Muxi、Ascend)と互換性があります。
対象ユーザー
- 消費者向けまたは古いハードウェア上で大規模モデルを実行したい開発者や研究者。
- Linux、Windows、Android 上で軽量で PyTorch に依存しない推論エンジンが必要なユーザー。
- LLM サーバー、WebUI、ローカルチャットを簡単に開始できる CLI ツールを探している人。
特徴
- 低 VRAM 要求:VRAM > 10GB の場合、CPU オフロードにより単一カードで DeepSeek R1 671B モデル全体を実行可能。
- PyTorch に依存しない:カスタム C++ 実装により、パフォーマンス向上と移植性の向上を実現。
- 多様な量子化:あらゆる GPU で FP8 推論を可能にし、動的量子化もサポート。
- 多様なデプロイ:OpenAI 互換 API サーバー、WebUI、TUI デプロイウィザードを含む。
- クロスプラットフォーム:NVIDIA、AMD、さまざまな NPU をサポートし、Android 用にコンパイル可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト