1CatAI/1Cat-vLLM
V100 / SM70-focused vLLM engineering fork for modern LLM inference.
何を解決するか
1Cat-vLLM は、現代の大規模言語モデルの時代において Tesla V100 (SM70) GPU が陳腐化しないように設計された、vLLM の特殊なフォークです。標準の vLLM が効率的または互換性に欠ける可能性がある古い Volta アーキテクチャのハードウェア上で、特に Qwen クラスの AWQ および実験的な FP8 モデルの推論を最適化しています。
どう動くか
このプロジェクトは、V100 上での高性能推論を可能にする複数のハードウェア固有の最適化を統合しています。
- カスタムカーネル: TurboMind 由来の SM70 カーネルと、デコードおよびプリフィル操作の両方に対応する専用の
FLASH_ATTN_V100バックエンドを統合しています。 - AWQ サポート: SM70 上での密行列および MoE Qwen モデルに対する最適化された 4 ビット AWQ 推論パスを提供しています。
- メモリとコンテキスト管理: 長文コンテキスト推論(最大 256K)に最適化されたランタイムデフォルトを含み、マルチモーダル入力のメモリ予算を管理しています。
- 推測的デコード: 特定のワークロード向けにオプションとして MTP(マルチトークン予測)推測的デコードをサポートしています。
- 実験的パス: FP8 モデル、FP8 KVキャッシュ、DFlash に対する研究レベルのサポートを含んでいます。
対象ユーザー
Tesla V100 GPU を引き続き使用し、OpenAI互換 API を備えた現代的で高性能な LLM をデプロイしたい個人開発者、スタジオ、チーム向けです。
主な特徴
- V100 最適化: 一般的なフォークではなく、SM70 アーキテクチャに特化して最適化されています。
- 長文コンテキスト対応: メモリが許す限り、公開プロファイルのデフォルトが 256K コンテキストです。
- マルチモーダル対応: SM70 パスではデフォルトで画像入力をサポートしています。
- OpenAI 互換性: Cherry Studio や OpenClaw などの一般的な OpenAI スタイルクライアントで検証済みです。
- 事前ビルド済みウェHEEL: Ubuntu 24.04 および CUDA 12.8 用の事前ビルド済みウェHEEL を提供し、インストールが簡単です。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch