1CatAI/1Cat-vLLM

V100 / SM70-focused vLLM engineering fork for modern LLM inference.

何を解決するか

1Cat-vLLM は、現代の大規模言語モデルの時代において Tesla V100 (SM70) GPU が陳腐化しないように設計された、vLLM の特殊なフォークです。標準の vLLM が効率的または互換性に欠ける可能性がある古い Volta アーキテクチャのハードウェア上で、特に Qwen クラスの AWQ および実験的な FP8 モデルの推論を最適化しています。

どう動くか

このプロジェクトは、V100 上での高性能推論を可能にする複数のハードウェア固有の最適化を統合しています。

  • カスタムカーネル: TurboMind 由来の SM70 カーネルと、デコードおよびプリフィル操作の両方に対応する専用の FLASH_ATTN_V100 バックエンドを統合しています。
  • AWQ サポート: SM70 上での密行列および MoE Qwen モデルに対する最適化された 4 ビット AWQ 推論パスを提供しています。
  • メモリとコンテキスト管理: 長文コンテキスト推論(最大 256K)に最適化されたランタイムデフォルトを含み、マルチモーダル入力のメモリ予算を管理しています。
  • 推測的デコード: 特定のワークロード向けにオプションとして MTP(マルチトークン予測)推測的デコードをサポートしています。
  • 実験的パス: FP8 モデル、FP8 KVキャッシュ、DFlash に対する研究レベルのサポートを含んでいます。

対象ユーザー

Tesla V100 GPU を引き続き使用し、OpenAI互換 API を備えた現代的で高性能な LLM をデプロイしたい個人開発者、スタジオ、チーム向けです。

主な特徴

  • V100 最適化: 一般的なフォークではなく、SM70 アーキテクチャに特化して最適化されています。
  • 長文コンテキスト対応: メモリが許す限り、公開プロファイルのデフォルトが 256K コンテキストです。
  • マルチモーダル対応: SM70 パスではデフォルトで画像入力をサポートしています。
  • OpenAI 互換性: Cherry Studio や OpenClaw などの一般的な OpenAI スタイルクライアントで検証済みです。
  • 事前ビルド済みウェHEEL: Ubuntu 24.04 および CUDA 12.8 用の事前ビルド済みウェHEEL を提供し、インストールが簡単です。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch