syv-ai/qwen38-27b-rtx3090

Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

何を解決するか

このプロジェクトは、1台のコンシューマー向けNVIDIA RTX 3090(24 GB VRAM)上でQwen3.8-27Bモデルの高度に最適化されたサービング環境を提供します。限られたハードウェア上で高スループットかつ低レイテンシで大規模モデルを実行する課題に対処するため、先進的な量子化、推測デコード、メモリ管理技術を採用しています。

仕組み

システムはvLLMを基盤とし、複数の最適化層を適用しています。

  • 量子化: 嵌め込み行列とLMヘッドをint8/int4に再量子化することでVRAMを解放し、処理速度を向上させます。
  • 推測デコード: MTP(マルチトークン予測)やDFlash2など、複数の推測モードを提供。1ステップで複数トークンを予測し、生成を加速します。
  • コンテキスト管理: プレフィックスキャッシュを実装し、文書の再処理を回避。KVarN 4/2ビットKVキャッシュにより、最大240kトークンの拡張コンテキスト窓をサポートします。
  • 運用モード: 高スループットAPIバックエンド向けの「バッチ」モードと、低レイテンシチャット向けに最適化された「シングルユーザー」モードの2種類の構成を提供します。

対象ユーザー

1台のRTX 3090を所有し、Qwen3.8-27Bをプロダクションレベルのパフォーマンス、大容量コンテキスト、OpenAI互換APIで実行したい開発者やAI研究者。

主な特徴

  • 高スループット: バッチモードで最大約1,035トークン/秒を達成。
  • 低レイテンシ: DFlash2推測を使用したシングルユーザーモードで120トークン/秒以上を達成。
  • 大容量コンテキスト: KVarN統合により最大240kトークンのコンテキストをサポート。
  • 損失なしの推測: 推測デコードは正確であり、元のモデルの分布を維持します。
  • OpenAI互換: キー認証オプション付きのAPIを提供。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト