dphnAI/sonar

Large-scale LLM inference engine

What it solves

Sonar は、HuggingFace 互換モデルを大規模にサービングするために設計された高性能推理エンジンです。速度を犠牲にすることなく、GPU メモリの効率的な管理と複数の同時ユーザーへの対応という課題を解決します。

How it works

Sonar は vLLM の Paged Attention 技術に基づき、continuous batching と最適化された CUDA kernels を利用することで、モデルサービングを最適化します。AWQ, GPTQ, GGUF などの幅広い量化手法をサポートし、メモリ使用量を削減します。また、EAGLE や MTP のような投機的デコーディング (speculative decoding) 技術を用いて生成を加速します。OpenAI 互換の API server を提供し、さまざまな UI との統合が容易です。

Who it's for

大量のユーザー向けに LLM をデプロイする必要がある開発者やプラットフォームプロバイダー、および AI チャットプラットフォームや API インフラストラクチャを統合するユーザーを対象としています。

Highlights

  • PagedAttention: スループットを最大化するための効率的な K/V cache 管理。
  • Extensive Quantization Support: AQLM, AutoRound, BitNet を含む多数の形式に対応。
  • Advanced Sampling: DRY, XTC, Mirostat のような最新のサンプラーをサポート。
  • Scalability: 分散および非分離推理 (disaggregated inference) と multi-LoRA サポートを特徴とする。
  • Multimodal Support: マルチモーダルモデルの処理能力。