dphnAI/aphrodite-engine
Large-scale LLM inference engine
What it solves
Sonar(旧称 Aphrodite Engine)は、HuggingFace 互換モデルの大規模サービスを最適化するよう設計されており、複数の同時ユーザーに対して高性能な推論を提供します。
How it works
vLLM の Paged Attention 技術を基盤とし、エンジンは連続バッチ処理と最適化された CUDA カーネルを使用してスループットを最大化します。AWQ、GPTQ、GGUF などの多様な量子化手法や、EAGLE、MTP といった推測デコード技術をサポートし、生成速度を向上させます。また、OpenAI 互換の API サーバーを提供し、様々な UI との統合を容易にします。
Who it’s for
多数のユーザーに同時に大規模言語モデルを提供し、高効率・低レイテンシを求める開発者やプラットフォーム提供者向けです。
Highlights
- Broad Quantization Support: AQLM、AutoRound、BitNet、Marlin など多数のフォーマットを統合。
- High-Performance Kernels: PagedAttention と最適化された CUDA カーネルで推論速度を向上。
- Advanced Sampling: DRY、XTC、Mirostat といった最新サンプラーをサポート。
- Scalability: 分散型・分離型推論やマルチ LoRA を実装。
- Multimodal Capabilities: マルチモーダルモデルへの対応を含む。