lablup/mlxcel
High-performance LLM/VLM inference runtime and server for Apple Silicon / NVIDIA CUDA devices
何を解決するか
mlxcel は、大規模言語モデル(LLM)および視覚言語モデル(VLM)をデプロイする際に Python 環境を必要としないように設計された、高性能な推論ランタイムおよびサーバーです。ネイティブで単一プロセスで実行される環境を提供し、デプロイ、パッケージング、サービス監視を簡素化しながら、Pythonベースの MLX リファレンスと同等のパフォーマンスを維持します。
動作方法
Rust で実装された mlxcel は、ネイティブな MLX C++ バインディングを使用してモデルを実行します。Apple Silicon、NVIDIA CUDA互換デバイス、および実験的な OpenXLA 互換デバイスをサポートしています。ランタイムはモデルの読み込み、スケジューリング、推論を単一のネイティブプロセス内で処理し、mlx-community のチェックポイントから直接モデルを実行できるようにします。変換ステップは不要です。
対象ユーザー
最小限のオーバーヘッドでローカルまたは小規模クラスタの推論サーバーをデプロイしたい開発者やオペレーター、llama.cpp からの移行を検討している方(OpenAI互換APIと類似したフラグ構造のため)、Apple SiliconまたはNVIDIA GPUを使用しているユーザーに適しています。
主な特徴
- ネイティブパフォーマンス:
mlx-lmおよびmlx-vlmとほぼ同等のデコードスループットを達成し、短いプロンプトのテキストプレフィルが大幅に高速化されています。 - 広範なモデル対応:Llama、Qwen、Gemma、Phi、Mistral、DeepSeek など、多数のテキストおよび視覚言語モデルファミリーをサポートしています。
- OpenAI互換:
/v1/chat/completions、/v1/completions、/v1/responsesに対応する OpenAI互換 HTTP API を提供しています。 - プロダクション対応機能:連続バッチ処理、プロンプトプレフィックスキャッシュ、推測的デコード、KVキャッシュ圧縮を含みます。
- モデル手術:重み空間での変更(スケーリング、追加、削除、置換、補間)を、再トレーニングなしで YAML ファイルでロード時に直接行える、第一級の機能を提供します。
- 分散推論:特定のモデルファミリーに対して、テンソル並列およびパイプライン並列を実装しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト