youssofal/MTPLX
3x faster speeds on MLX | Qwen 3.8 27B | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.
何を解決するか
MTPLXはApple Silicon搭載Macでのローカル大規模言語モデル(LLM)の実行を高速化します。標準的な自己回帰的デコードの非効率性を、現代のモデル(Qwen 3.5/3.6/3.8など)に既に内蔵されているマルチトークン予測(MTP)ヘッドを活用することで解決します。これにより、別途メモリを消費するドラフトモデルを必要とせずに、複数のトークンを一度にドラフトし、検証することが可能になります。
動作方法
MTPLXはモデル自身の内蔵MTPヘッドを使用して、現在位置よりも複数トークン先を事前にドラフトします。その後、これらのドラフトされたブロックを1回のバッチ処理で検証します。出力が標準的なサンプリングと数学的に同一になるように保つために、LeviathanとChenの定理に基づく正確なリジェクトサンプリングと残差補正を採用しています。これにより、速度を向上(最大2.24倍)させつつ、温度やtop_pの設定に関わらず同じ出力分布を維持できます。
対象ユーザー
- Macユーザー:Apple Silicon(M1以降)とmacOS 14+を搭載し、ローカルLLMをより高速に実行したい方。
- 開発者:ローカルエージェント、コードアシスタント(Claude CodeやClineなど)、RAGパイプライン用のOpenAIまたはAnthropic互換APIサーバーが必要な方。
- モデル作成者:統合された「Forge」ツールを使ってMTP対応モデルの訓練、検証、公開を行いたい方。
特徴
- ネイティブMac体験:DMGアプリとして提供。自動ハードウェアチェック、モデル推奨、ファン制御を備えています。
- LTPネイティブ速度:追加のRAMオーバーヘッドなしに、内蔵MTPヘッドを活用して高速デコードを実現。
- 自動チューニング:特定のMacのハードウェア(チップ、帯域、熱特性)に最適なドラフト深度を自動測定し、1秒あたりのトークン数を最大化します。
- 統合サーバー:1つのデーモンからチャットモデル、埋め込みモデル、再ランカーをOpenAI/Anthropic互換APIで提供。
- Forgeツールキット:Hugging FaceリポジトリをMLXに変換、MTPアダプタの訓練、速度向上の検証を可能にするユーティリティを内蔵。
- セッション管理:ウォームプレフィックスセッションバンクとSSDセッションキャッシュを備え、マルチターンチャットをほぼ瞬時に復元可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト