Epistates/pmetal
PMetal: high-performance Apple Silicon framework for local LLM inference, LoRA/QLoRA fine-tuning, serving, quantization, and MLX/Metal acceleration.
何を解決するか
PMetal は Apple Silicon 専用に設計された包括的な機械学習プラットフォームです。高パフォーマンスな ML タスクのために Apple エコシステムを離れる必要がなくなり、Metal GPU カーネルと Apple Neural Engine (ANE) を活用して、モデルの学習、ファインチューニング、推論を統合されたツールセットで実現します。
動作方法
Rust で記述された PMetal は、埋め込み可能な SDK とツールのセットとして動作します。MLX C++ ブリッジとカスタム Metal カーネルと統合し、M シリーズチップでのパフォーマンスを最適化します。以下の3つの主要インターフェースからアクセス可能です:
- デスクトップ GUI:Tauri と Svelte を使用した視覚的なモデル管理および学習用アプリケーション。
- ターミナル TUI:20タブの制御センターで、詳細な設定とモニタリングが可能。
- CLI:学習、推論、量子化タスクの迅速実行を目的としたコマンドラインインターフェース。
また、Thunderbolt、イーサネット、Wi-Fi を通じて複数の Mac を「ホームクラスター」として接続し、分散学習をサポート。自動的にリング構造を形成し、勾配の all-reduce 操作を実行します。
対象ユーザー
- Apple ハードウェア上でモデルの学習やファインチューニングを行いたい ML エンジニアおよび研究者。
- 高パフォーマンスな ML 機能を自社アプリケーションに統合したい Rust および Python 開発者。
- ローカル LLM の管理、量子化、モデルマージを GUI や TUI で行いたい Apple Silicon ユーザー。
主な特徴
- フルスタックツールキット:pretraining、SFT、LoRA、QLoRA、distillation、推論の各段階に対応する GUI、TUI、CLI を備えています。
- ハードウェア最適化:チップファミリー(M1 から M5)を自動検出し、デバイスのグレード(Base、Pro、Max、Ultra)に応じてカーネルパラメータを最適化します。
- 分散学習:Thunderbolt 対応クラスタリングにより、複数 Mac 間の分散学習を可能にし、自動的にファブリックフォールバックを実行します。
- 広範なモデル対応:Llama、Qwen、DeepSeek、Mistral、Gemma、Phi など、多数のアーキテクチャをサポートしています。
- 高度な技術:GRPO 推理学習、知識蒸留、スペキュレーティブデコード(DFlash)、およびさまざまなモデルマージ戦略(SLERP、TIES、DARE)を実装しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト