Epistates/pmetal

PMetal: high-performance Apple Silicon framework for local LLM inference, LoRA/QLoRA fine-tuning, serving, quantization, and MLX/Metal acceleration.

何を解決するか

PMetal は Apple Silicon 専用に設計された包括的な機械学習プラットフォームです。高パフォーマンスな ML タスクのために Apple エコシステムを離れる必要がなくなり、Metal GPU カーネルと Apple Neural Engine (ANE) を活用して、モデルの学習、ファインチューニング、推論を統合されたツールセットで実現します。

動作方法

Rust で記述された PMetal は、埋め込み可能な SDK とツールのセットとして動作します。MLX C++ ブリッジとカスタム Metal カーネルと統合し、M シリーズチップでのパフォーマンスを最適化します。以下の3つの主要インターフェースからアクセス可能です:

  • デスクトップ GUI:Tauri と Svelte を使用した視覚的なモデル管理および学習用アプリケーション。
  • ターミナル TUI:20タブの制御センターで、詳細な設定とモニタリングが可能。
  • CLI:学習、推論、量子化タスクの迅速実行を目的としたコマンドラインインターフェース。

また、Thunderbolt、イーサネット、Wi-Fi を通じて複数の Mac を「ホームクラスター」として接続し、分散学習をサポート。自動的にリング構造を形成し、勾配の all-reduce 操作を実行します。

対象ユーザー

  • Apple ハードウェア上でモデルの学習やファインチューニングを行いたい ML エンジニアおよび研究者
  • 高パフォーマンスな ML 機能を自社アプリケーションに統合したい Rust および Python 開発者
  • ローカル LLM の管理、量子化、モデルマージを GUI や TUI で行いたい Apple Silicon ユーザー

主な特徴

  • フルスタックツールキット:pretraining、SFT、LoRA、QLoRA、distillation、推論の各段階に対応する GUI、TUI、CLI を備えています。
  • ハードウェア最適化:チップファミリー(M1 から M5)を自動検出し、デバイスのグレード(Base、Pro、Max、Ultra)に応じてカーネルパラメータを最適化します。
  • 分散学習:Thunderbolt 対応クラスタリングにより、複数 Mac 間の分散学習を可能にし、自動的にファブリックフォールバックを実行します。
  • 広範なモデル対応:Llama、Qwen、DeepSeek、Mistral、Gemma、Phi など、多数のアーキテクチャをサポートしています。
  • 高度な技術:GRPO 推理学習、知識蒸留、スペキュレーティブデコード(DFlash)、およびさまざまなモデルマージ戦略(SLERP、TIES、DARE)を実装しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト