mizorewww/laya-coreml

Local Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.

解決する問題

Laya-CoreML は、Apple Silicon 上で「型付き意思決定」モデルを極めて低遅延かつ高エネルギー効率で実行する方法を提供します。自己回帰デコード(トークンを1つずつ生成する)の必要性を排除し、生成された JSON やテキストを解析するオーバーヘッドなしに、モデルが確率、スコア、ブール値を即座に返すことを可能にします。

仕組み

このプロジェクトは、Laya モデルを Apple の Core ML フレームワークに移植し、特に Apple ニューラルエンジン(ANE)向けに最適化しています。非生成的な意思決定アプローチを使用することで、与えられた入力に対して単一ショットの予測を生成できます。ANE 最適化バージョンでは、特定のアーキテクチャ調整(BC1L アクティベーションや 1x1 プロジェクションなど)を使用して、ワークロードが CPU や GPU だけでなくニューラルエンジンで実行されるようにし、消費電力を大幅に削減し、速度を向上させます。

対象読者

  • macOS でリアルタイムエージェントを構築する開発者(同梱の Snake ゲームデモなど)。
  • Apple ハードウェアで高速・低電力の分類や意思決定を必要とするアプリケーション。
  • PyTorch や Transformers などの重い依存関係なしに、多言語意思決定モデルをローカルで実行したいユーザー。

ハイライト

  • ニューラルエンジン最適化: MLX FP16 実装と比較して、意思決定あたりのエネルギー消費を大幅に削減。
  • ゼロトークン生成: テキストを生成する代わりに、直接確率と型付き回答を返します。
  • 高性能: M3 Max ハードウェアのゲームループで、毎秒約 50 回の意思決定を維持可能。
  • スタンドアロン推論: 推論の実行に PyTorch、Transformers、MLX を必要としません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト