mizorewww/laya-coreml
Local Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.
解決する問題
Laya-CoreML は、Apple Silicon 上で「型付き意思決定」モデルを極めて低遅延かつ高エネルギー効率で実行する方法を提供します。自己回帰デコード(トークンを1つずつ生成する)の必要性を排除し、生成された JSON やテキストを解析するオーバーヘッドなしに、モデルが確率、スコア、ブール値を即座に返すことを可能にします。
仕組み
このプロジェクトは、Laya モデルを Apple の Core ML フレームワークに移植し、特に Apple ニューラルエンジン(ANE)向けに最適化しています。非生成的な意思決定アプローチを使用することで、与えられた入力に対して単一ショットの予測を生成できます。ANE 最適化バージョンでは、特定のアーキテクチャ調整(BC1L アクティベーションや 1x1 プロジェクションなど)を使用して、ワークロードが CPU や GPU だけでなくニューラルエンジンで実行されるようにし、消費電力を大幅に削減し、速度を向上させます。
対象読者
- macOS でリアルタイムエージェントを構築する開発者(同梱の Snake ゲームデモなど)。
- Apple ハードウェアで高速・低電力の分類や意思決定を必要とするアプリケーション。
- PyTorch や Transformers などの重い依存関係なしに、多言語意思決定モデルをローカルで実行したいユーザー。
ハイライト
- ニューラルエンジン最適化: MLX FP16 実装と比較して、意思決定あたりのエネルギー消費を大幅に削減。
- ゼロトークン生成: テキストを生成する代わりに、直接確率と型付き回答を返します。
- 高性能: M3 Max ハードウェアのゲームループで、毎秒約 50 回の意思決定を維持可能。
- スタンドアロン推論: 推論の実行に PyTorch、Transformers、MLX を必要としません。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト