mizorewww/laya-coreml

Local Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.

解決的問題

Laya-CoreML 提供了一種在 Apple Silicon 上以極低延遲和高能源效率運行「類型化決策」模型的方式。它消除了自迴歸解碼(逐個生成 token)的需求,使模型能夠即時返回機率、分數和布林值答案,而無需解析生成的 JSON 或文字。

運作方式

此專案將 Laya 模型移植到 Apple 的 Core ML 框架,特別針對 Apple 神經引擎(ANE)進行最佳化。透過使用非生成式的決策方法,它可以對給定輸入產生單次預測。ANE 最佳化版本使用特定的架構調整(如 BC1L 激活和 1x1 投影),以確保工作負載在神經引擎上運行,而不僅僅是 CPU 或 GPU,從而顯著降低功耗並提高速度。

適用對象

  • 在 macOS 上建置即時代理的開發者(例如內含的 Snake 遊戲示範)。
  • 需要在 Apple 硬體上進行快速、低功耗分類或決策的應用程式。
  • 想要在本地運行多語言決策模型,而無需依賴 PyTorch 或 Transformers 等重型依賴項的使用者。

亮點

  • 神經引擎最佳化:與 MLX FP16 實作相比,每次決策的能源消耗顯著降低。
  • 零 token 生成:直接返回機率和類型化答案,而非生成文字。
  • 高效能:在 M3 Max 硬體上的遊戲迴圈中,可持續每秒約 50 次決策。
  • 獨立推論:無需 PyTorch、Transformers 或 MLX 即可運行推論。

相關

  • 專案
  • 專案
  • 專案
  • 專案