mizorewww/laya-coreml

Local Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.

解决的问题

Laya-CoreML 提供了一种在 Apple Silicon 上以极低延迟和高能源效率运行“类型化决策”模型的方式。它消除了自回归解码(逐个生成 token)的需求,使模型能够即时返回概率、分数和布尔值答案,而无需解析生成的 JSON 或文本。

运作方式

此项目将 Laya 模型移植到 Apple 的 Core ML 框架,特别针对 Apple 神经引擎(ANE)进行优化。通过使用非生成式的决策方法,它可以对给定输入产生单次预测。ANE 优化版本使用特定的架构调整(如 BC1L 激活和 1x1 投影),以确保工作负载在神经引擎上运行,而不仅仅是 CPU 或 GPU,从而显著降低功耗并提高速度。

适用对象

  • 在 macOS 上构建实时代理的开发者(例如内置的 Snake 游戏演示)。
  • 需要在 Apple 硬件上进行快速、低功耗分类或决策的应用程序。
  • 想要在本地运行多语言决策模型,而无需依赖 PyTorch 或 Transformers 等重型依赖项的用户。

亮点

  • 神经引擎优化:与 MLX FP16 实现相比,每次决策的能源消耗显著降低。
  • 零 token 生成:直接返回概率和类型化答案,而非生成文本。
  • 高性能:在 M3 Max 硬件上的游戏循环中,可持续每秒约 50 次决策。
  • 独立推理:无需 PyTorch、Transformers 或 MLX 即可运行推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目