mizorewww/laya-coreml

Local Laya typed decisions on Apple Core ML and Neural Engine. Validated ports, ~5 ms short decisions on M3 Max, reproducible speed and energy benchmarks.

해결하는 문제

Laya-CoreML은 Apple Silicon에서 '타입 기반 결정' 모델을 매우 낮은 지연 시간과 높은 에너지 효율로 실행할 수 있는 방법을 제공합니다. 자동 회귀 디코딩(토큰을 하나씩 생성)의 필요성을 제거하여, 생성된 JSON이나 텍스트를 파싱하는 오버헤드 없이 모델이 확률, 점수, 불리언 값을 즉시 반환할 수 있게 합니다.

작동 방식

이 프로젝트는 Laya 모델을 Apple의 Core ML 프레임워크로 포팅하며, 특히 Apple 신경 엔진(ANE)에 최적화합니다. 비생성적 의사 결정 방식을 사용하여 주어진 입력에 대해 단일 샷 예측을 생성할 수 있습니다. ANE 최적화 버전은 특정 아키텍처 조정(BC1L 활성화 및 1x1 프로젝션 등)을 사용하여 워크로드가 CPU나 GPU뿐만 아니라 신경 엔진에서 실행되도록 하여 전력 소비를 크게 줄이고 속도를 높입니다.

대상

  • macOS에서 실시간 에이전트를 구축하는 개발자(포함된 Snake 게임 데모 등).
  • Apple 하드웨어에서 빠르고 저전력 분류 또는 의사 결정이 필요한 애플리케이션.
  • PyTorch나 Transformers 같은 무거운 종속성 없이 로컬에서 다국어 결정 모델을 실행하려는 사용자.

주요 특징

  • 신경 엔진 최적화: MLX FP16 구현에 비해 결정당 에너지 소비를 크게 줄입니다.
  • 제로 토큰 생성: 텍스트를 생성하는 대신 직접 확률과 타입 기반 답변을 반환합니다.
  • 고성능: M3 Max 하드웨어의 게임 루프에서 초당 약 50회의 결정을 유지할 수 있습니다.
  • 독립적 추론: 추론 실행에 PyTorch, Transformers 또는 MLX가 필요하지 않습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트