Arm과 ExecuTorch 0.7: 생성 AI를 수십억 대의 디바이스로 확장

KleidiAI와 ExecuTorch 0.7을 통한 자동 가속

ExecuTorch 0.7 베타는 Arm KleidiAI를 통합하여 Android 및 크로스 플랫폼 개발자에게 즉시 사용 가능한 성능을 제공합니다. KleidiAI는 XNNPack, MediaPipe, MNN, ONNX Runtime, llama.cpp와 같은 널리 사용되는 Edge AI 프레임워크에 삽입되는 AI 가속기 레이어입니다.

ExecuTorch 0.7에서 KleidiAI를 기본으로 활성화함으로써, 개발자는 맞춤 튜닝이나 코드 변경 없이 즉시 성능 최적화에 접근할 수 있습니다. 그 결과:

  • 더 빠른 모델 시작
  • 낮은 지연 시간
  • 더 적은 메모리 사용량

광범위한 하드웨어 호환성을 위한 SDOT 활용

주요 스마트폰을 넘어 GenAI 접근성을 확대하기 위해, Arm은 SDOT(Signed Dot Product) 명령어를 활용하고 있습니다. Armv8.2 아키텍처에 도입된 SDOT는 8비트 부호 있는 정수 벡터에 대한 효율적인 내적 연산을 가능하게 하며, 이는 Int8 또는 Int4 정밀도 형식을 사용하는 LLM을 구동하는 행렬 곱셈 루틴을 가속화하는 데 핵심적입니다.

SDOT는 Arm 생태계 전반에 걸쳐 널리 지원되어 약 30억 대(전체 Arm 기반 디바이스의 약 72%)에 적용됩니다. 이러한 광범위한 가용성 덕분에 Llama 3.2 1B와 같은 모델이 대부분의 Android 디바이스와 Raspberry Pi 5와 같은 엣지 하드웨어에서 효율적으로 실행될 수 있습니다.

성능 벤치마크 및 사용 사례

고성능 하드웨어 성능

ExecuTorch와 KleidiAI 간의 이전 협업은 I8MM 기능(Armv8.6 아키텍처 이상)을 활용한 Int4 행렬 곱셈에 초점을 맞추었습니다. Galaxy S24+에서 이 구성을 사용했을 때 다음과 같은 성과를 얻었습니다:

  • Prefill 성능: 비KleidiAI 커널보다 20% 이상 향상되어 초당 350 토큰 이상을 처리합니다.
  • Decode 성능: 초당 40 토큰 이상.

이 성능은 실시간 온디바이스 작업에 충분하며, 예를 들어 약 600 토큰(대략 50개의 읽지 않은 메시지)을 부드러운 사용자 경험으로 요약할 수 있습니다.

구형 하드웨어에서의 접근성

SDOT 확장만 지원하는 디바이스는 플래그십 속도에 미치지 못할 수 있지만, 디코드 단계는 평균 인간 독서 속도보다 빠른 경우가 많습니다. 이를 통해 여러 실용적인 오프라인 GenAI 사용 사례가 가능해집니다:

  • 프라이빗 스마트 어시스턴트: 로컬 LLM을 음성-텍스트 및 텍스트-음성 모델과 결합하여 완전 오프라인 음성 기반 상호작용을 구현합니다.
  • 컨텍스트 인식 텍스트 완성: 인터넷 연결 없이 로컬 텍스트 편집기에서 실시간으로 지능형 제안을 제공하여 글쓰기 또는 코딩 워크플로를 지원합니다.

결론

SDOT, KleidiAI, ExecuTorch 0.7의 결합을 통해 Arm은 생성 AI 기능을 수십억 대의 기존 디바이스로 확장하고 있으며, 기술을 고성능 플래그십을 넘어 전 세계 하드웨어의 더 넓은 기반으로 확장하고 있습니다.

Sources