UbiquitousLearning/mllm

Fast Multimodal LLM on Mobile Devices

해결하는 문제

mllm은 모바일 및 엣지 디바이스를 위해 특별히 설계된 빠르고 가벼운 멀티모달 LLM 추론 엔진입니다. 고수준 모델 최적화 알고리즘과 저수준 하드웨어 가속 레이어를 연결하는 통합 프레임워크를 제공함으로써, 리소스가 제한된 하드웨어에서 대규모 멀티모달 모델을 실행하는 문제를 해결합니다.

작동 원리

이 엔진은 AI 추론 스택의 중앙 허브 역할을 수행하며, 최적화 기술(양자화, 가지치기, 투기적 디코딩 등)과 하드웨어별 런타임(CUDA, CANN, MLIR 등)을 연결합니다. mllm-convertor를 사용하여 PyTorch 및 SafeTensors 모델을 가져와 실행을 위한 전용 mllm 형식으로 변환합니다.

주요 기술 구현 사항:

  • 하드웨어 백엔드: Arm CPU, OpenCL GPU, QNN NPU 및 Ascend NPU 지원.
  • Android 아키텍처: 인앱 Go 서버(mllm_server.aar)를 사용하는 클라이언트-서버 설계를 통해 UI와 무거운 추론 계산을 분리.
  • 그래프 추출: trace API를 통해 동적 모델 실행을 최적화된 정적 계산 그래프로 변환하여 직렬화 및 배포 성능 향상.
  • 최적화: W4A16 및 W8A8을 포함한 다양한 양자화 경로를 지원하며, Jetson Orin을 위한 특정 최적화(AWQ 및 Marlin GEMM 사용) 제공.

대상 사용자

높은 처리량과 낮은 지연 시간으로 멀티모달 모델을 실행해야 하는 엣지 디바이스, Android 스마트폰 및 임베디드 시스템(NVIDIA Jetson 등)용 AI 애플리케이션을 구축하는 개발자 및 엔지니어.

주요 특징

  • 폭넓은 하드웨어 지원: Arm CPU, OpenCL GPU, Qualcomm (QNN) 및 Huawei (Ascend) NPU에서 실행 가능.
  • 엣지에서의 고성능: Qwen3-VL-2B W8A8 기준, AGX Orin 32GB에서 llama.cpp 대비 최대 3.12배의 prefill 속도 향상 달성.
  • Pythonic 모델 작성: 신속한 모델 개발 및 구현을 위한 고수준 API 제공.
  • 광범위한 모델 zoo: Qwen 시리즈, LLaMA, DeepSeek-OCR, Phi-3-Vision을 포함한 다양한 모델 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트