OpenBMB/MiniCPM-V

A Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone

해결하는 문제

MiniCPM-V와 MiniCPM-o는 이미지, 동영상, 오디오 이해 능력을 크게 훼손하지 않으면서도 iOS, Android, HarmonyOS 등 모바일 기기에서 효율적으로 배포할 수 있는 고성능 다중모달 대규모 언어 모델(MLLM)을 제공합니다.

작동 방식

  • MiniCPM-V 4.6는 SigLIP2-400M과 Qwen3.5-0.8B 기반의 1.3B 파라미터 아키텍처를 사용합니다. 시각 인코딩 계산 비용을 50% 이상 줄이는 '내부-ViT 조기 압축' 기술을 적용하고, 정확도와 속도의 균형을 위해 4x/16x 혼합 시각 토큰 압축을 지원합니다.
  • MiniCPM-o 4.5는 9B 파라미터의 오미모달 모델로, 실시간 완전 이중 방향 상호작용이 가능합니다. 즉, 스트리밍 동영상과 오디오 입력을 처리하면서 동시에 음성과 텍스트 출력을 생성할 수 있어 블로킹 없이 능동적인 상호작용이 가능합니다.

대상 사용자

  • 모바일 개발자: 스마트폰에 고급 시각-언어 또는 오미모달 기능을 직접 통합하고자 하는 사람.
  • AI 연구자: 효율적인 MLLM 아키텍처와 엣지 배포 기술에 관심 있는 사용자.
  • 로컬 LLM 사용자: Ollama, vLLM, llama.cpp와 같은 프레임워크를 사용해 자체 하드웨어에서 다중모달 모델을 실행하고자 하는 사람.

주요 특징

  • 엣지 최적화: iOS, Android, HarmonyOS에 특별히 최적화되었으며, 오픈소스 적응 코드를 제공합니다.
  • 고효율성: MiniCPM-V 4.6는 Qwen3.5-0.8B보다 약 1.5배 높은 토큰 처리량을 달성하면서도 더 강력한 기능을 제공합니다.
  • 오미모달 상호작용: MiniCPM-o 4.5는 실시간으로 보고, 듣고, 말하는 동시에 처리할 수 있습니다.
  • 다양한 프레임워크 호환성: SGLang, vLLM, llama.cpp, Ollama, SWIFT, LLaMA-Factory와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트