OpenBMB/MiniCPM-o-Demo

Official PyTorch+CUDA Full-functional Web Demo for MiniCPM-o 4.5

해결하는 문제

이 프로젝트는 실시간 양방향 상호작용을 위한 오미모달 모델인 MiniCPM-o 4.5용 데모 시스템을 제공합니다. 모델이 서로 방해하지 않도록 동시에 시각, 청각, 음성 출력을 처리할 수 있도록 하여, 기존의 턴기반 AI 상호작용을 뛰어넘는 부드러운 대화 경험을 제공합니다.

작동 방식

시스템은 PyTorch + CUDA 추론 백엔드(선택적 C++ 백엔드는 llama.cpp를 통해 제공)와 가벼운 프론트엔드-백엔드 아키텍처를 사용합니다. 시간 분할 다중화(TDM) 메커니즘을 통해 밀리초 단위의 타임라인에서 입력 및 출력 스트림을 동기화하여, 지속적인 비디오 및 오디오 스트림을 처리하면서 동시에 텍스트 및 음성 출력을 생성합니다. 모델은 1Hz 주기로 스트림을 모니터링하여 자발적으로 대화를 시작할 수 있는 프로액티브 상호작용 메커니즘을 채택합니다.

대상 사용자

  • 실시간 멀티모달 AI 인터페이스 구현 또는 테스트를 원하는 개발자
  • 엔드투엔드 오미모달 아키텍처 및 양방향 스트리밍에 관심 있는 연구자
  • 로컬 GPU 또는 PC에서 고성능 시각-언어 및 음성 기능을 경험하고 싶은 사용자

주요 특징

  • 양방향 상호작용: 모델이 동시에 시각, 청각을 인식하고 음성으로 응답할 수 있는 실시간 오미모달 라이브 스트리밍을 지원합니다.
  • 프로액티브 상호작용: 모델이 장면을 지속적으로 이해하며 자발적으로 알림이나 의견을 제시할 수 있습니다.
  • 오미모달 기능: 강력한 시각 성능(GPT-4o를 일부 벤치마크에서 초과), 양방향 실시간 음성, 최첨단 OCR을 통합합니다.
  • 유연한 배포: PyTorch, C++(llama.cpp), 다양한 양자화 형식(int4, GGUF)을 지원하여 GPU, PC, 맥북 등 다양한 환경에 배포 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트