OpenBMB/MiniCPM-o-Demo

Official PyTorch+CUDA Full-functional Web Demo for MiniCPM-o 4.5

何を解決するか

このプロジェクトは、リアルタイムで双方向のオムニモーダル対話が可能なミニCPM-o 4.5用のデモシステムを提供します。モデルが同時に視覚、音声を認識し、応答できるようにすることで、相互のブロッキングを回避し、従来のターンベースAI対話よりも滑らかな会話体験を実現します。

動作方法

システムはPyTorch + CUDA推論バックエンド(必要に応じてllama.cpp経由のC++バックエンドも利用可能)と軽量なフロントエンド・バックエンドアーキテクチャを使用しています。時間分割多重(TDM)メカニズムにより、ミリ秒単位のタイムライン上で入力と出力ストリームを同期し、連続する動画および音声ストリームを処理しながら、同時にテキストと音声出力を生成します。モデルは1Hzの頻度でストリームを監視し、自発的に会話の開始を判断するプロアクティブなインタラクションメカニズムを採用しています。

対象ユーザー

  • リアルタイムマルチモーダルAIインターフェースの実装やテストを検討する開発者
  • エンドツーエンドのオムニモーダルアーキテクチャや双方向ストリーミングに興味を持つ研究者
  • ローカルGPUやPC上で高性能な視覚言語および音声機能を体験したいユーザー

特徴

  • 双方向対話: モデルが同時に視覚、音声を認識し、応答できるリアルタイムオムニモーダルライブストリーミングをサポート。
  • プロアクティブなインタラクション: モデルがシーンの継続的な理解に基づき、自発的にリマインダーまたはコメントを発言可能。
  • オムニモーダル機能: 視覚性能(一部のベンチマークでGPT-4oを上回る)、バイリンガルリアルタイム音声、最先端のOCRを統合。
  • 柔軟なデプロイ: PyTorch、C++(llama.cpp)、さまざまな量子化形式(int4、GGUF)をサポートし、GPU、PC、MacBookなど多様な環境に展開可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト