OpenBMB/MiniCPM-V

A Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone

何を解決するか

MiniCPM-V と MiniCPM-o は、画像、動画、音声の理解能力を大幅に損なうことなく、モバイルデバイス(iOS、Android、HarmonyOS)に効率的にデプロイ可能な高性能なマルチモーダル大規模言語モデル(MLLM)を提供します。

仕組み

  • MiniCPM-V 4.6 は、SigLIP2-400M と Qwen3.5-0.8B を基盤とする 1.3B パラメータアーキテクチャです。視覚エンコーディングの計算コストを 50% 以上削減する「イントラ-ViT早期圧縮」技術を採用し、精度と速度のバランスを取るために 4x/16x の混合視覚トークン圧縮をサポートしています。
  • MiniCPM-o 4.5 は 9B パラメータのオムニモーダルモデルで、リアルタイムでフルデュプレックス(双方向)のインタラクションが可能です。これは、ストリーミング動画や音声入力を処理しながら、同時に音声とテキスト出力を生成できるため、ブロッキングがなく、能動的な対話が可能になります。

対象ユーザー

  • モバイル開発者:スマートフォンに先進的な視覚言語またはオムニモーダル機能を直接統合したい人。
  • AI研究者:効率的な MLLM アーキテクチャやエッジデプロイ技術に興味がある人。
  • ローカル LLM ユーザー:Ollama、vLLM、llama.cpp などのフレームワークを使って自前ハードウェアでマルチモーダルモデルを実行したい人。

特徴

  • エッジ最適化:iOS、Android、HarmonyOS へのデプロイを目的としており、オープンソースの適応コードを提供。
  • 高効率性:MiniCPM-V 4.6 は、Qwen3.5-0.8B よりも約 1.5 倍のトークンスループットを達成。性能はさらに強化されています。
  • オムニモーダルインタラクション:MiniCPM-o 4.5 はリアルタイムで視覚、聴覚、発話の同時処理をサポート。
  • 広範なフレームワーク対応:SGLang、vLLM、llama.cpp、Ollama、SWIFT、LLaMA-Factory と互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト