OpenBMB/MiniCPM-V
A Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone
何を解決するか
MiniCPM-V と MiniCPM-o は、画像、動画、音声の理解能力を大幅に損なうことなく、モバイルデバイス(iOS、Android、HarmonyOS)に効率的にデプロイ可能な高性能なマルチモーダル大規模言語モデル(MLLM)を提供します。
仕組み
- MiniCPM-V 4.6 は、SigLIP2-400M と Qwen3.5-0.8B を基盤とする 1.3B パラメータアーキテクチャです。視覚エンコーディングの計算コストを 50% 以上削減する「イントラ-ViT早期圧縮」技術を採用し、精度と速度のバランスを取るために 4x/16x の混合視覚トークン圧縮をサポートしています。
- MiniCPM-o 4.5 は 9B パラメータのオムニモーダルモデルで、リアルタイムでフルデュプレックス(双方向)のインタラクションが可能です。これは、ストリーミング動画や音声入力を処理しながら、同時に音声とテキスト出力を生成できるため、ブロッキングがなく、能動的な対話が可能になります。
対象ユーザー
- モバイル開発者:スマートフォンに先進的な視覚言語またはオムニモーダル機能を直接統合したい人。
- AI研究者:効率的な MLLM アーキテクチャやエッジデプロイ技術に興味がある人。
- ローカル LLM ユーザー:Ollama、vLLM、llama.cpp などのフレームワークを使って自前ハードウェアでマルチモーダルモデルを実行したい人。
特徴
- エッジ最適化:iOS、Android、HarmonyOS へのデプロイを目的としており、オープンソースの適応コードを提供。
- 高効率性:MiniCPM-V 4.6 は、Qwen3.5-0.8B よりも約 1.5 倍のトークンスループットを達成。性能はさらに強化されています。
- オムニモーダルインタラクション:MiniCPM-o 4.5 はリアルタイムで視覚、聴覚、発話の同時処理をサポート。
- 広範なフレームワーク対応:SGLang、vLLM、llama.cpp、Ollama、SWIFT、LLaMA-Factory と互換性があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト