OpenBMB/MiniCPM-V
A Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone
解決的問題
MiniCPM-V 與 MiniCPM-o 提供高效率的多模態大語言模型(MLLM),體積小巧,可在 iOS、Android 與 HarmonyOS 等行動裝置上高效部署,同時不顯著犧牲圖像、影片與音訊理解能力。
工作原理
- MiniCPM-V 4.6 基於 SigLIP2-400M 與 Qwen3.5-0.8B 的 1.3B 參數架構。採用內部 ViT 早期壓縮技術,將視覺編碼計算成本降低超過 50%,並支援 4x/16x 混合視覺標記壓縮,以平衡準確性與速度。
- MiniCPM-o 4.5 是一個 9B 參數的全模態模型,支援即時全雙工互動。這表示它能在處理串流影片與音訊輸入的同時,同步產生語音與文字輸出,不會阻塞,進而實現主動式互動。
適用對象
- 行動開發者:希望將先進的視覺-語言或全模態功能直接整合至智慧型手機的開發者。
- AI 研究者:對高效 MLLM 架構與邊緣部署技術感興趣的使用者。
- 本地 LLM 使用者:使用 Ollama、vLLM 或 llama.cpp 等框架,在自有硬體上執行多模態模型的使用者。
核心亮點
- 邊緣優化:專為 iOS、Android 與 HarmonyOS 部署設計,提供開源適配程式碼。
- 高效率:儘管具備更強能力,MiniCPM-V 4.6 的令牌吞吐量仍比 Qwen3.5-0.8B 高約 1.5 倍。
- 全模態互動:MiniCPM-o 4.5 支援即時同步的視覺、聽覺與語音互動。
- 廣泛框架支援:相容 SGLang、vLLM、llama.cpp、Ollama、SWIFT 與 LLaMA-Factory。
相關
- 專案
- 專案
- 專案
- 專案
- 專案