OpenBMB/MiniCPM-V
A Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone
解决的问题
MiniCPM-V 和 MiniCPM-o 提供高性能多模态大语言模型(MLLM),体积小巧,可在 iOS、Android 和 HarmonyOS 等移动设备上高效部署,同时不显著牺牲图像、视频和音频理解能力。
工作原理
- MiniCPM-V 4.6 基于 SigLIP2-400M 和 Qwen3.5-0.8B 的 1.3B 参数架构。采用内部 ViT 早期压缩技术,将视觉编码计算成本降低超过 50%,并支持 4x/16x 混合视觉标记压缩,以平衡精度与速度。
- MiniCPM-o 4.5 是一个 9B 参数的全模态模型,支持实时全双工交互。这意味着它可以在处理流式视频和音频输入的同时,同步生成语音和文本输出,而不会阻塞,从而实现主动交互。
适用人群
- 移动开发者:希望将先进的视觉-语言或全模态功能直接集成到智能手机上的开发者。
- AI 研究者:对高效 MLLM 架构和边缘部署技术感兴趣的用户。
- 本地 LLM 用户:使用 Ollama、vLLM 或 llama.cpp 等框架在自有硬件上运行多模态模型的用户。
核心亮点
- 边缘优化:专为 iOS、Android 和 HarmonyOS 部署设计,提供开源适配代码。
- 高效率:尽管具备更强能力,MiniCPM-V 4.6 的令牌吞吐量仍比 Qwen3.5-0.8B 高约 1.5 倍。
- 全模态交互:MiniCPM-o 4.5 支持实时同步的视觉、听觉与语音交互。
- 广泛框架支持:兼容 SGLang、vLLM、llama.cpp、Ollama、SWIFT 和 LLaMA-Factory。
相关
- 项目
- 项目
- 项目
- 项目
- 项目