OpenBMB/MiniCPM-o-Demo

Official PyTorch+CUDA Full-functional Web Demo for MiniCPM-o 4.5

解决的问题

本项目提供 MiniCPM-o 4.5 的演示系统,该模型专为实时、全双工交互设计。它解决了在不相互阻塞的情况下演示模型同时看、听、说能力的挑战,提供了一种超越传统轮次式 AI 交互的流畅对话体验。

工作原理

系统采用 PyTorch + CUDA 推理后端(可选通过 llama.cpp 使用 C++ 后端)和轻量级前后端架构。它使用时间分割多路复用(TDM)机制,在毫秒级时间线上同步输入和输出流,使模型能够处理连续的视频和音频流,同时生成并发的文本和语音输出。主动交互机制使模型以 1Hz 频率监控流,自主决定何时启动语音。

适用人群

  • 开发者:希望实现或测试实时多模态 AI 接口的用户
  • 研究人员:对端到端全模态架构和全双工流式传输感兴趣的用户
  • 用户:希望在本地 GPU 或 PC 上体验高性能视觉-语言和语音能力的用户

主要亮点

  • 全双工交互:支持实时全模态直播流,模型可同时观看、聆听和说话
  • 主动交互:模型可根据对场景的持续理解,自主发起提醒或评论
  • 全模态能力:融合强大视觉性能(部分基准超越 GPT-4o)、双语实时语音和业界领先的 OCR
  • 灵活部署:支持 PyTorch、C++(llama.cpp)及多种量化格式(int4、GGUF),可在 GPU、PC 和 MacBook 上部署

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目