QwenLM/Qwen-MM-Plugins

Make any agent harness multimodal-native.

解决的问题

提供一组原生多模态插件,使 AI 代理能够直接处理图像、视频、音频、3D 模型和 CAD 文件等多样化媒体类型,而无需依赖独立的 API 或基础 shell 命令。

工作原理

功能以「技能」和可选的 MCP(模型上下文协议)服务器形式安装。这些插件可与各种代理框架(如 Claude Code 或 Qwen Code)集成,赋予底层模型读取本地文件、调用专用模型服务进行 OCR 和转录,甚至控制外部软件(如 Blender 和 FreeCAD)的能力。

适用人群

希望为 Qwen 模型添加多模态能力的 AI 代理开发者,以及需要 AI 处理复杂媒体任务(如视频分析、文档可视化或 3D 建模)的代理框架用户。

主要亮点

  • 核心媒体处理:原生支持本地图像、视频帧和文档的读取,支持裁剪和边界框标注。
  • 专用工具:可直接控制 3D 软件,包括 Blender(建模/渲染)和 FreeCAD(参数化 CAD)。
  • 高级视频内存:为长视频提供分层内存,支持无需重新观看整个文件即可查询。
  • 全能力支持:具备音视频记忆能力,可将教程视频转换为带插图的 PDF。
  • 广泛集成:支持多种代理框架,并使用 uv 实现按需 Python 依赖管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目