QwenLM/Qwen-MM-Plugins

Make any agent harness multimodal-native.

解決的問題

提供一組原生多模態插件,讓 AI 代理能直接處理圖像、影片、音訊、3D 模型與 CAD 檔案等多樣化媒體類型,無需依賴獨立的 API 或基本 shell 命令。

工作原理

功能以「技能」與可選的 MCP(模型上下文協定)伺服器形式安裝。這些插件可與各種代理框架(如 Claude Code 或 Qwen Code)整合,賦予底層模型讀取本機檔案、呼叫專用模型服務進行 OCR 與轉錄,甚至控制外部軟體(如 Blender 與 FreeCAD)的能力。

適用對象

希望為 Qwen 模型加入多模態能力的 AI 代理開發者,以及需要 AI 處理複雜媒體任務(如影片分析、文件視覺化或 3D 建模)的代理框架使用者。

主要亮點

  • 核心媒體處理:原生支援本地影像、影片畫格與文件的讀取,支援裁切與邊界框標註。
  • 專用工具:可直接控制 3D 軟體,包括 Blender(建模/渲染)與 FreeCAD(參數化 CAD)。
  • 高階影片記憶:為長影片提供階層式記憶,支援無需重新觀看整個檔案即可查詢。
  • 全方位能力:具備音視覺記憶能力,可將教學影片轉換為帶插圖的 PDF。
  • 廣泛整合:支援多種代理框架,並使用 uv 實現按需 Python 依賴管理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案