QwenLM/Qwen-MM-Plugins
Make any agent harness multimodal-native.
解決的問題
提供一組原生多模態插件,讓 AI 代理能直接處理圖像、影片、音訊、3D 模型與 CAD 檔案等多樣化媒體類型,無需依賴獨立的 API 或基本 shell 命令。
工作原理
功能以「技能」與可選的 MCP(模型上下文協定)伺服器形式安裝。這些插件可與各種代理框架(如 Claude Code 或 Qwen Code)整合,賦予底層模型讀取本機檔案、呼叫專用模型服務進行 OCR 與轉錄,甚至控制外部軟體(如 Blender 與 FreeCAD)的能力。
適用對象
希望為 Qwen 模型加入多模態能力的 AI 代理開發者,以及需要 AI 處理複雜媒體任務(如影片分析、文件視覺化或 3D 建模)的代理框架使用者。
主要亮點
- 核心媒體處理:原生支援本地影像、影片畫格與文件的讀取,支援裁切與邊界框標註。
- 專用工具:可直接控制 3D 軟體,包括 Blender(建模/渲染)與 FreeCAD(參數化 CAD)。
- 高階影片記憶:為長影片提供階層式記憶,支援無需重新觀看整個檔案即可查詢。
- 全方位能力:具備音視覺記憶能力,可將教學影片轉換為帶插圖的 PDF。
- 廣泛整合:支援多種代理框架,並使用
uv實現按需 Python 依賴管理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案