SamurAIGPT/Generative-Media-Skills
Multi-modal Generative Media Skills for AI Agents (Claude Code, Cursor, Gemini CLI). High-quality image, video, and audio generation powered by muapi.ai.
解決的問題
本專案為 AI 代理(如 Claude Code、Cursor 和 Gemini CLI)提供了一套完整的工具集,用於生成、編輯和顯示專業級的圖像、影片和音訊。它彌合了高階創作意圖與使用各種 AI 模型產出高品質多模態媒體所需的技術 API 呼叫之間的差距。
運作方式
該系統建立在架構導向架構之上,利用 muapi-cli 與超過 100 個 AI 模型(包括 Midjourney、Flux 和 Kling)進行互動。它分為兩個主要層級:
- 核心基元: CLI 的輕量級封裝,用於原始 API 存取,處理檔案上傳、基本圖像編輯和身分驗證等任務。
- 專家函式庫: 一系列高價值的「技能」,將創作目標轉化為技術指令。這包括電影攝影、UI 設計和品牌設計的專門工作流程。
此外,它還提供了一個 MCP (Model Context Protocol) 伺服器,允許代理直接呼叫 19 個結構化工具,而無需執行 shell 指令稿。
適用對象
專為使用 AI 代理來自動化多模態內容創作的開發人員和創作者設計,特別是那些使用 Claude Desktop 或 Cursor 等相容 MCP 工具的使用者。
亮點
- 代理原生設計: 使用結構化的 JSON 輸出和語意退出代碼,以無縫整合到代理工作流程中。
- 專家知識層: 包含用於專業電影導演、UI 原子設計和標誌幾何基元的預建技能。
- 豐富的配方包: 具備 41 個由 LLM 編排的工作流程配方,例如將照片轉換為 3D 公仔或建立電影級產品廣告。
- 廣泛的模型支援: 一鍵存取各種模型,包括 Midjourney v7、Flux Kontext、Seedance 2.0 和 Kling 3.0。
- 直接媒體顯示: 包含一個
--view旗標,可自動在系統檢視器中開啟生成的媒體。
相關
- 專案
- 專案
- 專案
- 專案