WJZ-P/gemini-skill
gemini drawing MCP & skill through browser, can be used in openclaw or any agent that supports MCP. Gemini画图 MCP和sill,支持龙虾或任何agent使用٩(๑>◡<๑)۶
解決的問題
Gemini Skill 可自動化 Gemini 網頁介面,讓使用者無需手動操作瀏覽器,即可執行 AI 圖像生成、多輪文字對話與圖像提取等任務。它彌補了 AI 代理(透過 Model Context Protocol)與 Gemini 網頁 UI 之間的差距,有效將網頁介面轉化為可程式化的工具。
工作原理
本專案使用 Chrome DevTools Protocol (CDP) 與 Puppeteer(搭配防機器人偵測的隱蔽插件)來控制瀏覽器實例。採用「守護程序」架構,背景程序管理瀏覽器的生命週期,在 30 分鐘無活動後自動關閉以節省資源。
它被實作為一個 MCP(Model Context Protocol)伺服器,表示可接入任何支援 MCP 的 AI 客戶端(如 Claude 或 CodeBuddy)。AI 客戶端將請求發送至 MCP 伺服器,伺服器隨即將這些請求轉譯為在 gemini.google.com 上的瀏覽器操作。
適用對象
- 希望讓其代理具備使用 Gemini 網頁功能(特別是圖像生成)能力的 AI 代理開發者
- 希望自動化 Gemini 網頁介面中重複性任務的進階使用者
- 希望透過標準化協定將 Gemini 的網頁功能整合至其他工作流程的開發者
主要特色
- 完全自動化:支援圖像生成、參考圖像上傳與高解析度圖像下載
- MCP 整合:標準化介面,讓任何 MCP 相容客戶端皆可控制 Gemini
- 智慧生命週期管理:背景守護程序可依需求自動啟動瀏覽器,並在無活動後延遲銷毀
- 防偵測機制:使用
puppeteer-extra-plugin-stealth繞過自動化檢測 - 圖像處理:內建功能可自動移除下載圖像中的水印
- Atlas Cloud 支援:包含可選的 OpenAI 相容提供者,支援直接透過 API 存取各種模型
相關
- 專案
- 專案
- 專案
- 專案
- 專案