WJZ-P/gemini-skill

gemini drawing MCP & skill through browser, can be used in openclaw or any agent that supports MCP. Gemini画图 MCP和sill,支持龙虾或任何agent使用٩(๑>◡<๑)۶

解决的问题

Gemini Skill 使 Gemini 网页界面的自动化成为可能,让用户无需手动操作浏览器即可执行 AI 图像生成、多轮文本对话和图像提取等任务。它弥合了 AI 代理(通过 Model Context Protocol)与 Gemini 网页 UI 之间的差距,将网页界面有效地转变为可编程工具。

工作原理

该项目使用 Chrome DevTools Protocol (CDP) 和 Puppeteer(带有防机器人检测的隐身插件)来控制浏览器实例。采用「守护进程」架构,后台进程管理浏览器的生命周期,在 30 分钟无活动后自动关闭以节省资源。

它被实现为一个 MCP(Model Context Protocol)服务器,意味着它可以接入任何兼容 MCP 的 AI 客户端(如 Claude 或 CodeBuddy)。AI 客户端向 MCP 服务器发送请求,服务器将这些请求转换为在 gemini.google.com 上的浏览器操作。

适用人群

  • 希望让其代理具备使用 Gemini 网页功能(尤其是图像生成)能力的 AI 代理开发者
  • 希望自动化 Gemini 网页界面中重复性任务的高级用户
  • 希望通过标准化协议将 Gemini 的网页功能集成到其他工作流中的开发者

主要亮点

  • 完全自动化:支持图像生成、参考图像上传以及高清图像下载
  • MCP 集成:标准化接口,允许任何 MCP 兼容客户端控制 Gemini
  • 智能生命周期管理:后台守护进程按需自动启动浏览器,并在无活动后延迟销毁
  • 防检测机制:使用 puppeteer-extra-plugin-stealth 绕过自动化检测
  • 图像处理:内置功能可自动移除下载图像中的水印
  • Atlas Cloud 支持:包含可选的 OpenAI 兼容提供者,支持直接通过 API 访问多种模型

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目