WJZ-P/gemini-skill

gemini drawing MCP & skill through browser, can be used in openclaw or any agent that supports MCP. Gemini画图 MCP和sill,支持龙虾或任何agent使用٩(๑>◡<๑)۶

해결하는 문제

Gemini Skill은 Gemini 웹 인터페이스의 자동화를 가능하게 하여, 사용자가 브라우저를 수동으로 조작하지 않고도 AI 이미지 생성, 다중 라운드 텍스트 대화, 이미지 추출과 같은 작업을 수행할 수 있도록 합니다. AI 에이전트(모델 컨텍스트 프로토콜을 통해)와 Gemini 웹 UI 사이의 격차를 메우며, 웹 인터페이스를 프로그래머블 도구로 전환합니다.

작동 방식

이 프로젝트는 Chrome DevTools Protocol (CDP)와 Puppeteer(봇 탐지 회피를 위한 스테이슬스 플러그인 포함)를 사용하여 브라우저 인스턴스를 제어합니다. 백그라운드 프로세스가 브라우저의 수명 주기를 관리하는 "데몬" 아키텍처를 채택하여, 30분간 비활성 상태가 지속되면 자동으로 종료하여 리소스를 절약합니다.

MCP(Model Context Protocol) 서버로 구현되어 있어, Claude나 CodeBuddy와 같은 MCP 호환 AI 클라이언트에 연결할 수 있습니다. AI 클라이언트는 MCP 서버에 요청을 보내며, 서버는 이를 gemini.google.com에서 브라우저 작업으로 변환합니다.

대상 사용자

  • Gemini의 웹 기능(특히 이미지 생성)을 사용할 수 있도록 하고 싶은 AI 에이전트 개발자
  • Gemini 웹 인터페이스에서 반복적인 작업을 자동화하고 싶은 파워 유저
  • 다른 워크플로우에 Gemini의 웹 기능을 표준화된 프로토콜을 통해 통합하고 싶은 개발자

주요 기능

  • 완전 자동화: 이미지 생성, 참조용 이미지 업로드, 고해상도 이미지 다운로드 지원
  • MCP 통합: 표준화된 인터페이스로 MCP 호환 클라이언트가 Gemini를 제어할 수 있음
  • 스마트 수명 주기 관리: 백그라운드 데몬이 필요 시 브라우저를 자동으로 시작하고 비활성 후 지연 종료 처리
  • 탐지 회피: puppeteer-extra-plugin-stealth를 사용해 자동화 검사를 우회
  • 이미지 처리: 다운로드한 이미지에서 자동으로 워터마크 제거 기능 내장
  • Atlas Cloud 지원: 다양한 모델에 대한 직접 API 접근을 가능하게 하는 선택적 OpenAI 호환 제공자 포함

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트