SamurAIGPT/Generative-Media-Skills

Multi-modal Generative Media Skills for AI Agents (Claude Code, Cursor, Gemini CLI). High-quality image, video, and audio generation powered by muapi.ai.

해결하는 문제

이 프로젝트는 Claude Code, Cursor, Gemini CLI와 같은 AI 에이전트가 전문 수준의 이미지, 영상, 오디오를 생성, 편집, 표시할 수 있도록 포괄적인 도구 세트를 제공합니다. 고수준의 창의적 의도와 다양한 AI 모델을 사용하여 고품질 멀티모달 미디어를 생성하기 위해 필요한 기술적 API 호출 사이의 격차를 메웁니다.

작동 방식

이 시스템은 muapi-cli를 활용하여 100개 이상의 AI 모델(중요한 모델로 Midjourney, Flux, Kling 포함)과 상호작용하는 스키마 기반 아키텍처로 구성되어 있습니다. 두 가지 주요 레이어로 구성되어 있습니다:

  • 핵심 원시 기능: CLI에 대한 얇은 래퍼로, 파일 업로드, 기본 이미지 편집, 인증과 같은 작업을 처리합니다.
  • 전문 라이브러리: 창의적 목표를 기술적 지시로 변환하는 고가치의 "스킬" 모음입니다. 이에는 영화 연출, UI 설계, 브랜딩을 위한 전문 워크플로우가 포함됩니다.

또한, 에이전트가 쉘 스크립트를 실행하지 않고도 19개의 구조화된 도구를 직접 호출할 수 있는 MCP(Model Context Protocol) 서버를 제공합니다.

대상 사용자

MCP 호환 도구(예: Claude Desktop 또는 Cursor)를 사용하는 AI 에이전트를 활용하여 멀티모달 콘텐츠 생성을 자동화하는 개발자 및 창작가를 위한 것입니다.

주요 특징

  • 에이전트 내재형 설계: 구조화된 JSON 출력과 의미적 종료 코드를 사용하여 에이전트 파이프라인에 원활하게 통합됩니다.
  • 전문 지식 계층: 전문적인 영화 연출, UI를 위한 원자적 디자인, 로고를 위한 기하학적 원시 형태를 위한 사전 구축된 스킬이 포함되어 있습니다.
  • 풍부한 레시피 팩: LLM이 조율하는 워크플로우 레시피 41개가 포함되어 있으며, 예를 들어 사진을 3D 액션 피규어로 변환하거나 영화 같은 제품 광고를 생성하는 등의 작업이 가능합니다.
  • 광범위한 모델 지원: Midjourney v7, Flux Kontext, Seedance 2.0, Kling 3.0 등 다양한 모델에 한 번의 클릭으로 접근할 수 있습니다.
  • 직접 미디어 표시: 생성된 미디어를 시스템 뷰어에서 자동으로 열 수 있는 --view 플래그를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트