SamurAIGPT/Generative-Media-Skills
Multi-modal Generative Media Skills for AI Agents (Claude Code, Cursor, Gemini CLI). High-quality image, video, and audio generation powered by muapi.ai.
해결하고자 하는 문제
이 프로젝트는 Claude Code, Cursor, Gemini CLI와 같은 AI 에이전트가 전문 수준의 이미지, 비디오, 오디오를 생성·편집할 수 있도록 포괄적인 툴셋을 제공합니다. 고수준의 창의적 의도와 고품질 멀티모달 미디어를 만들기 위해 필요한 기술 API 호출 사이의 격차를 메우며, 다양한 AI 모델을 활용합니다.
작동 방식
시스템은 muapi-cli 로 구동되는 Core/Library 아키텍처 위에 구축되었습니다:
- 코어 프리미티브: CLI에 대한 얇은 래퍼로, 원시 API 접근, 파일 업로드, 기본 편집 및 인증을 처리합니다.
- 전문가 라이브러리: 영화 감독, UI 디자이너, 로고 제작자 등 도메인별 스킬이 창의적 목표를 기술 지시로 변환합니다.
- 레시피 팩: 40개가 넘는 LLM 오케스트레이션 워크플로 레시피(예: 사진을 3D 액션 피규어로 변환하거나 시네마틱 제품 광고 제작)를 제공해 에이전트가 단계별 지시를 따라 실행할 수 있습니다.
- MCP 서버: Model Context Protocol 서버로, 19개의 구조화된 도구를 호환 에이전트에 직접 노출시켜 쉘 스크립트 필요성을 없앱니다.
대상 사용자
전문 멀티모달 생성 기능을 에이전트 워크플로에 통합하고자 하는 개발자 및 AI 에이전트 사용자, 특히 Claude Desktop이나 Cursor와 같은 MCP 호환 도구를 사용하는 사람들을 위한 것입니다.
하이라이트
- 에이전트 네이티브 설계: 구조화된 JSON 출력과 의미론적 종료 코드를 사용해 파이프라인 통합을 원활하게 합니다.
- 광범위한 모델 지원: Midjourney v7, Flux, Kling 3.0, Veo3 등 100개 이상의 모델에 접근할 수 있습니다.
- 미디어 직접 표시:
--view플래그를 통해 생성된 미디어를 시스템 뷰어에서 자동으로 열 수 있습니다. - 전문 워크플로: AI 클리핑(긴 영상을 세로형 쇼츠로 변환), 패션 착용, 건축 렌더링 등 전용 파이프라인을 제공합니다.