SamurAIGPT/Generative-Media-Skills

Multi-modal Generative Media Skills for AI Agents (Claude Code, Cursor, Gemini CLI). High-quality image, video, and audio generation powered by muapi.ai.

何を解決するか

このプロジェクトは、AIエージェント(Claude Code、Cursor、Gemini CLIなど)が、プロフェッショナル級の画像、動画、音声を生成、編集、表示するための包括的なツールセットを提供します。これは、高度なクリエイティブな意図と、さまざまなAIモデルを使用して高品質なマルチモーダルメディアを生成するために必要な技術的なAPI呼び出しとの間のギャップを埋めるものです。

仕組み

このシステムは、muapi-cliを活用して100以上のAIモデル(Midjourney、Flux、Klingを含む)と対話するための、スキーマ駆動型アーキテクチャに基づいて構築されています。主に2つのレイヤーで構成されています:

  • Core Primitives: CLIの薄いラッパーであり、生のAPIアクセスを提供し、ファイルのアップロード、基本的な画像編集、認証などのタスクを処理します。
  • Expert Library: クリエイティブな目標を技術的な指示に変換する、価値の高い「スキル」のコレクションです。これには、シネマトグラフィ、UIデザイン、ブランディングのための専門的なワークフローが含まれます。

さらに、MCP (Model Context Protocol) サーバーを提供しており、エージェントがシェルスクリプトを実行することなく、19個の構造化されたツールを直接呼び出すことができます。

対象ユーザー

マルチモーダルなコンテンツ作成を自動化するためにAIエージェントを使用している開発者やクリエイター、特にClaude DesktopやCursorのようなMCP互換ツールを利用している方を対象としています。

ハイライト

  • Agent-Native Design: エージェントのパイプラインにシームレスに統合するために、構造化されたJSON出力とセマンティックな終了コードを使用します。
  • Expert Knowledge Layer: プロフェッショナルな映画演出、UIのためのアトミックデザイン、ロゴのための幾何学的プリミティブを含む、構築済みのスキルが含まれています。
  • Extensive Recipe Pack: 写真を3Dアクションフィギュアに変換したり、映画のような製品広告を作成したりするような、41個のLLMオーケストレーションによるワークフローレシピを特徴としています。
  • Broad Model Support: Midjourney v7、Flux Kontext、Seedance 2.0、Kling 3.0を含む幅広いモデルにワンクリックでアクセスできます。
  • Direct Media Display: 生成されたメディアをシステムのビューアで自動的に開く--viewフラグが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト