SamurAIGPT/Generative-Media-Skills
Multi-modal Generative Media Skills for AI Agents (Claude Code, Cursor, Gemini CLI). High-quality image, video, and audio generation powered by muapi.ai.
何を解決するか
このプロジェクトは、AIエージェント(Claude Code、Cursor、Gemini CLIなど)が、プロフェッショナル級の画像、動画、音声を生成、編集、表示するための包括的なツールセットを提供します。これは、高度なクリエイティブな意図と、さまざまなAIモデルを使用して高品質なマルチモーダルメディアを生成するために必要な技術的なAPI呼び出しとの間のギャップを埋めるものです。
仕組み
このシステムは、muapi-cliを活用して100以上のAIモデル(Midjourney、Flux、Klingを含む)と対話するための、スキーマ駆動型アーキテクチャに基づいて構築されています。主に2つのレイヤーで構成されています:
- Core Primitives: CLIの薄いラッパーであり、生のAPIアクセスを提供し、ファイルのアップロード、基本的な画像編集、認証などのタスクを処理します。
- Expert Library: クリエイティブな目標を技術的な指示に変換する、価値の高い「スキル」のコレクションです。これには、シネマトグラフィ、UIデザイン、ブランディングのための専門的なワークフローが含まれます。
さらに、MCP (Model Context Protocol) サーバーを提供しており、エージェントがシェルスクリプトを実行することなく、19個の構造化されたツールを直接呼び出すことができます。
対象ユーザー
マルチモーダルなコンテンツ作成を自動化するためにAIエージェントを使用している開発者やクリエイター、特にClaude DesktopやCursorのようなMCP互換ツールを利用している方を対象としています。
ハイライト
- Agent-Native Design: エージェントのパイプラインにシームレスに統合するために、構造化されたJSON出力とセマンティックな終了コードを使用します。
- Expert Knowledge Layer: プロフェッショナルな映画演出、UIのためのアトミックデザイン、ロゴのための幾何学的プリミティブを含む、構築済みのスキルが含まれています。
- Extensive Recipe Pack: 写真を3Dアクションフィギュアに変換したり、映画のような製品広告を作成したりするような、41個のLLMオーケストレーションによるワークフローレシピを特徴としています。
- Broad Model Support: Midjourney v7、Flux Kontext、Seedance 2.0、Kling 3.0を含む幅広いモデルにワンクリックでアクセスできます。
- Direct Media Display: 生成されたメディアをシステムのビューアで自動的に開く
--viewフラグが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト