lidge-jun/ima2-gen

Local-first visual generation runtime and studio for people and coding agents, with reproducible image and video workflows across multiple providers.

何を解決するか

ima2-gen は、複数の AI プロバイダー間で画像および動画生成を簡素化するローカル優先のビジュアル生成スタジオを提供します。異なる Web インターフェースを切り替える必要がなく、さまざまな API および OAuth フローを単一のランタイムに統合。プロフェッショナルな反復ツールとして、ノードベースの分岐、クリーニング用キャンバス、コードエージェント向けの専用ワークフローを追加しています。

動作方法

このプロジェクトはビジュアル生成ランタイムおよびスタジオとして機能します。OpenAI(OAuth/API)、Grok(OAuth/API)、Gemini(Antigravity CLI または直接 API による)、NovelAI、ComfyUI など、幅広いプロバイダーに接続できます。これらの接続はコアレジストリを通じて管理され、CLI と Web ベースの UI の両方で操作可能です。

主な運用モードは以下の通りです:

  • クラシックモード:参照画像をサポートする標準的なテキストから画像/動画生成。
  • ノードモード:成功した生成を複数の方向に分岐させ、反復のビジュアルグラフを作成可能。
  • umaキャンバスモード:ズーム、パン、注釈、背景のクリーニング(ワンクリック GPT 透過ツールを含む)に特化した空間。
  • ストーリーボードモード:動画および画像制作におけるキャラクターやシーンの連続性を維持。

対象ユーザー

  • ビジュアルクリエイター:複数の AI 画像・動画生成器を統合したインターフェースが必要な人。
  • AI コーディングエージェントima2 CLI を使ってアセット生成、フロントエンド設計、UI/UX デザインを実行できるパッケージ化された「スキル」(Markdown 指示)を備えています。
  • 開発者:再現可能なワークフローとローカルギャラリーによるアセット管理が可能なローカル優先ツールを求める人。

特徴

  • マルチプロバイダー対応:OpenAI、Grok、Gemini、NovelAI、ComfyUI への統合アクセス。
  • 高度な反復機能:ノードベースの分岐と、ターゲットクリーニング・注釈用キャンバス。
  • 動画機能:Grok を通じたテキストから動画、画像から動画の生成、キーフレーム抽出をサポート。
  • エージェント対応:AI コーディングエージェント向けに最適化されたフロントエンドおよび UI/UX デザイン用の専用スキルセット。
  • ローカル優先:セッション認識の履歴とローカルプロンプトライブラリのインポートを備えたローカルギャラリー。
  • ベクタライゼーション:ラスターアートを実際の SVG パスにトレース可能。
  • SSE マルチプレクシング:並列ジョブ中にブラウザの接続制限を回避するため、1 つの Server-Sent Events 接続を使用。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト