freestylefly/awesome-gpt-image-2
GPT-Image2向けのプロムプト・アス・コードシステムとテンプレートライブラリ。文章形式のプロンプトを、安定的で制御可能なAI画像生成のための構造化されたプロトコルに変換します。
yang0/handraw-style
216の番号付き手描きイラストスタイルと、すぐに使える二か国語プロンプトのカレクト、さらにシンプルなWebギャラリー。ユーザーはスタイルIDを選んで主題を追加するだけで、テキストから画像AIで動作するプロンプトが得られ、スタイルを自分で説明しなくても一貫した視覚的トーンを確保できる。
abi/screenshot-to-code
screenshot‑to‑codeは、Gemini、GPT‑5.5、ClaudeなどのLLMを使用して、UIスクリーンショット、モックアップ、または短い画面録画を、すぐに実行可能なフロントエンドコード(HTML/CSS、React、Vueなど)に変換するオープンソースアプリで、オプションでアセット抽出やビジュアルプレビューも可能です。
aldegad/sprite-gen
AI生成パイプラインを使用して、単一のベース画像をゲーム対応の透明スプライトアトラスまたはアニメーションループに変換するPython CLIおよびエージェントスキル。
perseval-BLR/NeuralScreen
NeuralScreen は、NVIDIA の DLSS 5 神経アップスケーリング(およびオプションのフレーム生成)をリアルタイムでデスクトップ全体または個別ウィンドウに適用する Windows ユーティリティであり、より鮮明なビジュアル、スクリーンショット/録画ツール、およびカスタマイズ可能なオーバーレイ UI を提供します。
s1dashu/ip-as-logo-skill
一貫した構図とスタイルを持つ、シンプルでかわいらしい、商業的に利用可能なIPマスコットキャラクターを生成するためのAIエージェントスキル。
upscayl/upscayl
Real-ESRGAN と Vulkan を使用して、品質を損なうことなく低解像度画像を拡大・強化する、無料でオープンソースの AI 画像拡大ツールです。
wuyoscar/GPT-Image2-Skill
プロンプトギャラリー、2つの再利用可能なエージェントスキル(画像生成およびプロンプト抽出)、OpenAI の GPT-Image 2/2.5 モデル用のコマンドラインツール。
yanliudesign/mono-color-skill
機械的複製の美学に焦点を当て、1色または2色のインクでプロフェッショナルな編集印刷物、ポスター、パッケージングを作成するためのデザインシステムとAIスキル。
danielgatis/rembg
CLI、Python ライブラリ、HTTP サーバーとして使用可能な画像背景除去ツール。さまざまな AI モデルとハードウェアアクセラレーションをサポート。
Nutlope/logocreator
LogoCreatorは、Together AIを介してFLUX-2画像モデルを使用してブランド用ロゴを生成するオープンソースのウェブアプリです。Next.js、TypeScript、Radix、Tailwindで構築されており、アカウント不要で、Together AIキーのみで動作します。即時生成、FLUX-1編集、PNG/SVGエクスポート、オプションのレート制限と認証、履歴ダッシュボードなどの機能を備えています。リポジトリには明確なセットアップ手順と、サイズ選択、コスト予測、リファレンスロゴアップロード、有名ロゴの再デザインショーケースといった今後の課題がリストアップされています。
basketikun/chatgpt2api
ChatGPTのウェブ機能をリバースエンジニアリングし、組み込みのアカウントプール管理機能とともに画像生成および編集サービスを提供する、OpenAI互換のAPIプロキシ。
shitagaki-lab/see-through
単一のアニメイラストを、最大23の意味的に異なるインペイント済みレイヤーに分解し、2.5Dアニメーションおよびリギング用にPSDとして書き出すフレームワーク。
yjz211/vivid-figures-skill
Vivid Figures は、143の完成済みチャートテンプレートと7つのカラーパレットを備えたAgent-Skillです。AIアシスタントにCSV、Excel、JSON形式のデータファイルと自然言語の要求を渡すだけで、適切なプロットを選択し、PNG/PDF出力、および後でカスタマイズ可能な完全なPythonソースコードを自動生成します。オープンなAgent Skills仕様に準拠しており、Python 3.10+で動作し、個人的・非営利利用には無料です。
Kizzuwatnaa/DLSS5-Autopilot
DLSS 5 Autopilotは、NVIDIAのDLSS 5ニューラルアップスケーリングを、元々搭載されていなかったゲームに自動で追加するWindowsユーティリティです。インストール済みのゲームをスキャンし、ゲームのグラフィックスAPIとユーザーのRTX 20–50 GPUに基づいて、適切なコミュニティアドオン(ネイティブフック、OptiScaler、ブリッジ、フィーダー、RTX Remixなど)を選択。実行時に必要なDLLをダウンロードし、設定ファイルを書き込み、クリーンにアンインストールも可能。多数のランチャーに対応し、フレーム生成オプションを提供、動画/ウェブカメラストリームにも対応、CLIも利用可能。アンチチートシステムの安全チェックも備えています。
Comfy-Org/ComfyUI-Manager
ComfyUI‑Manager は、ビジュアルAIパイプラインUIである ComfyUI 用の拡張機能です。ユーザーがカレントレジストリまたはローカルキャッシュからカスタムノードパッケージやモデルファイルを閲覧・インストール・更新・有効/無効切り替え・削除できる「マネージャーパネル」を追加します。ワンクリックインストール、スナップショットベースの環境復元、外部サイトへのワークフロー共有、コンポーネントのコピー&ペースト、ヘッドレス用CLIツール、および広範な設定(セキュリティレベル、ネットワークモード、pip/uv処理)を備え、ComfyUIでStable-Diffusion画像生成を支える膨大なコミュニティ製ノードエコシステムの管理を簡素化します。
T8RIN/ImageToolbox
500 以上のフィルター、AI による背景除去、バッチ処理を備えた効率的な写真編集が可能な Android 向け画像編集ツール。
ostris/ai-toolkit
Ostris AI Toolkit は、コンシューマー向け GPU で最新の拡散モデル(画像、動画、音声、編集)をファインチューニングするためのオープンソーススイートです。Web UI、正しい PyTorch/Node.js/FFmpeg スタックを自動インストールする実験的なマネージャー、LoRA/LoKr トレーニング用の既製 YAML 設定を提供します。インストールは、Linux/macOS/Windows 用の簡単なスクリプトまたは手動の仮想環境ステップで機能します。このツールキットは、数十の最近のチェックポイント(FLUX-1/2、SDXL、Qwen-Image など)をサポートし、RunPod と Modal でのクラウド実行のガイドを含みます。
SegFault42/HeliosGen
HeliosGenは、オープンソースのデスクトップアプリ(macOS版リリース済み、Windows/Linux版は未定)で、AI画像および動画生成パイプラインをビジュアルにノードベースで構築・実行できるツールです。すべての処理はローカルで行われ、kie.ai API(またはオプションでCodex CLI)にリクエストを送信し、すべてのデータはユーザーのマシンに保存されます。マルチモデル対応、参照画像、並列/順次実行、リアルタイム履歴などの機能を備えています。アプリはTauri 2(Rust)とNext.js/Reactフロントエンドで構築されており、SQLiteでローカル永続化を実現、MITライセンスで提供されています。
facefusion/facefusion
FaceFusionは、画像および動画における顔の交換および編集を行う、高性能な顔操作プラットフォームです。
worldbench/DiffusionOPSD
DiffusionOPSD は、拡散画像生成モデル(Stable Diffusion 3.5‑M および Z‑Image‑Turbo)の微調整に向けた「オンポリシー自己蒸留」アルゴリズムのオープンソース実装です。固定された行動ポリシーから低ノイズ状態を繰り返し収集し、報酬勾配ステップを用いて明示的なポジティブ/ネガティブターゲットを構築し、それらに一致する新しいポリシーを学習し、EMA を用いて行動ポリシーを更新します。リポジトリには、依存関係のインストール、報酬モデルのチェックポイントのダウンロード、クイックスモークテストの実行、および7つの公開評価器(PickScore、CLIPScore、HPSv2.1/v3、Aesthetic、ImageReward、DeQA)または混合報酬目的のための本格的な分散トレーニングの起動スクリプトが含まれます。報告された結果では、20の設定のうち19でより高いホールドアウトスコアが達成され、先行手法と比較して GPU 時間が40–63 %削減されています。Apache 2.0 ライセンスで提供されています。
threerocks/hand-drawn-styles
AIエージェントが一貫性があり高品質な画像プロンプトを生成するために使用できる、19の検証済み手描きスタイルのプロンプトレシピからなるツール非依存のライブラリです。
higgsfield-ai/cli
Higgsfieldの生成AIモデル(画像、動画、3D、音声)の全セットをクロスプラットフォームでコマンドラインから利用可能に。Reactウェブアプリの構築、ブラウザゲームの公開、個人用「Soul」アバターの管理などもターミナルから完結。
LiamGvchi/gc-minimal-zine-poster
テーマや写真を、構造化されたプロンプトコンパイルシステムを使って、ミニマルで紙質感のある編集用ポスターに変換するCodexスキル。
NVlabs/Sana
SANAは、NVIDIAによるオープンソースで効率性を重視した拡散コードベースであり、高解像度画像および動画生成に適しています。複数のモデルファミリー(SANA、SANA‑1.5、SANA‑Sprint、SANA‑Video/Video 2.0、SANA‑WM、SANA‑Streaming)と強化学習ラッパー(Sol‑RL)を含みます。主な技術として線形アテンション、32倍圧縮のオートエンコーダ(DC‑AE)、デコーダ専用テキストエンコーダ、sCM蒸留を採用し、4K画像生成や1分間の720p動画生成を、同等モデルよりもはるかに少ないGPUコストで実現可能です。リポジトリにはトレーニング/推論スクリプト、Hugging Face上の事前学習済みチェックポイント、Diffusers統合、ComfyUIノード、デモが提供されています。ライセンスはApache 2.0です。
alisaitteke/photoshop-mcp
自然言語による指示で、AIアシスタントが背景除去やポートレートリタッチなどの作業を実行できる、Adobe Photoshopを制御するMCPサーバー。
LunarXuan/image-prompt-reverse
AI画像生成ツール向けに、リファレンス画像を高忠実度のポジティブ・ネガティブプロンプトに逆工程するCodexスキル。
invoke-ai/InvokeAI
Invoke AI は、ローカルで実行可能なオープンソースのビジュアルメディア生成プラットフォームです。統合キャンバス、ノードベースのワークフロー編集機能、ギャラリー管理、多数の最新テキストから画像生成モデル(Stable Diffusion、Flux、Qwen‑Image など)をサポートするWebベースUIを提供します。ユーザーは提供されたランチャを使ってインストールし、ローカルサーバーを起動して、直感的なブラウザインターフェースで画像の作成や修正が行えます。アーティスト、デザイナー、開発者向けに、柔軟で拡張可能なAI画像生成ツールを提供しています。
ciddwd/overlay-translator
Screen Translator は、画面をキャプチャし、OCRを実行し、翻訳(オフラインモデル、LLM API、または従来のMTサービス)して、結果を画面にオーバーレイ表示するAndroidアプリです。リアルタイム翻訳、バッチ画像処理、単語レベルの辞書照合、TTS、および豊富なカスタマイズ機能を備え、オフラインとクラウドの両方のオプションを提供します。
Acly/krita-ai-diffusion
生成的 AI ディフュージョンモデルを Krita の描画ワークフローに統合するプラグインで、インペインティング、ライブペインティング、精密な構造制御ツールを提供します。
CookSleep/gpt_image_playground
OpenAI の gpt-image-2.5 API を使用したテキストから画像生成、マスクベースの編集、会話型 AI エージェントによる画像作成を可能にするプロフェッショナルなウェブ UI
toyxyz/ComfyUI_toyxyz_test_nodes
Webカメラ/スクリーンキャプチャ、領域マスク作成、OpenPose編集、動画トリム/連結、MiniMax‑H3プロンプトビルダーを含むカスタムComfyUIノードのセット。より豊かな画像・動画生成ワークフローを可能にします。
shanliuling/dsh-image-gen
DeepSeek Harness用のAI画像生成スイートで、チャットベースの生成、バッチ生産スタジオ、マルチモデル比較、およびローカルComfyUI統合を提供します。
xororz/local-dream
Snapdragon NPU加速により、パフォーマンスが向上したローカルでのStable Diffusion画像生成を可能にするAndroidアプリ。
kijai/ComfyUI-KJNodes
ComfyUI‑KJNodes は、視覚的な Stable Diffusion UI(ComfyUI)用のプラグインで、ユーティリティノード、サブグラフ間の Set/Get 機能、多数のキーボード/マウスショートカットを追加し、大規模な生成グラフの構築と保守を容易にします。
Hugo-Dz/spritefusion-pixel-snapper
AIによって生成された不揃いで一貫性のないピクセルアートを修正するために、ピクセルを完璧なグリッドにスナップさせ、色を量子化するツール。
mcmonkeyprojects/SwarmUI
SwarmUI は、AI 画像、動画、音声生成モデル(Stable Diffusion、Flux など)を動作させるためのオープンソースの Web ベースの UI です。初心者向けの Generate タブ、高度な Comfy スタイルのワークフローエディター、マルチ GPU「スウォーム」サポート、拡張可能なプラグインを提供します。Windows、Linux、macOS(Apple シリコン)、Docker 用のインストーラーがあり、Runpod と Vast.ai 用のクラウド GPU テンプレートも利用できます。プロジェクトは「Almost-Release」ベータ版(v0.9.8)であり、MIT ライセンスですが、GPL/AGPL コンポーネントを自動インストールする場合があります。
Comfy-Org/ComfyUI_frontend
ComfyUI_frontend は、ComfyUI AIワークフロー・エンジンの公式ブラウザ/Electron UIです。ノードグラフ・エディタ、マスクエディタ、キュー/履歴表示、多言語UI、およびカスタムパネル、コマンド、コマンド、キーバインド、トースト通知のためのJavaScript拡張APIを提供します。リリースは「2週間の開発 → 2週間の凍結」サイクルに従い、起動フラグによって毎日公開されるナイトリービルドも利用可能です。
jau123/MeiGen-AI-Design-MCP
MeiGen AI Design MCPは、MCP互換サーバー(npmパッケージまたはリモートHTTPエンドポイント)であり、AIアシスタントが画像、動画、eコマース向けアセット(背景除去、製品詳細バッチ、マーケティングポスター、AI背景、アップスケーリング)を生成できるようにします。MeiGenクラウド、OpenAI互換API、ローカルComfyUIをサポートし、1,446のキュレートされたプロンプトを提供。CLIとHTTP APIも非MCP環境での利用を可能にします。
liyue-aigc/xianxia-visual-director
Codex/Agentスキル向けのビジュアルディレクションシステム。単純なアイデアを、壮大な東方系仙侠環境の構造的で映画的な画像プロンプトに変換する。
Akegarasu/lora-scripts
Stable Diffusion LoRAおよびDreamboothモデルのトレーニング用のGUIおよびスクリプトプリセットコレクション。データセットのタグ付けとトレーニングを統合された環境で行うことができます。
popopo-99/zy-cinematic-realism
LLMのためのシネマティックなビジュアルワークフロー。物語のアイデアを、AI画像生成器のためのプロフェッショナルでモデル固有のプロンプトに変換し、本物のシネマティックなリアリズムを実現します。
lbouaraba/comfyui-krea2edit
Krea 2を用いた指示ベース画像編集用のComfyUIノードパック。二重潜在変数と意味的根拠条件付けにより、高忠実度のアイデンティティ保持を実現。
llmsresearch/paperbanana
PaperBananaは、マルチエージェントLLM/VLMパイプラインを使用して、メソッドセクションのテキスト(またはデータファイル)を出版用の図や統計プロットに自動変換するオープンソースのPythonツールであり、バッチ実行、会議特有のスタイル、複数のAIプロバイダーをサポートしています。
goohai/Goohaitools-comfyui
プロフェッショナルな画像制作のために設計された、ComfyUI向けの70以上のカスタムノードを含む包括的なツールキット。バッチ処理、自動ID写真作成、および高度なマスク操作に特化しています。
carolinaaafy/travel-memory-sticker-card
旅行の写真をコレクタブルなデジタルメモリースティッカー・カードに変換するCodexスキル。
jtydhr88/ComfyUI-See-through
ComfyUIプラグインで、1枚のアニメイラストを深度順序付きのレイヤー化2.5Dモデルに分解し、Live2Dワークフローに特化して設計されています。
TheJoeFin/Text-Grab
Text GrabはWindows専用のデスクトップアプリで、スクリーンショット、PDF、UI要素など、画面に表示されるすべてのテキストをローカルOCR(WinAI、WinRT OCR、Tesseract)でキャプチャし、内蔵のクリーニング機能、スプレッドシート編集、正規表現ベースの抽出、再利用可能なキャプチャテンプレート、バッチフォルダ処理、Chrome/Edge拡張機能を提供します。すべての処理はデバイス内に留まり、Copilot+ PCではNPU加速推論もオプション。Microsoft Store、GitHubリリース、パッケージマネージャーからインストール可能。Visual Studioまたは.NET SDKでソースからビルド可能。