photoprism/photoprism
PhotoPrismは、データをプライバシー内に保ったまま、AIを使用して写真や動画を自動的にタグ付け、検索、整理できるオープンソースのセルフホスト型Webアプリです。
pangxiaobin/image-matting
RMBG-1.4モデルを使用して、ローカルでAI駆動の背景除去、バッチ処理、画像編集ツールを提供するデスクトップアプリケーション。
AgriciDaniel/banana-claude
Banana Claude は Claude Code プラグインで、自然言語によるリクエストを入力し、詳細な計画(プロンプト、モデル、コスト見積もり)を確認した上で、明示的な承認後、Google の Gemini 画像モデルを使ってビジュアル資産を生成または編集できます。オフライン優先の計画、プライバシー保護された API キーの取り扱い、1回限りの承認によりコストの透明性を確保しています。
yolain/ComfyUI-Easy-Use
ComfyUI-Easy-Useは、ComfyUIビジュアルエディタでのStable Diffusion(およびその他の拡散モデル)ワークフロー構築を効率化する包括的なカスタムノードセットです。ワンクリックローダー、プロンプトヘルパー、LoRA/ControlNetスタック、ループ/条件ロジック、画像ユーティリティ、UI調整機能を追加し、より少ないノードで複雑な生成パイプラインを作成・実行できるようにします。
krea-ai/krea-2
Krea 2 は、柔軟な微調整に適したベースRAWモデルと、高速で高品質なテキストto画像合成に最適化された蒸留済みTurboモデルを備えたオープンソース画像生成モデルです。
palxiao/poster-design
DOMキャンバス、AI背景削除機能、完全な管理バックエンドを備えたオープンソースのAIポスターデザインツール兼オンライン画像エディタです。
nuyoah-ai-works/nuyoah-xiezhen-prompt
AIポートレート写真用のプロンプト工学スキルで、プロフェッショナルな写真計画を再構成し、複数のショットにわたって一貫したスタイルとキャラクターの再現を可能にします。
nregret/Comfyui-Anima-Tools
アニメAIアート向けに設計されたComfyUI用の視覚的プロンプトとLoRA選択ツール。4万以上のアーティスト、キャラクター、衣装タグのデータベースを備えています。
AHEKOT/ComfyUI_VNCCS
一貫性のあるキャラクタースプライトを作成するためのComfyUIパイプラインで、ユーザーは複数の画像にわたって外見、ポーズ、衣装、感情を管理できます。
lucidrains/denoising-diffusion-pytorch
高品質な画像および1Dシーケンスを生成するための、Denoising Diffusion Probabilistic Models (DDPM) のPyTorch実装。
buluslan/gpt-image2-ecommerce
39のシーンテンプレートと技術的事前チェックを活用したAI駆動のビジュアルアセット生成ツールで、eコマース向けにプロフェッショナルでプラットフォーム準拠の製品画像を生成します。
wnby/photo-relic-editorial
実写写真を、同じ画像を用いた控えめで紙の質感を持つ版画バージョンと組み合わせることで、縦長の編集アートワークに変換する Codex スキル。
storytold/artcraft
ArtCraftは、アーティストが2Dまたは3Dシーンを構築し、AI生成画像、動画、音声、メッシュ、世界で埋め尽くすことができるデスクトップIDEです。合成、ポーズ転送、背景除去、プロンプト駆動生成のための視覚的ツールを提供し、62のビルトインモデルに加え、MidjourneyやSoraなどの外部プロバイダーもサポートします。Windows/macOS向けに利用可能(Linuxはソースから)、繰り返し可能で制御可能なAIアートワークフローを求めるクリエイターをターゲットとしています。
drawthingsai/draw-things-community
Draw Thingsアプリのコア画像生成、サンプリング、トレーニングコードを提供するコミュニティリポジトリ。リモート推論用の自己ホスティングgRPCサーバーも含む。
jtydhr88/ComfyUI-qwenmultiangle
ComfyUI用のカスタムノードで、Qwen-Image-Edit-2511-Multiple-Angles-LoRAと互換性のあるプロンプトを生成するためのインタラクティブな3Dビューポートを提供します。
allenk/GeminiWatermarkTool
決定論的なリバース・アルファブレンディング・アルゴリズムを使用して Google Gemini の画像(および動画)のウォーターマークを除去する、クロスプラットフォームのポータブル実行ファイル。オプションの GPU 加速 FDnCNN デノイズ、GUI/CLI インターフェース、バッチ処理、および MCP による AI エージェント統合を備えています。
ATH-MaaS/ComfyUI-Copilot
LLM駆動のエージェントを使用して、ComfyUIの画像生成ワークフローの生成、デバッグ、および最適化を自動化するComfyUI用のインテリジェントアシスタント。
wzj177/ecommerce-image-suite
AIを活用したツールキットで、eコマース販売者が製品画像を自動分析し、Amazon、Taobao、JD.com、TikTokなどさまざまなスタイルやプラットフォーム向けのプロフェッショナルなマーケティング画像セットを生成できます。
TaiT-tt/tait-crt-interface-skill
写真やテキストを、初期のCRTコンピュータインターフェースの美学を持つレトロなイラストレーションに変換するCodex画像生成スキル。
Fannovel16/comfyui_controlnet_aux
深度マップ、Canny エッジ、人間のポーズなど、ControlNet のヒント画像を生成するためのプリプロセッサを提供する ComfyUI ノードのコレクションです。
VigoZhao/AI-Visual-Prompt-Cookbook
130以上のJSONベースのビジュアルスタイルプロンプトテンプレートを収録したキュレート済みライブラリ。各 `style.json` は、再利用可能なレイアウト(例:ポスター、コラージュ、タイポグラフィアート)を定義し、プレースホルダを事前に埋めてからマルチモーダルLLM(ChatGPT‑4‑Vision、Gemini‑3‑Proなど)に貼り付けることで使用可能。リポジトリにはプレビュー画像、例値、検証スクリプト、コピー・プロンプトショートカットが含まれ、AI生成グラフィックの一貫性と反復作業のしやすさを実現する。
wkentaro/labelme
labelme は、画像や動画上にバウンディングボックス、ポリゴン、マスクなどを描画するためのクロスプラットフォーム Python/Qt デスクトップアプリです。アノテーションは JSON として保存され、VOC または COCO 形式にエクスポート可能で、コンピュータビジョンモデルのトレーニングデータ作成に実用的です。pip、有料のスタンドアロン実行ファイル、または Linux パッケージからインストールできます。最新バージョンでは AI アシストマスク生成(SAM、YOLO-World)が追加されています。
zuruoke/watermark-removal
画像インペインティングを使用して画像からウォーターマークを削除し、シームレスな結果を作成する機械学習プロジェクト。
dacnay816y62-hub/photo-revival
普通の写真を、大量の余白と小さな手書きのキャプションが添えられたミニマルで詩的な手描きイラストに変換するAIスキル命令のセット。
filliptm/ComfyUI_Fill-Nodes
Fill‑Nodes は、画像処理、ビジュアルエフェクト、キャプション生成、AIモデル呼び出し(GPT、DALL‑E、Hugging Faceなど)、ファイル処理(PDF、Googleドライブ)、オーディオリアクティブおよび動画ユーティリティを追加する、多数のカスタムComfyUIノードのコレクションです。ComfyUIの `custom_nodes` フォルダにリポジトリを配置するだけでインストール可能。バッチ読み込み、クリエイティブエフェクト適用、LLMによるキャプション生成、画像・動画・PDF・クラウド保存ファイルとしての結果エクスポートを含むエンドツーエンドワークフローの構築に使用できます。
six-nut/PocketMen-with-you
2枚以上の写真を、Codexコンパニオン用の一貫性のあるアニメーションキャラクタースプライトに変換するローカル生成ツール。オープンウェイトの画像モデルを使用します。
Hunyuan-PromptEnhancer/PromptEnhancer
Chain-of-Thought (思考の連鎖) による書き換えを行い、ユーザーの意図を維持しながら、text-to-image や image-to-image の編集プロンプトを強化するプロンプト書き換えユーティリティです。
kadevin/ilab-conjure
iLab CONJUREは、複数のAIモデル(GPT-Image、Gemini、Codex)を使用して画像を生成・編集するための、FastAPIベースのローカル実行型Web UI(およびCLI)です。タスクキュー、永続的なギャラリー、プロンプトテンプレートチップ、SQLite履歴を備え、OpenAI互換APIとローカルのCodex OAuthフローの両方をサポートしています。ソースコードまたはビルド済みのmacOS/Windowsパッケージからインストールし、APIキーを設定するだけで画像生成を開始できます。
eikek/docspell
Docspellは、スキャンした紙、メール、その他のファイルを整理するオープンソースの個人用ドキュメント管理システムです。Stanford CoreNLPを使用してタグ、日付、送信者を自動的に提案し、必要に応じてOCRを実行し、REST APIとモバイル対応のElm Web UIを介して全文検索を提供します。Docker、Debianパッケージ、Nix、Helmでインストール可能で、AGPL-v3ライセンスです。
SamurAIGPT/Vibe-Workflow
Vibe Workflow は、生成画像および動画パイプラインを構築するためのオープンソースでMITライセンスのノードベース視覚エディタです。Next.jsフロントエンド、MuAPIの生成モデルを呼び出すFastAPIバックエンド、再利用可能なワークフロービルダーUIライブラリから構成されています。Dockerまたは手動で自己ホスティング可能、またはホステッドSaaS版を利用でき、カスタムノードで任意のAIモデルや外部APIを呼び出すことも可能です。
NimaNzrii/comfyui-photoshop
PhotoshopのインターフェースにComfyUIのAI機能を直接統合し、AI駆動の編集ワークフローをスムーズに実現するプラグイン。
chaiNNer-org/chaiNNer
プログラムによる画像処理とAIアップスケーリングのためのノードベースGUIで、視覚的なインターフェースを通じてカスタマイズ可能な処理パイプラインを構築できます。
PrismML-Eng/Bonsai-Image-Demo
Apple Silicon、Linux、Windows向けのクロスプラットフォームデモ。4 BパラメータのBonsaiディフュージョンモデル用に、macOS(MLX)またはNVIDIA GPU(gemlite + HQQ)上でWebベーススタジオとCLIによる画像生成を提供。
karimz1/imgcompress
ローカルAIによる背景削除、一括圧縮、70種類以上の画像形式への変換を提供する、セルフホスト型の画像処理サーバーです。
trueai-org/midjourney-proxy
Midjourneyの画像生成および顔交換機能を、プログラム可能なインターフェースを通じて自社アプリに統合できるオープンソースのAPIプロキシです。
YanWenKun/ComfyUI-Windows-Portable
NVIDIA GPU搭載のWindows環境で、Stable Diffusion用のノードベースUIであるComfyUIを、40以上のカスタムノードと300以上の事前コンパイル済みPythonパッケージと共にバンドルした即時実行可能なパッケージ。AI画像/動画生成を瞬時に開始できます。
Comfy-Org/comfy-cli
comfy‑cli は、オープンソースの生成メディアエンジンである ComfyUI をインストール、起動、管理するための Python コマンドラインツールです。環境設定、カスタムノードのインストール、モデルのダウンロード、ワークフローの実行を処理でき、またホストされた Comfy Cloud サービスにジョブをオフロードすることも可能です。高速な `uv` ベースの依存関係解決、LLMエージェント向けのJSON構造出力、シェル補完、PRテストやバックグラウンドサーバー管理のユーティリティなど、さまざまな機能を備えています。
FireRedTeam/FireRed-Image-Edit
高精度で一貫性のある編集、強力なアイデンティティ保持、およびマルチ要素融合機能を備えた汎用画像編集モデル。
NVIDIA-RTX/NRD
GPU加速、APIに依存しない、リアルタイム・レイトレーシング・デノイジング(REBLUR, RELAX, SIGMA)のためのライブラリ。
GiMi-Xiaomi/gimi-illustration-skill
カスタマイズ可能なスタイルと一貫したキャラクターIPを用いて、テキスト記事や脚本を概念図に変換するAIエージェントスキル。
LibrePhotos/librephotos
LibrePhotosは、AIで生成されたメタデータ(顔、物体、キャプション)を自動的に追加し、意味的検索、マップビュー、マルチユーザーアルバムを提供する自己ホスト型フォト管理サーバーです。Dockerコンテナとして提供され、Django RESTバックエンド、ReactウェブUI、およびオプションのReact-Native Androidクライアントを備えており、すべてのコンピュータビジョンタスクにONNX-runモデルを使用しています。
rupeshs/fastsdcpu
OpenVINO と潜在的整合性モデルを活用した、CPU 向けに最適化された高パフォーマンスな Stable Diffusion 実装で、ほぼリアルタイムの画像生成を実現します。
nv-tlabs/PiD
PiDは、標準的なVAE/RAEデコーダーを置き換え、潜在表現を単一のパスで超解像された2Kから4Kピクセルに変換するプラグアンドプレイの拡散デコーダーです。
Gourieff/ComfyUI-ReActor
画像や動画内の顔を素早く簡単に置換するためのComfyUIノードセットで、顔の修復とブレンド顔モデルの作成を特徴としています。
Nerogar/OneTrainer
データセット作成、ファインチューニング、モデル変換のツールを提供する、GUI または CLI で操作できる拡散モデル向けの包括的なトレーニングスイートです。
yurijmikhalevich/rclip
rclip は、OpenCLIP 埋め込みを使用して、自然言語による記述、例となる画像、または重み付けされた組み合わせによって写真を見つけることができる、ローカルでターミナルネイティブな画像検索ツールです。オプションのインタラクティブ UI と多くの画像フォーマットのサポートを備えています。
markfulton/NanoBananaEditor
Google の Gemini 画像モデルを使用する React および TypeScript ベースのエディタで、テキストから画像生成、マスク編集、検索接地プロンプトを可能にします。
nihui/zimage-ncnn-vulkan
任意のVulkan対応GPUで、高性能な画像生成、インペインティング、ControlNetサポートを実現する、ncnnベースのポータブルZ-Image生成器の実装です。