Nutlope/easyedit

EasyEditは、Flux 2とTogether AIで駆動されるプロンプトベースの画像編集ツールで、1つのテキストプロンプトで画像を編集できます。

mmartial/ComfyUI-Nvidia-Docker

NVIDIA GPU 加速を備えた ComfyUI Stable‑Diffusion Web UI を実行する Docker イメージ。GPU 固有のタグ、UID/GID マッピング、および ComfyUI‑Manager の内蔵により、簡単な更新が可能。

SerialLain3170/adeleine

色付きのヒント、テキストタグ、または参照画像によるガイドをサポートする、線画の自動着色向けのディープラーニングフレームワーク。

Bing-su/adetailer

Stable Diffusion web UI用の拡張機能で、生成された画像の詳細を修正するためにマスク作成とインペイントを自動化します。

cocktailpeanut/fluxgym

Flux Gymは、12-20GBのGPUでFLUX LoRAを訓練できるGradioベースのWeb UIです。Kohya-ssスクリプトをラップし、自動モデルダウンロードやHugging Faceへの公開機能を備えています。

deepgenteam/deepgen

DeepGen 1.0 は、画像生成、編集、推論を1つのフレームワークに統合した軽量な5Bパラメータの統合マルチモーダルモデルです。

nihui/zimage-ncnn-vulkan

任意のVulkan対応GPUで、高性能な画像生成、インペインティング、ControlNetサポートを実現する、ncnnベースのポータブルZ-Image生成器の実装です。

Lornatang/SRGAN-PyTorch

SRGANのPyTorch再実装で、生成的敵対ネットワークを使用して、細かいテクスチャを復元した4倍拡大の写真のようにリアルな画像を生成します。

asagi4/comfyui-prompt-control

複雑なAI画像生成ワークフロー(LoRAの読み込み、プロンプトのスケジューリング、リージョナルプロンプティングなど)を、多数のノードを手動で接続する代わりに、シンプルなテキストプロンプトで制御できるComfyUI拡張機能です。

yanokusnir-ai/one-node-flux-2-klein

ComfyUI用のカスタムノードで、フルな FLUX.2 [klein] ワークフローを1つの自己完結型UIウィジェットにラップし、複雑なノードグラフを排除する。

worldbench/DanceOPD

DanceOPDは、複数の拡散ベースの画像生成能力(テキストから画像、ローカル編集、グローバル編集、リアリズムなど)を一つのモデルに集約する研究用ライブラリです。各教師モデルを速度場として扱い、生徒モデル自身のロールアウト状態に対してクエリを行い、単純な速度MSE損失を用いて学習を行います。このリポジトリはSD-3.5-MediumおよびZ-Imageバックエンドをサポートし、スモークテスト用の軽量なテスト、およびLoRAアダプターを用いたフルトレーニング用のスクリプトと設定を提供します。

hustvl/ControlAR

ControlAR は、エッジ、深度、マスクによる空間ガイドを用いた自己回帰モデル向けの制御可能な画像生成を提供し、任意解像度の生成をサポートします。

wafer-bob/ASASR

ASASRは、FLUX.1-devに基づく忠実な画像スーパーレゾリューションフレームワークであり、敵対的ソボレフ整合を用いてアーティファクトを低減し、拡大画像の構造的忠実性を向上させます。

bentoml/BentoDiffusion

BentoML フレームワークを使用して、さまざまな Stable Diffusion ファミリーモデルをセルフホストおよびデプロイするためのサンプルプロジェクトのコレクションです。

shiimizu/ComfyUI_smZNodes

AUTOMATIC1111のプロンプト解析と埋め込みを再現するカスタムComfyUIノード(CLIP Text Encode++ と Settings)で、Stable Diffusion WebUIとComfyUI間で同一の画像生成を可能にします。

Windsander/ADI-Stable-Diffusion

ONNXRuntime を使用して、複数のプラットフォームで Python に依存しない高パフォーマンスな Stable Diffusion モデル推論を実現する C++ ライブラリおよび CLI ツール。

mrhan1993/Fooocus-API

Fooocus向けに構築されたFastAPIベースのREST APIで、手動でのパラメータ調整なしに高品質な画像をプログラムで生成できます。

melMass/comfy_mtb

ComfyUI用のカスタムノード集で、画像生成ワークフローに便利なユーティリティツールを追加します。

lobehub/sd-webui-lobe-theme

Stable Diffusion WebUI 用の現代的で高度にカスタマイズ可能なインターフェースフレームワーク。AI画像生成のワークフローと視覚体験を向上させます。

yejy53/RealGen

RealGenは、強化学習中にAI検出器を報酬信号として使用することで、アーティファクトを抑え、極めてフォトリアルな画像を生成するテキストから画像への生成器です。

cure-lab/MMA-Diffusion

マルチモーダルな敵対的攻撃を用いて、プロンプトフィルタやセーフティチェッカーを回避し、NSFWコンテンツを生成させることで、Text-to-Imageモデルのセキュリティを評価するためのフレームワーク。

ATH-MaaS/Ovis-Image

Ovis-Image は 7B パラメータのテキスト‑ツー‑イメージモデルで、高品質なテキスト描画とレイアウト精度を最適化し、手に入りやすいハードウェア上で効率的に動作するよう設計されています。

nachifur/RDDM

高品質な画像復元と生成のための残差去噪拡散モデルフレームワーク。降雨除去やぼかし除去などのタスクをサポートします。

viiika/Meissonic

Meissonicは、コンシューマー向けGPUで動作するように設計された、効率的な高解像度テキストから画像への合成のための非自己回帰型マスク生成トランスフォーマーです。

nxnai/Voost

Voost は統合された Diffusion Transformer で、高品質な双方向バーチャルトライオン・トライオフを実現し、人物画像に服を追加したり除去したりできます。

Ammmob/PixelSmile

PixelSmile は、人物やアニメキャラクターの画像において、本人のアイデンティティを保ちつつ感情を変更できる、細かい顔表情編集ツールです。

nekhtiari/image-similarity-measures

2枚の画像間の8つの標準的な画像類似度指標(RMSE、PSNR、SSIM、FSIM、ISSM、SRE、SAM、UIQ)を計算するPythonパッケージとCLI。pipでインストール可能で、オプションで高速化を追加でき、`image-similarity-measures`コマンドまたはコード内の`evaluation`関数で利用可能。画像処理やAIモデルの定量的評価に特に有用で、リモートセンシングの文脈で活用できる。

Stability-AI/stability-sdk

Pythonライブラリとコマンドラインツールを通じて、画像の生成、アップスケーリング、アニメーションを可能にするStability API用のクライアントSDK。

mo-browser-apps/icons

AI を使用して .icns 形式の macOS アプリアイコンを生成するデスクトップアプリ。ユーザーは希望するデザインをテキストで記述し、結果を段階的に改善できる。

HalfAI1102/anthropic-art

Anthropicの視覚スタイルで手描きの編集イラストを生成し、抽象的な概念をミニマリストの視覚的メタファーに変換するエージェントスキル。

Nutlope/blinkshot

Juggernaut Lightning Flux と Together AI を活用したオープンソースのリアルタイムAI画像生成ツール。

Sygil-Dev/sygil-webui

低VRAM GPU向けの最適化を施した、Stable Diffusion用のWebベースのユーザーインターフェース。画像生成、拡大、プロンプト工学のツールを提供。

ShuaixinHuang/image-multiple-angles-3d-camera

インタラクティブな3DウィジェットとQwen-Image-Edit-Plusモデルを使用して、アップロードされた画像のカメラ視点を変更できる、3D制御による画像生成ツール。

Lakonik/LakonLab

大規模な拡散モデルを実験するための高性能なコードベース。高度なフローマッチングと蒸留技術を実装し、効率的な数ステップでの画像生成を可能にします。

Mukosame/Anime2Sketch

深層学習を使用して、イラスト、アニメアート、マンガをクリーンな線画やスケッチに変換するスケッチ抽出ツールです。

apple-aiml-research/ml-stable-diffusion

Apple Silicon上でCore MLを使用してStable Diffusionモデルの変換と実行を行うためのツールキット。モバイルデプロイ向けに高度な重み圧縮を備えています。

spectertoucanberth/thumbnail-maker-lab

Thumbnail Maker Lab は、ベクターグラフィックスとAI駆動の画像編集、一括処理を組み合わせたプロフェッショナルなタイル画像作成ツールキットです。

cathrynlavery/diagram-design

Diagram Designは、ブランドに準拠した静的なHTML + SVG形式の編集用図表(アーキテクチャ図、フローチャート、グラフ、マップなど)を大量に生成するAIエージェントスキルです。3種類の視覚バリエーションを提供し、自動的なカラー/フォントのオンボーディングとアクセシビリティ対応を備えています。Claude Code、Codex、Copilot、Factory Droid、Pi、Kiroなどのエージェントスキルプラットフォームと統合可能です。

liujuntao123/smart-excalidraw-next

Smart Excalidrawは、自然言語の記述をLLM(Claude sonnet-4.5など)を使用して編集可能なExcalidraw図に変換するNext.js Webアプリです。20種類以上の図表タイプ、自動ルーティング矢印をサポートし、共有サーバーサイドLLM(アクセスパスワード)または個人用APIキー設定のいずれかを選択できます。pnpm devでローカル実行するか、ホストされているデモをご利用ください。

ramjke/Translumo

Translumoは、画面領域をキャプチャし、OCR(Windows OCR、Tesseract、EasyOCR)を実行し、小型MLモデルで最良の結果を選択し、DeepL/Google/Yandex/Papagoを介して翻訳し、その結果を画面上にオーバーレイ表示するWindowsデスクトップアプリです。ゲームでのリアルタイム使用を想定しており、多言語対応、プロキシローテーション、低遅延動作をサポートしています。本プロジェクトはオープンソース(Apache 2.0)であり、.NET 8、Visual Studio 2022、および複数のOCR/ビジョンライブラリを使用して構築されています。

Picsart-AI-Research/MI-GAN

モバイルデバイス向けに最適化された軽量なGANベースの画像修復モデル。SOTAモデルと比較してパラメータ数を大幅に削減し、推論速度を向上させつつ、高品質な結果を提供します。

Physton/sd-webui-prompt-all-in-one

stable-diffusion-webui向けの拡張機能で、自動翻訳、プロンプト整理ツール、ChatGPT連携によりプロンプト入力体験を向上させます。

TTPlanetPig/Comfyui_TTP_Toolset

Smart Tile 2.0を搭載したComfyUIノードコレクション。セマンティック検出と可変サイズのタイルを使用して、高精細なアップスケーリングを実現するオブジェクト認識型タイルベースのimg2imgワークフローです。

leeguooooo/image-use

OpenAI APIキーが不要なゼロ依存のPython CLIで、既存のChatGPTまたはGeminiサブスクリプションを使って画像生成が可能。

groundboxerrespect/Dlls5-auto

REST APIを介して、どんな画像にも映画的なライティングやブロムなどの写実的なニューラルレンダリングの美学を適用するセルフホスト型の画像強化サービスです。

HyperGAN/HyperGAN

PyTorch に基づく組み合わせ可能な GAN フレームワークで、開発者やアーティストが生成的対抗ネットワークをトレーニング、共有、デプロイしやすくなります。