Nutlope/easyedit
EasyEditは、Flux 2とTogether AIで駆動されるプロンプトベースの画像編集ツールで、1つのテキストプロンプトで画像を編集できます。
mmartial/ComfyUI-Nvidia-Docker
NVIDIA GPU 加速を備えた ComfyUI Stable‑Diffusion Web UI を実行する Docker イメージ。GPU 固有のタグ、UID/GID マッピング、および ComfyUI‑Manager の内蔵により、簡単な更新が可能。
SerialLain3170/adeleine
色付きのヒント、テキストタグ、または参照画像によるガイドをサポートする、線画の自動着色向けのディープラーニングフレームワーク。
Bing-su/adetailer
Stable Diffusion web UI用の拡張機能で、生成された画像の詳細を修正するためにマスク作成とインペイントを自動化します。
cocktailpeanut/fluxgym
Flux Gymは、12-20GBのGPUでFLUX LoRAを訓練できるGradioベースのWeb UIです。Kohya-ssスクリプトをラップし、自動モデルダウンロードやHugging Faceへの公開機能を備えています。
deepgenteam/deepgen
DeepGen 1.0 は、画像生成、編集、推論を1つのフレームワークに統合した軽量な5Bパラメータの統合マルチモーダルモデルです。
nihui/zimage-ncnn-vulkan
任意のVulkan対応GPUで、高性能な画像生成、インペインティング、ControlNetサポートを実現する、ncnnベースのポータブルZ-Image生成器の実装です。
Lornatang/SRGAN-PyTorch
SRGANのPyTorch再実装で、生成的敵対ネットワークを使用して、細かいテクスチャを復元した4倍拡大の写真のようにリアルな画像を生成します。
asagi4/comfyui-prompt-control
複雑なAI画像生成ワークフロー(LoRAの読み込み、プロンプトのスケジューリング、リージョナルプロンプティングなど)を、多数のノードを手動で接続する代わりに、シンプルなテキストプロンプトで制御できるComfyUI拡張機能です。
yanokusnir-ai/one-node-flux-2-klein
ComfyUI用のカスタムノードで、フルな FLUX.2 [klein] ワークフローを1つの自己完結型UIウィジェットにラップし、複雑なノードグラフを排除する。
worldbench/DanceOPD
DanceOPDは、複数の拡散ベースの画像生成能力(テキストから画像、ローカル編集、グローバル編集、リアリズムなど)を一つのモデルに集約する研究用ライブラリです。各教師モデルを速度場として扱い、生徒モデル自身のロールアウト状態に対してクエリを行い、単純な速度MSE損失を用いて学習を行います。このリポジトリはSD-3.5-MediumおよびZ-Imageバックエンドをサポートし、スモークテスト用の軽量なテスト、およびLoRAアダプターを用いたフルトレーニング用のスクリプトと設定を提供します。
hustvl/ControlAR
ControlAR は、エッジ、深度、マスクによる空間ガイドを用いた自己回帰モデル向けの制御可能な画像生成を提供し、任意解像度の生成をサポートします。
wafer-bob/ASASR
ASASRは、FLUX.1-devに基づく忠実な画像スーパーレゾリューションフレームワークであり、敵対的ソボレフ整合を用いてアーティファクトを低減し、拡大画像の構造的忠実性を向上させます。
bentoml/BentoDiffusion
BentoML フレームワークを使用して、さまざまな Stable Diffusion ファミリーモデルをセルフホストおよびデプロイするためのサンプルプロジェクトのコレクションです。
shiimizu/ComfyUI_smZNodes
AUTOMATIC1111のプロンプト解析と埋め込みを再現するカスタムComfyUIノード(CLIP Text Encode++ と Settings)で、Stable Diffusion WebUIとComfyUI間で同一の画像生成を可能にします。
Windsander/ADI-Stable-Diffusion
ONNXRuntime を使用して、複数のプラットフォームで Python に依存しない高パフォーマンスな Stable Diffusion モデル推論を実現する C++ ライブラリおよび CLI ツール。
mrhan1993/Fooocus-API
Fooocus向けに構築されたFastAPIベースのREST APIで、手動でのパラメータ調整なしに高品質な画像をプログラムで生成できます。
melMass/comfy_mtb
ComfyUI用のカスタムノード集で、画像生成ワークフローに便利なユーティリティツールを追加します。
lobehub/sd-webui-lobe-theme
Stable Diffusion WebUI 用の現代的で高度にカスタマイズ可能なインターフェースフレームワーク。AI画像生成のワークフローと視覚体験を向上させます。
yejy53/RealGen
RealGenは、強化学習中にAI検出器を報酬信号として使用することで、アーティファクトを抑え、極めてフォトリアルな画像を生成するテキストから画像への生成器です。
cure-lab/MMA-Diffusion
マルチモーダルな敵対的攻撃を用いて、プロンプトフィルタやセーフティチェッカーを回避し、NSFWコンテンツを生成させることで、Text-to-Imageモデルのセキュリティを評価するためのフレームワーク。
ATH-MaaS/Ovis-Image
Ovis-Image は 7B パラメータのテキスト‑ツー‑イメージモデルで、高品質なテキスト描画とレイアウト精度を最適化し、手に入りやすいハードウェア上で効率的に動作するよう設計されています。
nachifur/RDDM
高品質な画像復元と生成のための残差去噪拡散モデルフレームワーク。降雨除去やぼかし除去などのタスクをサポートします。
viiika/Meissonic
Meissonicは、コンシューマー向けGPUで動作するように設計された、効率的な高解像度テキストから画像への合成のための非自己回帰型マスク生成トランスフォーマーです。
nxnai/Voost
Voost は統合された Diffusion Transformer で、高品質な双方向バーチャルトライオン・トライオフを実現し、人物画像に服を追加したり除去したりできます。
Ammmob/PixelSmile
PixelSmile は、人物やアニメキャラクターの画像において、本人のアイデンティティを保ちつつ感情を変更できる、細かい顔表情編集ツールです。
nekhtiari/image-similarity-measures
2枚の画像間の8つの標準的な画像類似度指標(RMSE、PSNR、SSIM、FSIM、ISSM、SRE、SAM、UIQ)を計算するPythonパッケージとCLI。pipでインストール可能で、オプションで高速化を追加でき、`image-similarity-measures`コマンドまたはコード内の`evaluation`関数で利用可能。画像処理やAIモデルの定量的評価に特に有用で、リモートセンシングの文脈で活用できる。
Stability-AI/stability-sdk
Pythonライブラリとコマンドラインツールを通じて、画像の生成、アップスケーリング、アニメーションを可能にするStability API用のクライアントSDK。
mo-browser-apps/icons
AI を使用して .icns 形式の macOS アプリアイコンを生成するデスクトップアプリ。ユーザーは希望するデザインをテキストで記述し、結果を段階的に改善できる。
HalfAI1102/anthropic-art
Anthropicの視覚スタイルで手描きの編集イラストを生成し、抽象的な概念をミニマリストの視覚的メタファーに変換するエージェントスキル。
Nutlope/blinkshot
Juggernaut Lightning Flux と Together AI を活用したオープンソースのリアルタイムAI画像生成ツール。
Sygil-Dev/sygil-webui
低VRAM GPU向けの最適化を施した、Stable Diffusion用のWebベースのユーザーインターフェース。画像生成、拡大、プロンプト工学のツールを提供。
ShuaixinHuang/image-multiple-angles-3d-camera
インタラクティブな3DウィジェットとQwen-Image-Edit-Plusモデルを使用して、アップロードされた画像のカメラ視点を変更できる、3D制御による画像生成ツール。
Lakonik/LakonLab
大規模な拡散モデルを実験するための高性能なコードベース。高度なフローマッチングと蒸留技術を実装し、効率的な数ステップでの画像生成を可能にします。
Mukosame/Anime2Sketch
深層学習を使用して、イラスト、アニメアート、マンガをクリーンな線画やスケッチに変換するスケッチ抽出ツールです。
apple-aiml-research/ml-stable-diffusion
Apple Silicon上でCore MLを使用してStable Diffusionモデルの変換と実行を行うためのツールキット。モバイルデプロイ向けに高度な重み圧縮を備えています。
spectertoucanberth/thumbnail-maker-lab
Thumbnail Maker Lab は、ベクターグラフィックスとAI駆動の画像編集、一括処理を組み合わせたプロフェッショナルなタイル画像作成ツールキットです。
cathrynlavery/diagram-design
Diagram Designは、ブランドに準拠した静的なHTML + SVG形式の編集用図表(アーキテクチャ図、フローチャート、グラフ、マップなど)を大量に生成するAIエージェントスキルです。3種類の視覚バリエーションを提供し、自動的なカラー/フォントのオンボーディングとアクセシビリティ対応を備えています。Claude Code、Codex、Copilot、Factory Droid、Pi、Kiroなどのエージェントスキルプラットフォームと統合可能です。
liujuntao123/smart-excalidraw-next
Smart Excalidrawは、自然言語の記述をLLM(Claude sonnet-4.5など)を使用して編集可能なExcalidraw図に変換するNext.js Webアプリです。20種類以上の図表タイプ、自動ルーティング矢印をサポートし、共有サーバーサイドLLM(アクセスパスワード)または個人用APIキー設定のいずれかを選択できます。pnpm devでローカル実行するか、ホストされているデモをご利用ください。
ramjke/Translumo
Translumoは、画面領域をキャプチャし、OCR(Windows OCR、Tesseract、EasyOCR)を実行し、小型MLモデルで最良の結果を選択し、DeepL/Google/Yandex/Papagoを介して翻訳し、その結果を画面上にオーバーレイ表示するWindowsデスクトップアプリです。ゲームでのリアルタイム使用を想定しており、多言語対応、プロキシローテーション、低遅延動作をサポートしています。本プロジェクトはオープンソース(Apache 2.0)であり、.NET 8、Visual Studio 2022、および複数のOCR/ビジョンライブラリを使用して構築されています。
Picsart-AI-Research/MI-GAN
モバイルデバイス向けに最適化された軽量なGANベースの画像修復モデル。SOTAモデルと比較してパラメータ数を大幅に削減し、推論速度を向上させつつ、高品質な結果を提供します。
Physton/sd-webui-prompt-all-in-one
stable-diffusion-webui向けの拡張機能で、自動翻訳、プロンプト整理ツール、ChatGPT連携によりプロンプト入力体験を向上させます。
TTPlanetPig/Comfyui_TTP_Toolset
Smart Tile 2.0を搭載したComfyUIノードコレクション。セマンティック検出と可変サイズのタイルを使用して、高精細なアップスケーリングを実現するオブジェクト認識型タイルベースのimg2imgワークフローです。
leeguooooo/image-use
OpenAI APIキーが不要なゼロ依存のPython CLIで、既存のChatGPTまたはGeminiサブスクリプションを使って画像生成が可能。
groundboxerrespect/Dlls5-auto
REST APIを介して、どんな画像にも映画的なライティングやブロムなどの写実的なニューラルレンダリングの美学を適用するセルフホスト型の画像強化サービスです。
HyperGAN/HyperGAN
PyTorch に基づく組み合わせ可能な GAN フレームワークで、開発者やアーティストが生成的対抗ネットワークをトレーニング、共有、デプロイしやすくなります。