baidu/ERNIE-Image

Baidu が提供するオープンウェイト 8B Diffusion Transformer テキスト‑ツー‑イメージモデルで、テキスト描画、複雑な指示の実行、構造化されたビジュアル構成に優れています。

wildminder/ComfyUI-DyPE

FLUX や Qwen Image などの Diffusion Transformer (DiT) を、学習なしのモデルパッチングとカスケード細化技術を用いて、超高解像度(4K+)で生成可能にする ComfyUI カスタムノードパックです。

martin-rizzo/ComfyUI-ZImagePowerNodes

Z-Image Turboモデルに最適化されたComfyUIカスタムノードのコレクション。強化されたスタイル制御、低ステップでの一貫性、および構図の多様性を提供します。

LuqP2/Image-MetaHub

Image MetaHubは、AI生成画像・動画・音声をインデックス化し、ComfyUI、Automatic1111、InvokeAI、Midjourneyなどのツールから生成メタデータを抽出し、高速なファセット検索、視覚的類似性検索、系統追跡、埋め込みComfyUIワークスペースを提供するローカルファーストのデスクトップアプリ(Electron + React)です。コアアプリはオープンソース(MPL 2.0)、39ドルのオフラインProライセンスで詳細な統合、比較ビュー、無制限クラスタリング、アナリティクスが利用可能。

CVCUDA/CV-CUDA

CV‑CUDAは、NVIDIAのオープンソースGPUアクセラレーション・コンピュータビジョンライブラリです。高速でスケーラブルな画像/動画オペレータ(リサイズ、フィルタ、色変換など)を提供し、すべてGPU上で実行され、C/C++およびPythonのAIフレームワークと統合されます。Linux用のビルド済みwheel(`cvcuda-cu12`または`cvcuda-cu13`)からインストールし、`nvimgcodec`を使用して画像を直接GPUにデコードし、ディープラーニングモデルにデータを供給する前にCV‑CUDAオペレータをチェーンさせることができます。このライブラリは最新のNVIDIA GPU(Turing以降)をターゲットとしており、Microsoft Bingのビジュアル検索やTencent Cloudの動画処理などの本番システムで使用されています。

carson-katri/dream-textures

Stable Diffusionを統合し、3Dワークスペース内でシームレステクスチャ、コンセプトアート、画像アセットを直接生成するBlenderアドオン。

damian0815/compel

transformers型テキスト埋め込みシステム向けのテキストプロンプト重み付けおよびブレンドライブラリであり、画像生成パイプラインにおけるプロンプトの影響力を正確に制御可能にします。

YukihoAA/waifu2x_snowshell

waifu2x、Real-CUGAN、Real-ESRGAN などの複数のAI画像拡大ツール用のGUIシェルで、画像強化のためのドラッグアンドドロップインターフェースを提供します。

thekevinscott/UpscalerJS

ブラウザまたは Node.js で AI を使って画像の解像度を向上させ、ノイズを除去し、ぼかしを修正できる JavaScript ライブラリです。

Extraltodeus/ComfyUI-AutomaticCFG

CFGを自動的に再スケールすることで画像アーティファクトと過度な彩度を防ぎ、生成速度を加速させるツールを提供するComfyUI拡張機能。

Dana-Farber-AIOS/pathml

PathML はオープンソースの Python ライブラリ(Docker イメージとしても提供)で、全スライド病理ワークフロー全体を簡素化します:多様なスライド形式の読み込み、スケーラブルな前処理(染色正規化、タイル化、GPU 変換)、データを PyTorch テンソルに変換、細胞レベルのグラフ構築、そして深層学習または ONNX モデルの実行。AI 主導の計算病理学へのハードルを下げることを目的としており、すでに多数のハイインパクトなバイオメディカル論文で利用されています。

adobe-research/custom-diffusion

少数の画像から新しい概念を学習し、ストレージ負荷を最小限に抑えてテキスト‑ツー‑イメージ拡散モデルを高速かつ効率的にファインチューニングする手法。

hollowstrawberry/kohya-colab

Stable Diffusion LoRA モデルのトレーニングとデータセット準備に使える Google Colab ノートブックのコレクション。SDXL サポートも含まれます。

e-sensing/sits

SITS は、衛星画像時系列データキューブの構築、正則化、分類に向けたオープンソース R パッケージ(Python ラッパー付き)です。多数の公開 EO コレクションに接続可能で、ML/DL モデル(GPU加速付き CNN やアテンションエンコーダーを含む)を提供し、学習、分類、平滑化、不確実性推定、アクティブラーニングまでをエンドツーエンドでサポートします。

facefusion/facefusion-docker

CUDAやROCmなどのさまざまなハードウェアアクセラレータ上で簡単に実行できる、FaceFusion顔操作プラットフォームのDockerベースのデプロイ。

SerialLain3170/AwesomeAnimeResearch

アニメおよびカートゥーン生成に焦点を当てた、画像合成からアニメーション制作までを網羅する研究論文とデータセットの厳選されたコレクション。

google-deepmind/dm_pix

PIXは、JAXベースの画像処理ライブラリであり、GPU/TPU加速機能(例:反転、リサイズ)を提供します。`jax.jit`でコンパイル、`jax.vmap`でベクトル化、または`jax.pmap`で複数デバイス上で実行可能です。まずJAXをインストールし、次に`pip install dm-pix`を実行してください。NumPyの画像処理コードと同様に利用可能ですが、JAXのフルパフォーマンスと自動微分機能を利用できます。

dangeng/visual_anagrams

ピクセルベースの拡散モデルを使用して、回転、反転、または再配置によってアイデンティティが変化する錯覚画像(オプティカル・イリュージョン)を生成するツールです。

UCSC-VLAA/story-iter

トレーニング不要の反復フレームワークで、最大 100 フレームにわたる長編ストーリーの可視化において、グローバルリファレンスクロスアテンションモジュールを用いて意味的一貫性を保ちます。

Shilin-LU/MACE

MACE は拡散モデル用のファインチューニングフレームワークで、セレブリティや露骨なコンテンツなど、最大 100 個の不要な概念を大量に消去しながら、無関係なモデル知識を保持します。

Weistrass/DyRef

動的報酬最適化を使用して、画像生成モデルが異なる種類の複数の参照画像を正確に組み合わせることを可能にする二段階トレーニングフレームワーク。

ussoewwin/ComfyUI-QwenImageLoraLoader

Nunchaku Qwen‑Image、Z‑Image‑Turbo、Krea2 ControlNetモデル用のLoRA重みをロード・スタックするComfyUIカスタムノードのセット。UIコントロール、実験的AWQ調整層サポート、DiffSynth ControlNet統合を備える。

DigitalSlideArchive/HistomicsTK

HistomicsTKは、ホールスライド病理画像を解析するためのオープンソースのPythonツールキットです。染色ノーマライゼーション、核のセグメンテーション、および特徴量抽出を提供し、スタンドアロンのライブラリとして、またはDigital Slide Archiveウェブプラットフォームのプラグインとして使用できます。

zsyOAOA/ResShift

ResShift は、画像超解像と復元のための効率的な拡散モデルで、サンプリングステップを削減し、画像品質を犠牲にせず推論速度を向上させます。

mrslimslim/gpt-image-canvas

複数ステップのprompt-to-image生成のために、無限のキャンバスとエージェントによるプランニングを組み合わせた、ローカルファーストなAI画像ワークスペース。

bcmi/libcom

現実的なオブジェクト挿入を可能にする統一されたツールセットを提供する画像合成ツールボックス。調和、影生成、配置評価を含む。

giriss/comfy-image-saver

CivitaiやPromptheroと互換性のある生成メタデータを埋め込んだ画像を保存するためのComfyUIカスタムノードのセットです。

fallenshock/FlowEdit

FlowEdit は ICCV 2025 論文のオープンソース PyTorch 実装であり、事前学習済み拡散モデル(例: Stable Diffusion 3、Flux)とフロー ネットワークを再利用することで、高コストな潜在空間逆変換を必要とせずに高速なテキスト誘導画像編集を実現します。ユーザーは元画像、元の説明文、目的の説明文を提供するだけで、コンパクトな編集コードを計算し、編集画像を生成します。リポジトリには実行可能なスクリプト、YAML による設定、ComfyUI ノードへのリンクが含まれており、広範な統合が可能です。

haidog-yaqub/MeanFlow

A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.

open-mmlab/PowerPaint

テキストガイド付きオブジェクト挿入、オブジェクト削除、アウトペイントをサポートする、柔軟性に富んだ画像インペイントモデル。

VoxelCubes/PanelCleaner

Panel Cleanerは、機械学習モデルを使用して漫画の会話吹き出し内のテキストを検出し、マスク処理するオープンソースのPythonツールです。その後、テキストを削除(LaMaによるインペイントをオプションで使用)またはOCRで抽出できます。コマンドラインまたはQt GUIから利用可能で、バッチ処理、CUDA加速、カスタマイズ可能なプロファイルをサポートします。GPL-v3ライセンスで、pipパッケージ、プリビルドバイナリ、Flatpak、AUR、Dockerイメージとして提供されています。

mittagessen/kraken

kraken は、歴史的および非ラテン文字用に設計されたオープンソースでPythonベースのOCRツールキットです。トレーナブルなレイアウト解析、読み順検出、ニューラルネットワークによる文字認識を提供し、右から左、双方向、縦書きの文字列に対応します。標準XMLフォーマット(ALTO、PageXML、hOCR)を出力し、単語レベルのバウンディングボックスを提供。パブリックモデルリポジトリを備え、LinuxまたはmacOSでpip/pipx経由でインストール可能。`kraken get …` でモデルを取得し、1行のコマンドで画像の2値化、セグメンテーション、OCRを実行できます。

gongnyang/gongnyang-prompt-kit

Claude Code用のプロンプトコンパイルキットで、曖昧な画像リクエストをgpt-image-2向けのプロフェッショナルで検証済みのプロンプトに変換

zjx0101/ObjectClear

ObjectClearは、ターゲットオブジェクトとその関連効果(影など)を同時に除去しつつ、背景の一貫性を維持するオブジェクト除去モデルです。

joeylitalien/noise2noise-pytorch

Noise2Noise 論文の非公式な PyTorch 実装。ガウス、ポアソン、テキストオーバーレイ、またはモンテカルロレンダリングノイズを使用して、ノイズのみを含むデータで U‑Net ノイズ除去器を学習およびテストするためのスクリプトを提供します。

apple-aiml-research/ml-gmpi

2D GANs を Multiplane Images に変換することで、3D 視点合成とメッシュ抽出を可能にする 3D 対応型生成モデル。

apple-aiml-research/ml-mdm

マトリョーシカ拡散モデルのためのエンドツーエンドフレームワークで、最大1024x1024ピクセルの高解像度テキストから画像への合成モデルの効率的なトレーニングを可能にします。

a312863063/generators-with-stylegan2

映画、広告、ゲームで使用される、高忠実度でユニークなバーチャルな人間の顔を生成する StyleGAN2 ベースの顔生成器のコレクションです。

ModelTC/LightX2V-Qwen-Image-Lightning

Qwen‑Image テキストから画像へのモデルの蒸留された、より高速なバージョン(4 または 8 ステップ拡散)で、fp32/bf16/fp8 チェックポイント、LoRA アダプター、すぐに使える ComfyUI ワークフローを提供します。わずかな品質低下で 12〜25 倍の高速化を実現し、Diffusers、ComfyUI、Nunchaku、Cache‑dit と統合できます。

hako-mikan/sd-webui-supermerger

AUTOMATIC1111のStable Diffusion WebUI用のモデルマージ拡張機能。モデルをメモリ内でマージし、ディスクへの保存なしでブロックごとの重み調整を行うことができます。

lucidrains/autoregressive-diffusion-pytorch

拡散モデルを用いることでベクトル量子化を必要としない、自己回帰的な画像生成のPyTorch実装です。

alexandre01/deepsvg

深層学習と微分可能なテンソルを用いて、ベクターグラフィックス(SVG)の生成とアニメーションを行う階層的生成ネットワークおよびライブラリ。

huangzh13/StyleGAN.pytorch

高解像度のリアルな画像を生成するための、オリジナルの StyleGAN アーキテクチャの歴史的な PyTorch 実装です。

Jonseed/ComfyUI-Detail-Daemon

FluxおよびSDXLモデルに特に最適化された、サンプリング中にノイズスケジュール(シグマ)を調整することで画像の細部を強化し、背景のぼかしを軽減するComfyUIノードのセットです。

giddyyupp/ganilla

実写画像を芸術的なイラストに変換するための生成対抗ネットワーク、GANILLA の PyTorch 実装です。

facefusion/facefusion-pinokio

FaceFusion Pinokio は、Pinokio を通じたワンクリックインストールにより、画像および動画内の顔の交換・編集が可能な、簡素化されたインストールプロセスを提供する顔操作プラットフォームです。

TencentARC/ColorFlow

ColorFlowは、フレーム間でキャラクターやオブジェクトのアイデンティティを一貫性を持って維持しながら、黒白画像シーケンスを色分けするリトリーブ増強拡散フレームワークです。

cracker0dks/CaptchaSolver

CaptchaSolver は、Node.js を介して実行される YOLO/Darknet ニューラルネットワークモデルを使用して、数種類のファイルホスティングサイトの 6 桁および幾何学的キャプチャを自動的に解決する JDownloader 2 プラグインです。Windows/Linux(amd64)用の事前コンパイル済みバイナリと、他のプラットフォーム用のビルド手順を提供しており、サーバーや NAS デバイスで JDownloader を完全に自動化して運用できるようにします。