wildminder/ComfyUI-DyPE

一个 ComfyUI 自定义节点包,通过无需训练的模型补丁和级联优化,使 FLUX 和 Qwen Image 等扩散变换器实现 4K+ 超高清图像生成。

martin-rizzo/ComfyUI-ZImagePowerNodes

一组专为 Z-Image Turbo 模型优化的 ComfyUI 自定义节点,提供增强的风格控制、低步数一致性以及构图多样性。

LuqP2/Image-MetaHub

Image MetaHub 是一款本地优先的桌面应用(Electron + React),用于索引 AI 生成的图像、视频和音频,从 ComfyUI、Automatic1111、InvokeAI、Midjourney 等工具中提取生成元数据,并提供快速分面搜索、视觉相似性搜索、谱系追踪和嵌入式 ComfyUI 工作区。核心应用开源(MPL 2.0),$39 离线 Pro 许可证解锁高级集成、比较视图、无限聚类和分析功能。

CVCUDA/CV-CUDA

CV‑CUDA 是 NVIDIA 的开源 GPU 加速计算机视觉库。它提供快速、可扩展的图像/视频算子(调整大小、滤镜、色彩转换等),这些算子完全在 GPU 上运行,并与 C/C++ 和 Python AI 框架集成。通过 Linux 的预构建 wheels (`cvcuda-cu12` 或 `cvcuda-cu13`) 进行安装,使用 `nvimgcodec` 将图像直接解码至 GPU,并在将数据馈送至深度学习模型之前串联 CV‑CUDA 算子。该库针对现代 NVIDIA GPU (Turing 及更新版本) 设计,并应用于 Microsoft Bing 视觉搜索和 Tencent Cloud 视频处理等生产系统中。

carson-katri/dream-textures

一个 Blender 插件,集成 Stable Diffusion,直接在 3D 工作区内生成无缝纹理、概念艺术和图像资产。

damian0815/compel

适用于 transformers 型文本嵌入系统的文本提示权重与混合库,可精确控制图像生成流水线中提示的影响。

YukihoAA/waifu2x_snowshell

一个用于 waifu2x、Real-CUGAN 和 Real-ESRGAN 等多个 AI 图像放大工具的 GUI 外壳,提供图像增强的拖拽界面。

thekevinscott/UpscalerJS

一个可在浏览器或 Node.js 中使用 AI 实现图像分辨率提升、去噪和去模糊的 JavaScript 库。

Dana-Farber-AIOS/pathml

PathML 是一个开源的 Python 库(也提供 Docker 镜像),可简化全片病理工作流:加载多种切片格式、执行可扩展的预处理(染色归一化、切块、GPU 转换)、将数据转换为 PyTorch 张量、构建细胞层级图,并运行深度学习或 ONNX 模型。它旨在降低 AI 驱动的计算病理门槛,已在多篇高影响力的生物医学出版物中使用。

adobe-research/custom-diffusion

一种快速且高效的方法,用于微调文本到图像扩散模型,从少量图像中学习新概念,且仅需极少的存储空间。

hollowstrawberry/kohya-colab

一套用于准备数据集和训练 Stable Diffusion LoRA 模型的 Google Colab 笔记本,支持 SDXL。

e-sensing/sits

SITS 是一个开源 R 包(附带 Python 包装器),用于构建、正则化和分类卫星影像时序数据立方体。它可连接多个公共地球观测数据集,提供一系列 ML/DL 模型(包括 GPU 加速的 CNN 和注意力编码器),并提供从训练、分类、平滑、不确定性估计到主动学习的端到端工具。

facefusion/facefusion-docker

基于 Docker 的 FaceFusion 人脸操作平台部署方案,可让用户在 CUDA 和 ROCm 等多种硬件加速器上轻松运行该软件。

SerialLain3170/AwesomeAnimeResearch

专注于动画和卡通生成的精选研究论文与数据集集合,涵盖从图像合成到动画制作的各个主题。

google-deepmind/dm_pix

PIX 是一个基于 JAX 的图像处理库,提供 GPU/TPU 加速的函数(例如:翻转、缩放),这些函数可以使用 `jax.jit` 进行编译、使用 `jax.vmap` 进行向量化,或使用 `jax.pmap` 在多个设备上运行。请先安装 JAX,然后执行 `pip install dm-pix`。其用法与 NumPy 图像处理代码完全相同,但具备完整的 JAX 性能和自动微分功能。

dangeng/visual_anagrams

使用基于像素的扩散模型生成多视角错觉图的工具,可创建在旋转、翻转或重新排列时会改变身份的图像。

UCSC-VLAA/story-iter

一个无需训练的迭代框架,用于长篇故事可视化,利用全局参考交叉注意力模块在最多 100 帧中保持语义一致性。

Shilin-LU/MACE

MACE 是一个用于扩散模型的微调框架,能够大规模抹除多达 100 个不想要的概念(例如名人或露骨内容),同时保留与之无关的模型知识。

Weistrass/DyRef

一个两阶段训练框架,使用动态奖励优化使图像生成模型能够准确结合多张不同类型的参考图像。

ussoewwin/ComfyUI-QwenImageLoraLoader

一组用于 ComfyUI 的自定义节点,可加载并堆叠 Nunchaku Qwen‑Image、Z‑Image‑Turbo 和 Krea2 ControlNet 模型的 LoRA 权重,支持 UI 控制、实验性 AWQ 调制层支持和 DiffSynth ControlNet 集成。

DigitalSlideArchive/HistomicsTK

HistomicsTK 是一个用于分析全切片病理图像的开源 Python 工具包。它提供染色归一化、细胞核分割和特征提取功能,既可以作为独立库使用,也可以作为 Digital Slide Archive Web 平台插件使用。

zsyOAOA/ResShift

ResShift 是一种高效的扩散模型,用于图像超分辨率和恢复,通过减少采样步数提升推理速度,同时不牺牲图像质量。

mrslimslim/gpt-image-canvas

一个本地优先的 AI 图像工作区,将无限画布与智能体规划相结合,用于多步骤的提示词到图像生成。

bcmi/libcom

一个提供统一工具集的图像合成工具箱,用于实现逼真的对象插入,包括调和、阴影生成和放置评估。

giriss/comfy-image-saver

一组用于在 ComfyUI 中保存嵌入生成元数据的图像的自定义节点,确保与 Civitai 和 Prompthero 兼容。

fallenshock/FlowEdit

FlowEdit 是 ICCV 2025 论文的开源 PyTorch 实现,通过复用预训练扩散模型(如 Stable Diffusion 3、Flux)和流网络,实现无需昂贵潜在空间反演的快速文本引导图像编辑。用户只需提供源图像、源描述和目标描述,系统即可生成简洁的编辑代码并输出编辑图像。仓库包含可直接运行的脚本、基于 YAML 的配置以及 ComfyUI 节点链接,便于广泛集成。

haidog-yaqub/MeanFlow

A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.

open-mmlab/PowerPaint

支持文本引导对象插入、对象移除和外绘的多功能图像修复模型。

VoxelCubes/PanelCleaner

Panel Cleaner 是一个开源的 Python 工具,利用机器学习模型定位并遮盖漫画对话气泡中的文本,然后可选择性地移除文本(支持可选的 LaMa 图像修复)或通过 OCR 提取文本。支持命令行和 Qt GUI,具备批量处理、CUDA 加速和可配置的配置文件功能。项目采用 GPL-v3 许可证,可通过 pip 包、预构建二进制文件、Flatpak、AUR 和 Docker 镜像获取。

mittagessen/kraken

kraken 是一个开源、基于 Python 的 OCR 工具包,专为历史文献和非拉丁文字设计。提供可训练的布局分析、阅读顺序检测和神经网络字符识别,支持从右到左、双向及竖排文本。输出标准 XML 格式(ALTO、PageXML、hOCR),提供单词级边界框,并附带公开模型仓库。可通过 pip/pipx 在 Linux 或 macOS 上安装,使用 `kraken get …` 获取模型,再通过一行命令完成图像的二值化、分段与 OCR。

gongnyang/gongnyang-prompt-kit

专为 Claude Code 设计的提示编译工具包,可将模糊的图像请求转化为适用于 gpt-image-2 的专业且经过验证的提示

zjx0101/ObjectClear

ObjectClear 是一个对象移除模型,能够联合消除目标对象及其相关效应(如阴影),同时保持背景一致性。

joeylitalien/noise2noise-pytorch

Noise2Noise 论文的非官方 PyTorch 实现,提供脚本以使用高斯、泊松、文本叠加或蒙特卡洛渲染噪声,在仅含噪数据上训练和测试 U‑Net 去噪器。

apple-aiml-research/ml-gmpi

一种具备 3D 感知能力的生成模型,可将 2D GANs 转换为多平面图像 (Multiplane Images) 以实现 3D 视角合成与网格提取。

apple-aiml-research/ml-mdm

一个用于套娃扩散模型的端到端框架,能够高效训练高达1024x1024像素的高分辨率文本到图像合成模型。

a312863063/generators-with-stylegan2

一系列基于 StyleGAN2 的面部生成器,可为电影、广告和游戏行业提供高保真度、独特的虚拟人脸。

ModelTC/LightX2V-Qwen-Image-Lightning

Qwen‑Image 文本到图像模型的蒸馏、更快速版本(4 或 8 步扩散),提供 fp32/bf16/fp8 检查点、LoRA 适配器,以及开箱即用的 ComfyUI 工作流。提供 12–25 倍的加速,仅有轻微的质量损失,并可与 Diffusers、ComfyUI、Nunchaku 和 Cache‑dit 集成。

hako-mikan/sd-webui-supermerger

一个用于 AUTOMATIC1111 的 Stable Diffusion WebUI 的模型合并扩展,允许用户在内存中合并模型并执行逐块权重调整,而无需保存到磁盘。

lucidrains/autoregressive-diffusion-pytorch

一个基于扩散方法的 PyTorch 实现,用于自回归图像生成,无需依赖向量量化。

alexandre01/deepsvg

一个使用深度学习和可微分张量创建和动画矢量图形(SVG)的分层生成网络和库。

huangzh13/StyleGAN.pytorch

一个用于生成高分辨率现实主义图像的原始 StyleGAN 架构的历史性 PyTorch 实现。

Jonseed/ComfyUI-Detail-Daemon

一组专为 Flux 和 SDXL 模型优化的 ComfyUI 节点,通过在采样过程中调整噪声调度(sigmas),增强图像细节并减少背景模糊。

giddyyupp/ganilla

GANILLA 的 PyTorch 实现,这是一种旨在将真实图像转换为艺术插图的生成对抗网络。

facefusion/facefusion-pinokio

FaceFusion Pinokio 是一个面部操作平台,通过 Pinokio 实现简化的安装流程,使用户能够轻松在图像和视频中交换和修改面部。

TencentARC/ColorFlow

ColorFlow 是一个检索增强的扩散框架,可在保持角色和物体身份一致的前提下,为黑白图像序列上色。

cracker0dks/CaptchaSolver

CaptchaSolver 是一个 JDownloader 2 插件,使用通过 Node.js 运行的 YOLO/Darknet 神经网络模型,自动解决少数文件托管网站的 6 位和几何验证码。它提供 Windows/Linux(amd64)的预编译二进制文件,并为其他平台提供构建说明,使用户能够在服务器或 NAS 设备上完全无人值守地运行 JDownloader。

Nutlope/easyedit

EasyEdit 是一个由 Flux 2 和 Together AI 驱动的提示式图像编辑工具,允许用户仅通过一个文本提示修改图像。

mmartial/ComfyUI-Nvidia-Docker

支持 NVIDIA GPU 加速的 ComfyUI Stable‑Diffusion Web UI 的 Docker 镜像,提供 GPU 专用标签、UID/GID 映射和内置 ComfyUI‑Manager,便于轻松更新。