SerialLain3170/adeleine

一个支持通过彩色提示、文本标签或参考图像进行引导的线稿自动上色深度学习框架。

Bing-su/adetailer

一个用于 Stable Diffusion web UI 的扩展,可自动完成掩码与修复,以优化生成图像的细节。

cocktailpeanut/fluxgym

Flux Gym 提供了一个 Gradio Web UI,让您可以在 12-20GB GPU 上训练 FLUX diffusion LoRAs。它封装了 Kohya-ss 训练脚本,提供完整的脚本选项、自动模型下载、可选的样本图像生成以及一键发布到 Hugging Face。

deepgenteam/deepgen

DeepGen 1.0 是一个轻量级 5B 参数统一多模态模型,将图像生成、编辑和推理整合到一个框架中。

nihui/zimage-ncnn-vulkan

一个基于 ncnn 的便携式 Z-Image 生成器实现,可在任何支持 Vulkan 的 GPU 上实现高性能图像生成、图像修复和 ControlNet 支持。

Lornatang/SRGAN-PyTorch

基于生成对抗网络的 PyTorch 重实现 SRGAN,可生成恢复精细纹理的 4 倍放大照片级真实感图像。

asagi4/comfyui-prompt-control

一个 ComfyUI 扩展,允许你使用简单的文本提示词来控制复杂的 AI 图像生成工作流(如 LoRA 加载、提示词调度和区域提示词),而无需手动连接数十个节点。

yanokusnir-ai/one-node-flux-2-klein

一个 ComfyUI 自定义节点,将完整的 FLUX.2 [klein] 工作流封装为单一、自包含的 UI 小部件,消除复杂的节点图。

worldbench/DanceOPD

DanceOPD 是一个研究型库,将多种基于扩散模型的图像生成能力(文本转图像、局部编辑、全局编辑、写实度等)浓缩到一个模型中。它将每个教师模型视为速度场,在学生模型的自身 Rollout 状态下进行查询,并使用简单的速度 MSE 损失进行训练。该库支持 SD-3.5-Medium 和 Z-Image 后端,包含一个微型烟雾测试(smoke-test),并提供用于 LoRA 适配器完整训练的脚本与配置。

hustvl/ControlAR

ControlAR 为自回归模型提供可控图像生成,支持通过边缘、深度或掩码进行空间引导,并支持任意分辨率。

wafer-bob/ASASR

ASASR 是一个基于 FLUX.1-dev 的忠实图像超分辨率框架,利用对抗 Sobolev 对齐减少伪影并提升放大图像的结构保真度。

bentoml/BentoDiffusion

一个使用 BentoML 框架来自助托管和部署各种 Stable Diffusion 系列模型的示例项目集合。

shiimizu/ComfyUI_smZNodes

自定义 ComfyUI 节点(CLIP Text Encode++ 和 Settings),复现 AUTOMATIC1111 的提示词解析和嵌入逻辑,实现 stable-diffusion-webui 与 ComfyUI 之间的图像生成完全一致。

Windsander/ADI-Stable-Diffusion

一个使用 ONNXRuntime 在多个平台上实现高性能、无 Python 依赖的 Stable Diffusion 模型推理的 C++ 库和 CLI 工具。

mrhan1993/Fooocus-API

为 Fooocus 构建的基于 FastAPI 的 REST API,允许开发者无需手动调整参数即可通过编程方式生成高质量图像。

melMass/comfy_mtb

ComfyUI 的自定义节点集合,通过额外的实用工具扩展图像生成工作流。

lobehub/sd-webui-lobe-theme

一款为 Stable Diffusion WebUI 设计的现代、高度可定制的界面框架,可提升 AI 图像生成的工作流与视觉体验。

yejy53/RealGen

RealGen 是一种文本生成图像工具,在强化学习过程中使用 AI 检测器作为奖励信号,从而生成具有极高写实感且伪影更少的图像。

cure-lab/MMA-Diffusion

通过使用多模态对抗性攻击来绕过提示词过滤器和安全检查器以生成 NSFW 内容,从而评估 Text-to-Image 模型的安全性框架。

ATH-MaaS/Ovis-Image

Ovis-Image 是一个 7B 参数的文本生成图像模型,针对高质量文字渲染和布局精度进行优化,旨在能够在普通可获取的硬件上高效运行。

nachifur/RDDM

一个用于高质量图像修复与生成的残差去噪扩散模型框架,支持去雨、去模糊等任务。

viiika/Meissonic

Meissonic 是一种非自回归掩码生成 Transformer,专为在消费级 GPU 上运行而设计,可实现高效的高分辨率文本到图像合成。

nxnai/Voost

Voost 是一个统一的 Diffusion Transformer,能够高质量地双向虚拟试穿与脱衣,允许用户在人物图片中添加或移除服装。

Ammmob/PixelSmile

PixelSmile 是一款细粒度的面部表情编辑工具,能够在保持人物或动漫角色身份的前提下,改变图像中的情绪。

nekhtiari/image-similarity-measures

一个 Python 包和 CLI,用于计算两张图像之间的八种标准图像相似度指标(RMSE、PSNR、SSIM、FSIM、ISSM、SRE、SAM、UIQ)。通过 pip 安装,可选添加加速功能,使用 `image-similarity-measures` 命令或代码中的 `evaluation` 函数。适用于定量评估图像处理或 AI 模型,尤其在遥感领域非常有用。

Stability-AI/stability-sdk

用于 Stability API 的客户端 SDK,通过 Python 库和命令行工具实现图像生成、放大和动画制作。

mo-browser-apps/icons

一款使用 AI 生成 macOS 应用图标(.icns 格式)的桌面应用,用户可通过描述期望设计并逐步优化结果。

HalfAI1102/anthropic-art

一个代理技能,以 Anthropic 视觉风格生成手绘编辑插图,将抽象概念转化为极简视觉隐喻。

Nutlope/blinkshot

一个基于 Juggernaut Lightning Flux 和 Together AI 的开源实时 AI 图像生成器。

Sygil-Dev/sygil-webui

一个为低 VRAM GPU 优化的 Stable Diffusion 浏览器端用户界面,提供图像生成、放大和提示工程工具。

ShuaixinHuang/image-multiple-angles-3d-camera

一个 3D 控制的图像生成工具,允许用户通过交互式 3D 小部件和 Qwen-Image-Edit-Plus 模型,更改上传图像的相机视角。

Lakonik/LakonLab

用于实验大型扩散模型的高性能代码库,实现了先进的流匹配(flow-matching)与蒸馏技术,以实现高效的几步图像生成。

Mukosame/Anime2Sketch

一款使用深度学习将插画、动漫艺术和漫画转换为干净线稿和草图的草图提取工具。

apple-aiml-research/ml-stable-diffusion

一个用于在 Apple Silicon 上使用 Core ML 转换和运行 Stable Diffusion 模型的工具包,具备面向移动部署的高级权重压缩功能。

spectertoucanberth/thumbnail-maker-lab

Thumbnail Maker Lab 是一个专业设计工具包,结合矢量图形与AI驱动的图像编辑和批量处理功能,用于创建缩略图。

cathrynlavery/diagram-design

Diagram Design 是一种 AI 代理技能,可生成大量符合品牌规范的静态 HTML + SVG 编辑图表(架构图、流程图、图表、地图等),提供三种视觉变体,并具备自动色彩/字体导入与无障碍支持。它可与 Claude Code、Codex、Copilot、Factory Droid、Pi、Kiro 及其他代理技能平台整合。

liujuntao123/smart-excalidraw-next

Smart Excalidraw 是一个 Next.js Web 应用,利用大语言模型(如 Claude sonnet-4.5)将自然语言描述转换为可编辑的 Excalidraw 图表。它支持 20 多种图表类型、自动路由箭头,并提供共享服务端 LLM(访问密码)或个人 API Key 配置。可通过 pnpm dev 本地运行或使用托管演示。

ramjke/Translumo

Translumo 是一款 Windows 桌面应用程序,可捕获屏幕区域、运行 OCR(Windows OCR、Tesseract、EasyOCR),通过小型 ML 模型选择最佳结果,并利用 DeepL/Google/Yandex/Papago 翻译文本,最后将翻译结果覆盖于屏幕上。专为游戏实时使用而设计,支持多种源/目标语言、代理服务器轮替及低延迟操作。该项目为开源(Apache 2.0),使用 .NET 8、Visual Studio 2022 及多种 OCR/视觉库构建。

Picsart-AI-Research/MI-GAN

一个针对移动设备优化的轻量级基于 GAN 的图像修复模型,在显著减少参数并加快推理速度的同时,提供与 SOTA 模型相当的高质量结果。

Physton/sd-webui-prompt-all-in-one

一个为 stable-diffusion-webui 设计的扩展功能,通过自动翻译、提示词组织工具与 ChatGPT 集成,提升提示词输入体验。

TTPlanetPig/Comfyui_TTP_Toolset

一套 ComfyUI 节点集合,包含 Smart Tile 2.0,这是一种对象感知型平铺 img2img 工作流,利用语义检测和可变大小的平铺块来实现高细节放大。

leeguooooo/image-use

无需 OpenAI API 密钥的零依赖 Python CLI,可利用现有 ChatGPT 或 Gemini 订阅生成图像。

groundboxerrespect/Dlls5-auto

一个通过 REST API 为任意图像应用电影级光照和光晕等写实神经渲染美学的自托管图像增强服务。

HyperGAN/HyperGAN

一个基于 PyTorch 的可组合 GAN 框架,使开发者和艺术家能够轻松训练、共享和部署生成对抗网络。