Steve-Mr/EmojiFace

FaceMoji(EmojiFace)是一款 Android 和 Web 应用,使用 YOLOv8‑face 模型在本地检测人脸,并用表情符号或模糊效果覆盖。支持离线运行、手动编辑、自定义表情符号字体,可作为仅通过分享启动的隐藏图标应用安装。

tmchow/illo-skill

一个为 AI 代理设计的插件,可生成带有反复出现吉祥物的印刷风格插图和图表,以视觉化呈现想法。

mirabarukaso/character_select_stand_alone_app

用于 AI 图像生成的独立界面。提供视觉角色选择、半自动标签补全,以及与 ComfyUI 和 Forge Neo 的 API 集成。

lquesada/ComfyUI-Inpaint-CropAndStitch

一个 ComfyUI 扩展,通过裁剪遮罩区域、在目标分辨率下处理并无缝缝合回原始图像,实现修复优化。

RoseKhlifa/Image-Studio

一个使用 SSE 和 WebSocket 模式防止长时间推理任务中连接超时的跨平台图像生成和编辑客户端。

nova452/Rebalance-Pack

一系列自定义 ComfyUI 节点,旨在简化图像生成和编辑,并提供对 Krea 2 和 Ideogram 4 模型的专门支持。

framepipe-dev/media-inference-worker

一个小型 Python 客户端,通过文本提示调用内部图像生成服务(例如 qwen-image-3)。安装依赖项,使用模型名称和提示运行 `generate.py`,其他端点请参阅 `RUNBOOK.md`。

ShiftHackZ/Stable-Diffusion-KMP

一款适用于 Android 和 iOS 的开源跨平台 AI 图像生成客户端,可连接至自托管 Stable Diffusion 服务器、云端 API 和本地设备运行时。

civitai/civitai

一个用于共享、发现和协作开发 Stable Diffusion 模型及 AI 生成定制化内容的社区平台。

Kosinkadink/ComfyUI-Advanced-ControlNet

一套用于高级 ControlNet 调度的 ComfyUI 节点,允许使用关键帧和自定义权重对整个时间步和批处理潜变量进行精确的强度控制。

Azornes/Comfyui-LayerForge

ComfyUI 的分层画布编辑器节点,支持在浏览器中进行图像合成、多边形修复选择和背景移除。

Code-with-Beto/snapai

一个 CLI 工具,移动开发者可使用 OpenAI 和 Google Gemini 图像模型生成应用图标和 Google Play 特性图形。

unconv-ai/Un-0

基于 Kuramoto 动力学的图像生成模型,通过整合耦合振子而非使用扩散或迭代去噪来生成图像。

TeamMoeAI/MoeSR

一款利用深度学习模型,专门针对 ACGN 插画、CG 和漫画优化的图像超分辨率与修复工具。

ssitu/ComfyUI_UltimateSDUpscale

一组 ComfyUI 节点,通过分块(tiled)方法对大图进行图生图扩散,以提升细节并降低硬件需求。

vladmandic/sdnext

基于 Stable Diffusion 的 AI 图像和视频生成综合 Web 界面,具有先进的内存优化和广泛的硬件支持。

facebookresearch/stable_signature

一个将不可见水印直接嵌入生成式 AI 模型的 LDM 解码器的系统,用于自动识别 AI 生成的图像。

yuanchenyang/smalldiffusion

一个轻量级的扩散库,用于训练和采样扩散及流模型,提供简洁的核心,便于在 U‑Net 和 DiT 架构上进行实验。

Topkill/tianruoocr

TianRuo OCR v6 是一款 Windows 桌面应用,可捕获屏幕文本,通过 PaddleOCR/RapidOCR 实现在线或离线 OCR,并使用多种在线服务进行翻译。支持常规、静默、截图和剪贴板监听模式,可配置快捷键,支持印刷体、表格和手写文本识别。

cardenluo/ComfyUI-Apt_Preset

ComfyUI‑Apt_Preset 是可视化 AI 工作流工具 ComfyUI 的插件。它将加载、control-net 和采样步骤打包为预设驱动的节点,提供适用于多种模型家族的通用加载器、用于视频/动画/control-net 的控制器堆栈、组合采样器节点以及实用图像/掩码工具。通过克隆到 `custom_nodes` 并运行 `install.bat` 进行安装;可选的配套插件和资源包可增加额外功能。该插件简化了复杂的图像生成图,使其更易于构建和维护。

intel/openvino-ai-plugins-gimp

OpenVINO AI 插件 for GIMP 通过 Intel OpenVINO 为 GIMP 3 添加了本地 AI 功能(超分辨率、语义分割以及包括 FastSD 在内的多种 Stable-Diffusion 变体),支持 CPU/GPU/NPU 推理。按照提供的 Windows/Linux 指南安装,加载模型后即可在编辑器内直接生成或编辑图像。

gmberton/vismatch

vismatch 是一个 Python 库,将 50 多种图像匹配模型(如 SIFT-LightGlue、LoFTR、SuperPoint-LightGlue)封装在单一、易于使用的 API 之后。它处理模型下载、图像加载、匹配和可视化,并提供 CLI 工具用于批量处理。该项目旨在简化对前沿视觉对应方法的实验和比较。

chflame163/ComfyUI_LayerStyle

一套为 ComfyUI 提供类 Photoshop 图层与蒙版合成功能的节点,减少对外部编辑软件的需求。

YouMind-OpenLab/nano-banana-pro-prompts-recommend-skill

一项 AI 代理技能,可帮助 AI 助手搜索并推荐适用于 Nano Banana Pro(Gemini)图像生成模型的 10,000+ 个精选提示。

wildminder/ComfyUI-DyPE

一个 ComfyUI 自定义节点包,通过无需训练的模型补丁和级联优化,使 FLUX 和 Qwen Image 等扩散变换器实现 4K+ 超高清图像生成。

sepandhaghighi/samila

一个生成艺术生成器,通过基于数学公式和随机参数计算数千个点来生成独特图像。

wooyeolbaek/attention-map-diffusers

attention‑map‑diffusers 是一个 Python 库,用于捕获和可视化 Hugging Face Diffusers 图像和视频生成管道中的注意力张量,让用户能够看到提示、图像块或视频帧如何相互影响。

Tencent-Hunyuan/HY-SOAR

HY-SOAR 是一种无奖励的后训练方法,用于纠正扩散模型的曝光偏差,通过让模型在生成过程中自行修正轨迹错误。

SalesforceAIResearch/DiffusionDPO

一个用于 Diffusion-DPO 的训练框架,通过直接偏好优化(Direct Preference Optimization)将 Stable Diffusion 等图像生成模型与人类偏好对齐。

rohitgandikota/sliders

一个用于创建 LoRA 适配器的框架,这些适配器充当滑块,可在 Stable Diffusion 与 FLUX 等扩散模型中精确控制特定视觉概念。

KohakuBlueleaf/LyCORIS

一个实现 LoHa 和 LoKr 等多种参数高效微调算法的库,使 Stable Diffusion 模型在极小存储和计算开销下实现高质量定制。

MochiDiffusion/MochiDiffusion

专为 Apple Silicon 设计的 macOS 原生应用程序,用于在本地运行 Stable Diffusion 和 FLUX.2 Klein,通过 Core ML 优化了高性能和低内存占用。

EutropicAI/Final2x

一款使用 AI 将图像放大并支持自定义模型和现代 Nvidia GPU 的跨平台图像超分辨率工具。

hako-mikan/sd-webui-regional-prompter

AUTOMATIC1111 的 Stable Diffusion WebUI 的自定义脚本,允许用户为图像的不同区域指定不同的提示词,以防止提示词溢出。

easydiffusion/easydiffusion

Stable Diffusion 的一键安装程序和用户界面,允许用户在无需技术知识的情况下在本地运行强大的图像生成 AI。

OpenModelDB/open-model-database

一个由社区驱动的数据库,可发现、比较和下载超过 600 个 AI 图像和视频上采样模型,并附有详细的元数据。

runpod-workers/worker-comfyui

RunPod 上的 ComfyUI 无服务器封装器,允许用户通过可扩展的 API 端点执行复杂的图像生成工作流。

lynote-ai/ai-image-detector

AI Image Detector 是一个开源的 Python 工具,用于估计图像是由 AI 生成的可能性。它自带多个即用的后端(UnivFD、Sentry、Nonescape、混合集成),只需运行单条指令 (`aidetect detect …`) 对文件或文件夹进行检测,即可输出概率和标签。可选的 extras 提供 Gradio Web UI 或 FastAPI 服务器。仓库中还包含基准测试脚本、阈值校准以及选择后端的明确指南。它是一个轻量、一次安装、随处可运行的 AI 图像检测实用工具,并有文档说明其局限性(无全局保证、无区域级定位)。

gazingstars123/Anima-Standalone-Trainer

一个用于 Implements LoRA 微调的 Anima 模型轻量级训练环境,配备有 Web UI。

KohakuBlueleaf/z-tipo-extension

适用于 SD-WebUI、Forge 和 ComfyUI 的提示词扩展插件,利用 TIPO 和 DanTagGen LLM 将简单标签或标题转换为详细的图像生成提示词。

boogu-project/Boogu-Image

一个开源的统一图像生成与编辑模型家族,提供高质量的文本到图像生成和精确的图像编辑能力,具备强大的中英文双语文本渲染功能。

ByteVisionLab/DreamLite

DreamLite 是一个紧凑的 0.39B 参数统一扩散模型,可在设备端完全实现超快速的 1024x1024 图像生成与编辑。

computational-cell-analytics/micro-sam

micro_sam 是一个基于 napari 的库,将 Meta 的 Segment Anything 模型适配用于显微镜成像。它提供仅需几次点击即可完成的交互式 2D/3D 分割与追踪,包含显微镜专用微调的 SAM 权重,并提供可选的自动提示生成和轻量级微调工具。

vvvvvjdy/D-OPSD

D-OPSD 是一种在线策略自我蒸馏框架,允许步进式蒸馏扩散模型在保持快速推理能力的同时,持续地针对新风格和概念进行微调。

pcb9382/PlateRecognition

PlateRecognition 是一个基于 YOLO‑v5/v7/v8 和 TensorRT 的开源多地区车牌检测与OCR系统。它可在桌面、服务器、Android/iOS 以及多种边缘AI芯片上运行,在现代硬件上实现 >99 % 的准确率,延迟低于50 ms。该项目提供 C/C++ 和 Python API,支持多种语言,并包含网页演示和测试代码。

danforthcenter/plantcv

PlantCV 是一个用于高通量植物表型分析的开源 Python 库。它提供模块化的计算机视觉功能(如分割、性状提取等),可串联成自定义分析流程。可通过 pip 或 conda 安装,包含详尽的文档、教程以及活跃的贡献者社区。

hustvl/Moebius

Moebius 是一个轻量级 0.22B 参数图像修复框架,通过架构优化与知识蒸馏,实现 100 亿级质量与 15 倍更快的推理速度。

helblazer811/Diffusion-Explorer

一个用于教育目的的互动式可视化工具,解释扩散模型与流式生成模型的几何直觉。