photoprism/photoprism

PhotoPrism 是一款开源的自托管 Web 应用,利用设备端 AI 自动对个人照片和视频进行标签化、搜索和整理,同时保护所有数据隐私。

pangxiaobin/image-matting

一款使用 RMBG-1.4 模型提供本地 AI 驱动的背景移除、批量处理和图像编辑工具的桌面应用程序。

AgriciDaniel/banana-claude

Banana Claude 是一个 Claude Code 插件,允许您输入自然语言请求,查看详细计划(提示、模型、成本估算),在明确批准后调用 Google 的 Gemini 图像模型生成或编辑视觉资产。它强调离线优先规划、隐私安全的 API 密钥处理以及一次性批准,以保持成本透明。

yolain/ComfyUI-Easy-Use

ComfyUI-Easy-Use 是一套全面的自定义节点,旨在简化 ComfyUI 可视化编辑器中 Stable Diffusion(及其他扩散模型)工作流的构建。它增加了单键加载器、提示词助手、LoRA/ControlNet 堆叠、循环/条件逻辑、图像工具和 UI 优化,让用户能以更少的节点创建并运行复杂的生成管线。

krea-ai/krea-2

Krea 2 是一个开源图像生成模型,包含一个用于灵活微调的基础 RAW 模型和一个用于快速、高质量文本到图像合成的蒸馏 Turbo 模型。

palxiao/poster-design

一款开源的 AI 海报设计工具与在线图片编辑器,具备 DOM 画布、AI 背景移除功能以及完整的管理后台。

nuyoah-ai-works/nuyoah-xiezhen-prompt

一种AI人像摄影提示工程技能,通过重构专业摄影计划,实现多张照片间一致的风格和角色复现。

nregret/Comfyui-Anima-Tools

专为动漫AI艺术设计的ComfyUI视觉提示与LoRA选择工具,包含4万多个艺术家、角色和服装标签的数据库。

AHEKOT/ComfyUI_VNCCS

一个用于创建一致角色精灵的ComfyUI管道,允许用户在多张图像中管理外观、姿势、服装和情绪。

lucidrains/denoising-diffusion-pytorch

用于生成高质量图像和 1D 序列的 Denoising Diffusion Probabilistic Models (DDPM) 的 PyTorch 实现。

buluslan/gpt-image2-ecommerce

一款基于AI的电商视觉资产生成工具,利用39个场景模板和专业技术预检,生成专业且符合平台要求的产品图像。

wnby/photo-relic-editorial

一个 Codex 技能,通过将真实照片与同一张影像的克制、纸纹版画版本配对,将照片转换为垂直的编辑艺术品。

storytold/artcraft

ArtCraft是一款桌面IDE,让艺术家构建2D或3D场景,并用AI生成的图像、视频、音频、网格和世界填充。它提供可视化工具用于合成、姿态迁移、背景移除和提示驱动生成,支持62个内置模型以及Midjourney和Sora等外部提供者。适用于Windows/macOS(Linux从源码构建),目标用户是希望实现可重复、可控制的AI艺术工作流的创作者。

drawthingsai/draw-things-community

一个社区仓库,提供 Draw Things 应用的核心图像生成、采样和训练代码,包含可自托管的 gRPC 服务器以实现远程推理。

jtydhr88/ComfyUI-qwenmultiangle

一个 ComfyUI 自定义节点,提供交互式 3D 视口,用于控制相机角度并生成与 Qwen-Image-Edit-2511-Multiple-Angles-LoRA 兼容的提示。

allenk/GeminiWatermarkTool

一个跨平台的便携式可执行文件,使用确定性反向 Alpha 混合算法去除 Google Gemini 图像(及视频)水印,具备可选的 GPU 加速 FDnCNN 去噪、GUI/CLI 界面、批量处理以及通过 MCP 实现的 AI Agent 集成。

ATH-MaaS/ComfyUI-Copilot

一个为 ComfyUI 设计的智能助手,通过 LLM 驱动的代理程序自动化图像生成工作流的生成、调试和优化。

wzj177/ecommerce-image-suite

一个由 AI 驱动的工具包,帮助电商卖家自动分析产品照片,并生成适用于 Amazon、Taobao、JD.com、TikTok 等多种风格和平台的完整专业营销图像集。

TaiT-tt/tait-crt-interface-skill

一种 Codex 图像生成技能,可将照片或文本转换为具有早期 CRT 计算机界面美学的复古插图。

Fannovel16/comfyui_controlnet_aux

一系列 ComfyUI 节点,提供用于创建 ControlNet 提示图像(如深度图、Canny 边缘和人体姿态)的预处理器。

VigoZhao/AI-Visual-Prompt-Cookbook

一个精选的 130+ 个基于 JSON 的视觉风格提示模板库,用于 AI 图像生成。每个 `style.json` 定义了一个可复用的布局(如海报、拼贴、文字艺术),包含你需在粘贴到多模态 LLM(ChatGPT‑4‑Vision、Gemini‑3‑Pro 等)前填充的占位符。仓库包含预览图、示例值、验证脚本和复制提示快捷方式,旨在让 AI 生成的图形保持一致且易于迭代。

wkentaro/labelme

labelme 是一个跨平台的 Python/Qt 桌面应用程序,用于在图像或视频上绘制边界框、多边形、掩码等。标注数据以 JSON 格式保存,可导出为 VOC 或 COCO 格式,是创建计算机视觉模型训练数据的实用工具。可通过 pip、付费独立可执行文件或 Linux 包安装;最新版本增加了 AI 辅助掩码生成(SAM、YOLO-World)功能。

zuruoke/watermark-removal

一个使用图像修补技术来移除图像中的水印,并创造出无缝效果的机器学习项目。

dacnay816y62-hub/photo-revival

一套 AI 技能指令,能将普通照片转化为极简、充满诗意的手绘插画,并带有大量留白与微小的手写字幕。

filliptm/ComfyUI_Fill-Nodes

Fill‑Nodes 是一个大型自定义 ComfyUI 节点集合,提供图像处理、视觉效果、字幕生成、AI 模型调用(GPT、DALL‑E、Hugging Face 等)、文件处理(PDF、Google 驱动)、音频响应与视频工具。通过将仓库放入 ComfyUI 的 `custom_nodes` 文件夹即可安装。可用于构建端到端工作流,实现批量加载、应用创意效果、通过 LLM 生成字幕,并将结果导出为图像、视频、PDF 或云端存储文件。

six-nut/PocketMen-with-you

一个本地生成工具,可将两张或更多照片转换为一致、动画化的角色精灵,用于 Codex 伙伴,使用开放权重的图像模型。

Hunyuan-PromptEnhancer/PromptEnhancer

一个使用思维链 (Chain-of-Thought) 重写技术来增强文本到图像 (text-to-image) 和图像到图像 (image-to-image) 编辑提示词,同时保留原始用户意图的提示词重写工具。

kadevin/ilab-conjure

iLab CONJURE 是一个基于 FastAPI 的本地运行网页 UI(及 CLI),用于使用多种 AI 模型(GPT-Image、Gemini、Codex)生成和编辑图像。它提供任务队列、持久化图库、提示词模板标签、SQLite 历史记录,并支持 OpenAI 兼容 API 和本地 Codex OAuth 流程。可通过源代码或预构建的 macOS/Windows 安装包进行安装,配置 API 密钥后即可开始生成图像。

eikek/docspell

Docspell 是一个开源的个人文档管理系统,用于整理扫描的纸质文件、电子邮件及其他文件。它使用 Stanford CoreNLP 自动建议标签、日期和发件人,必要时运行 OCR,并通过 REST API 和移动端友好的 Elm Web UI 提供全文搜索。可通过 Docker、Debian 包、Nix 或 Helm 安装,采用 AGPL-v3 许可证。

SamurAIGPT/Vibe-Workflow

Vibe Workflow 是一个开源、MIT 许可证的节点式可视化编辑器,用于构建生成式图像和视频流水线。它由 Next.js 前端、调用 MuAPI 生成模型的 FastAPI 后端以及可复用的工作流构建 UI 库组成。你可以通过 Docker 或手动方式自托管,也可使用托管的 SaaS 版本,并可通过自定义节点调用任何 AI 模型或外部 API。

NimaNzrii/comfyui-photoshop

一款将 ComfyUI 的 AI 能力直接整合到 Photoshop 界面中的插件,实现无缝的 AI 驱动编辑工作流。

chaiNNer-org/chaiNNer

用于程序化图像处理和 AI 放大的基于节点的 GUI,允许用户通过可视化界面构建可定制的处理流水线。

PrismML-Eng/Bonsai-Image-Demo

一个跨平台演示,适用于 4 B 参数的 Bonsai 扩散模型,提供基于 Web 的工作室和 CLI,可在 macOS(MLX)或 NVIDIA GPU(gemlite + HQQ)上进行图像生成。

karimz1/imgcompress

一个自托管的图像处理服务器,提供本地 AI 驱动的背景移除、批量压缩和超过 70 种图像格式的转换。

trueai-org/midjourney-proxy

一个开源的 Midjourney API 代理,允许开发者通过可编程接口将 Midjourney 的图像生成和人脸交换功能集成到自己的应用中。

YanWenKun/ComfyUI-Windows-Portable

一个即用型 Windows 软件包,将 ComfyUI(Stable Diffusion 的节点式 UI)与 40 多个自定义节点和 300 多个预编译 Python 包捆绑,让用户在 NVIDIA GPU 上立即启动 AI 图像/视频生成。

Comfy-Org/comfy-cli

comfy‑cli 是一个 Python 命令行工具,用于安装、启动和管理 ComfyUI(一个开源生成式媒体引擎)。它处理环境设置、自定义节点安装、模型下载、工作流执行,并可将任务卸载到托管的 Comfy Cloud 服务。功能包括基于 `uv` 的快速依赖解析、LLM 代理友好的 JSON 结构化输出、Shell 补全,以及用于测试 PR 和管理后台服务器的实用工具。

FireRedTeam/FireRed-Image-Edit

一个通用的图像编辑模型,提供高保真度、一致性的编辑,并具有强大的身份保留与多元素融合能力。

NVIDIA-RTX/NRD

GPU 加速、与 API 无关的实时光线追踪去噪库(REBLUR、RELAX、SIGMA)。

GiMi-Xiaomi/gimi-illustration-skill

一个 AI Agent 技能,可将文本文章和脚本转换为具有可定制风格和一致角色 IP 的概念图。

LibrePhotos/librephotos

LibrePhotos 是一个自托管的照片管理服务器,可自动添加 AI 生成的元数据(人脸、物体、字幕),并提供语义搜索、地图视图和多用户相册功能。它以 Docker 容器形式提供,包含 Django REST 后端、React Web UI 和可选的 React-Native Android 客户端,所有计算机视觉任务均使用 ONNX-run 模型。

rupeshs/fastsdcpu

一个利用 OpenVINO 和潜在一致性模型优化的高性能 Stable Diffusion 实现,专为 CPU 设计,可实现近乎实时的图像生成。

nv-tlabs/PiD

PiD 是一款即插即用的扩散解码器,通过取代标准的 VAE/RAE 解码器,在单次传递中将潜在表示直接转换为超分辨率 2K 到 4K 像素。

Gourieff/ComfyUI-ReActor

一组 ComfyUI 节点,用于在图像和视频中快速且简单地进行换脸,具备面部修复和混合面部模型创建功能。

Nerogar/OneTrainer

一套完整的扩散模型训练套件,提供数据集准备、微调和模型转换工具,支持 GUI 或 CLI 操作。

yurijmikhalevich/rclip

rclip 是一个本地的、原生终端图像搜索工具,使用 OpenCLIP 嵌入技术,让你可以通过自然语言描述、示例图像或加权组合来查找照片,支持多种图像格式,并可选交互式界面。

markfulton/NanoBananaEditor

基于 React 和 TypeScript 的编辑器,支持 Google 的 Gemini 图像模型,实现文本生成图像、遮罩编辑和搜索接地提示。

nihui/zimage-ncnn-vulkan

一个基于 ncnn 的便携式 Z-Image 生成器实现,可在任何支持 Vulkan 的 GPU 上实现高性能图像生成、图像修复和 ControlNet 支持。