freestylefly/awesome-gpt-image-2

GPT-Image2 用的提示即代码系统与模板库,将自然语言提示转化为稳定可控的 AI 图像生成结构化协议。

yang0/handraw-style

一个包含216个编号手绘插画风格的精选库,附带即用的双语提示词,以及一个简单的网页画廊。用户只需选择一个风格ID并添加主题,即可获得适用于文本到图像AI的提示词,无需自行描述风格即可确保视觉基调的一致性。

abi/screenshot-to-code

screenshot‑to‑code 是一款开源应用,利用 Gemini、GPT‑5.5 和 Claude 等大语言模型 (LLM),将 UI 截图、设计稿或短视频录制转换为可直接运行的前端代码(HTML/CSS、React、Vue 等),并支持可选的资产提取和视觉预览。

aldegad/sprite-gen

一个 Python CLI 和智能体技能,使用 AI 生成流水线将单个基础图像转换为游戏就绪的透明精灵图集或动画循环。

perseval-BLR/NeuralScreen

NeuralScreen 是一款 Windows 实用工具,可实时将 NVIDIA 的 DLSS 5 神经上采样(及可选帧生成)应用于整个桌面或单个窗口,提供更清晰的视觉效果、截图/录制工具以及可配置的叠加 UI。

s1dashu/ip-as-logo-skill

一种引导AI代理生成简单、可爱且具有商业价值的IP吉祥物角色的代理技能,确保构图和风格的一致性。

upscayl/upscayl

一款使用 Real-ESRGAN 和 Vulkan 技术,无损放大并增强低分辨率图像的免费开源 AI 图像放大器。

wuyoscar/GPT-Image2-Skill

提示图库、两个可复用的代理技能(图像生成与提示提取),以及 OpenAI 的 GPT-Image 2/2.5 模型的命令行工具。

yanliudesign/mono-color-skill

一个专注于机械复制美学的设计系统和AI技能,用于创建专业级的一或两色编辑印刷品、海报和包装。

danielgatis/rembg

一个可作为 CLI、Python 库或 HTTP 服务器使用的图像背景移除工具,支持多种 AI 模型和硬件加速。

Nutlope/logocreator

LogoCreator 是一个开源 Web 应用,通过 Together AI 使用 FLUX-2 图像模型生成品牌就绪的 Logo。使用 Next.js、TypeScript、Radix 和 Tailwind 构建,无需账户,只需提供 Together AI 密钥即可运行。功能包括即时生成、FLUX-1 编辑、PNG/SVG 导出、可选的速率限制和认证,以及历史仪表板。仓库提供了清晰的设置步骤,并列出了未来任务,如尺寸选择、成本预览、参考 Logo 上传,以及著名 Logo 重设计展示。

basketikun/chatgpt2api

一个与 OpenAI 兼容的 API 代理,通过对 ChatGPT 的 Web 功能进行逆向工程,提供带有内置账号池管理的图像生成和编辑服务。

shitagaki-lab/see-through

一个将单张动漫插画分解为最多 23 个语义不同的、经过修补的图层,并以 PSD 格式导出,用于 2.5D 动画和绑定(rigging)的框架。

yjz211/vivid-figures-skill

Vivid Figures 是一个 Agent-Skill,为 AI 助手提供 143 个现成的图表模板和 7 种配色方案。通过向助手提供数据文件(CSV、Excel、JSON)和自然语言请求,该技能可自动选择合适图表,生成 PNG/PDF 输出,并提供可后期调整的完整 Python 源代码。它遵循开放的 Agent Skills 规范,支持 Python 3.10+,个人非商业用途免费。

Kizzuwatnaa/DLSS5-Autopilot

DLSS 5 Autopilot 是一个 Windows 实用工具,可自动为从未搭载 NVIDIA DLSS 5 神经上采样的游戏添加该功能。它扫描已安装的游戏,根据游戏的图形 API 和用户的 RTX 20–50 GPU 选择合适的社区附加组件(原生钩子、OptiScaler、桥接、馈送器、RTX Remix 等),在运行时下载所需 DLL,写入配置文件,并可干净地卸载所有内容。支持多种启动器,提供帧生成选项,适用于视频/摄像头流,提供 CLI,包含反作弊系统的安全检查。

Comfy-Org/ComfyUI-Manager

ComfyUI‑Manager 是一个为可视化 AI 流水线 UI ComfyUI 设计的扩展。它添加了一个“管理器”面板,让用户能够从精选注册表或本地缓存中浏览、安装、更新、启用/禁用和移除自定义节点包及模型文件。功能包括一键安装、基于快照的环境恢复、工作流共享至外部网站、组件复制粘贴、无头模式使用的 CLI 工具,以及广泛的配置选项(安全级别、网络模式、pip/uv 处理)。它简化了 ComfyUI 中驱动 Stable-Diffusion 图像生成的庞大社区节点生态系统的管理。

T8RIN/ImageToolbox

一款提供 500 多种滤镜、AI 驱动背景移除和批量处理功能的高效 Android 图像编辑工具。

ostris/ai-toolkit

Ostris AI Toolkit 是一套开源工具组,用于在消费级 GPU 上微调现代扩散模型(图像、视频、音频、编辑)。它提供网页 UI、实验性管理器(可自动安装正确的 PyTorch/Node.js/FFmpeg 堆栈),以及现成的 YAML 配置文件,用于 LoRA/LoKr 训练。安装可通过 Linux/macOS/Windows 的简单脚本或手动虚拟环境步骤完成。此工具组支持数十种近期检查点(FLUX-1/2、SDXL、Qwen-Image 等),并包含在 RunPod 和 Modal 上进行云端运行的指南。

SegFault42/HeliosGen

HeliosGen 是一个开源桌面应用(macOS 已发布,Windows/Linux 待定),提供一个可视化的节点式画布,用于构建和运行 AI 图像与视频生成流水线。它在本地运行,将请求发送到 kie.ai API(或可选的 Codex CLI),并将所有数据存储在用户设备上。功能包括多模型支持、参考图像、并行/顺序执行以及实时历史记录。该应用使用 Tauri 2(Rust)和 Next.js/React 前端构建,使用 SQLite 实现本地持久化,采用 MIT 许可证。

facefusion/facefusion

FaceFusion 是一个高性能人脸操作平台,用于在图像和视频中交换和编辑人脸。

worldbench/DiffusionOPSD

DiffusionOPSD 是一个开源实现,用于微调扩散图像生成器(Stable Diffusion 3.5‑M 和 Z‑Image‑Turbo)的“在线策略自蒸馏”算法。它反复从冻结的行为策略中收集低噪声状态,使用奖励梯度步创建显式的正负目标,训练新策略匹配这些目标,并通过 EMA 更新行为策略。该仓库提供安装依赖、下载奖励模型检查点、运行快速烟雾测试以及启动全规模分布式训练的脚本,支持七种公开评估器(PickScore、CLIPScore、HPSv2.1/v3、Aesthetic、ImageReward、DeQA)或混合奖励目标。报告结果表明,在 19/20 个设置上获得了更高的保留分数,且 GPU 使用时间比先前方法减少了 40‑63 %。采用 Apache 2.0 许可证。

threerocks/hand-drawn-styles

一个工具无关的库,包含19个经验证的手绘风格提示配方,AI代理可用来生成一致且高质量的图像提示。

higgsfield-ai/cli

跨平台命令行界面,用于 Higgsfield 的全套生成式 AI 模型(图像、视频、3D、音频),以及构建 React 网站、发布浏览器游戏和管理个人“Soul”化身的工具——全部通过终端完成。

LiamGvchi/gc-minimal-zine-poster

一个 Codex 技能,通过结构化提示编译系统将主题或照片转化为简约、纸质感的编辑海报。

NVlabs/Sana

SANA 是 NVIDIA 推出的开源、高效导向的扩散代码库,适用于高分辨率图像和视频生成。它包含多个模型家族(SANA、SANA‑1.5、SANA‑Sprint、SANA‑Video/Video 2.0、SANA‑WM、SANA‑Streaming)和强化学习包装器(Sol‑RL)。关键技术包括线性注意力、32× 压缩自编码器(DC‑AE)、仅解码器文本编码器和 sCM 蒸馏,使 4K 图像生成和长达 1 分钟的 720p 视频生成的 GPU 成本远低于同类模型。该仓库提供训练/推理脚本、Hugging Face 上的预训练检查点、Diffusers 集成、ComfyUI 节点和演示。许可证为 Apache 2.0。

alisaitteke/photoshop-mcp

一个 MCP 服务器,使 AI 助手能够通过自然语言命令控制 Adobe Photoshop,执行背景移除和人像修饰等任务。

LunarXuan/image-prompt-reverse

一个将参考图像逆向工程为高保真度正负提示的Codex技能,适用于AI图像生成工具。

invoke-ai/InvokeAI

Invoke AI 是一个开源、本地运行的视觉媒体生成平台。它提供基于 Web 的 UI,具备统一画布、节点化工作流编辑器、画廊管理功能,并支持数十种现代文本到图像模型(Stable Diffusion、Flux、Qwen‑Image 等)。用户通过提供的启动器安装,运行本地服务器,并通过直观的浏览器界面创建或优化图像。该项目面向需要灵活、可扩展 AI 图像创作工具的艺术家、设计师和开发者。

ciddwd/overlay-translator

Screen Translator 是一款 Android 应用,可捕获屏幕,运行 OCR,通过本地模型、LLM API 或传统机器翻译服务进行文本翻译,并将结果叠加回屏幕。支持实时翻译、批量图像处理、单词级词典查询、TTS 及广泛自定义功能,提供离线与云端两种选项。

Acly/krita-ai-diffusion

一个将生成式 AI 扩散模型集成到 Krita 绘画工作流的插件,提供修补、实时绘画和精确结构控制等工具。

CookSleep/gpt_image_playground

一个专业级网页 UI,支持使用 OpenAI 的 gpt-image-2.5 API 进行文本到图像生成、基于掩码的编辑以及对话式 AI 代理图像创建

toyxyz/ComfyUI_toyxyz_test_nodes

一组用于网络摄像头/屏幕捕获、区域掩码创建、OpenPose 编辑、视频剪辑/拼接以及 MiniMax-H3 提示构建的自定义 ComfyUI 节点,支持更丰富的图像与视频生成工作流。

shanliuling/dsh-image-gen

DeepSeek Harness 的 AI 图像生成套件,提供基于聊天的生成、批量生产工作室、多模型对比以及本地 ComfyUI 集成。

xororz/local-dream

一款利用 Snapdragon NPU 加速实现高性能本地 Stable Diffusion 图像生成的 Android 应用。

kijai/ComfyUI-KJNodes

ComfyUI‑KJNodes 是 ComfyUI 的一个插件,增加了实用节点、跨子图 Set/Get 处理功能以及多种键盘/鼠标快捷键,使构建和维护大型生成图谱更加轻松。

Hugo-Dz/spritefusion-pixel-snapper

通过将像素对齐到完美的网格并将颜色量化,来修复由 AI 生成的杂乱且不一致的像素艺术的工具。

mcmonkeyprojects/SwarmUI

SwarmUI 是一个开源的基于 Web 的 UI,用于运行 AI 图像、视频和音频生成模型(Stable Diffusion、Flux 等)。它提供初学者友好的 Generate 标签页、高级 Comfy 风格工作流编辑器、多 GPU“集群”支持以及可扩展的插件。提供 Windows、Linux、macOS(Apple 芯片)和 Docker 的安装程序,以及用于 Runpod 和 Vast.ai 的云 GPU 模板。该项目处于“Almost-Release”测试版(v0.9.8),采用 MIT 许可证,但可能会自动安装 GPL/AGPL 组件。

Comfy-Org/ComfyUI_frontend

ComfyUI_frontend 是 ComfyUI AI 工作流引擎的官方浏览器/Electron 界面。它提供节点图编辑器、掩码编辑器、队列/历史记录视图、多语言界面,以及用于自定义面板、命令、快捷键和弹出消息的 JavaScript 扩展 API。发布周期为每两周开发期 → 每两周冻结期,通过启动参数可获取每日构建版本。

jau123/MeiGen-AI-Design-MCP

MeiGen AI 设计 MCP 是一个 MCP 兼容服务器(npm 包或远程 HTTP 端点),允许 AI 助手生成图像、视频和电商导向的资产(背景移除、产品详情批量生成、营销海报、AI 背景、放大)。支持 MeiGen 云、OpenAI 兼容 API 和本地 ComfyUI,提供 1,446 个精心策划的提示模板,并为非 MCP 使用提供 CLI 和 HTTP API。

liyue-aigc/xianxia-visual-director

Codex/Agent技能的视觉方向系统,将简单想法转化为宏大东方仙侠环境的结构化、电影级图像提示。

Akegarasu/lora-scripts

用于训练 Stable Diffusion LoRA 和 Dreambooth 模型的 GUI 和脚本预设集合,提供数据集标记和训练的集成环境。

popopo-99/zy-cinematic-realism

一种适用于LLM的电影级视觉工作流程,可将叙事构思转化为专业、模型特定的提示,用于AI图像生成,以实现真实的电影质感。

lbouaraba/comfyui-krea2edit

基于 Krea 2 的指令式图像编辑 ComfyUI 节点包,通过双重潜在与语义条件化实现高保真身份保留。

llmsresearch/paperbanana

PaperBanana 是一个开源 Python 工具,通过多代理 LLM/VLM 流水线将方法章节文本(或数据文件)转换为出版就绪的图表和统计图,支持批量运行、会议特定样式和多种 AI 提供商。

goohai/Goohaitools-comfyui

一个包含 70 多个自定义节点的完整工具包,专为 ComfyUI 设计,用于专业图像制作,专注于批量处理、自动证件照生成和高级蒙版操作。

carolinaaafy/travel-memory-sticker-card

一个将旅行照片转化为可收藏数字记忆贴纸卡片的 Codex 技能。

jtydhr88/ComfyUI-See-through

一个ComfyUI插件,可将单张动漫插画分解为具有深度顺序的分层2.5D模型,专为Live2D工作流设计。

TheJoeFin/Text-Grab

Text Grab 是一款仅限 Windows 的桌面应用,使用本地 OCR(WinAI、WinRT OCR 或 Tesseract)捕获任何可见文本(截图、PDF、UI 元素等),并提供内置清理、电子表格编辑、基于正则表达式的提取、可复用的捕获模板、批量文件夹处理和 Chrome/Edge 扩展功能。所有处理均在本地完成,Copilot+ PC 上可选 NPU 加速推理。可通过 Microsoft Store、GitHub 发布版或包管理器安装;源码可用 Visual Studio 或 .NET SDK 构建。