freestylefly/awesome-gpt-image-2
一个结构化的提示引擎和模板库,将散文式AI图像提示转换为可复用的、类似代码的协议,实现稳定且可控的图像生成。
yang0/handraw-style
一个包含216个编号手绘插画风格的精选库,附带即用的双语提示词,以及一个简单的网页画廊。用户只需选择一个风格ID并添加主题,即可获得适用于文本到图像AI的提示词,无需自行描述风格即可确保视觉基调的一致性。
abi/screenshot-to-code
screenshot‑to‑code 是一款开源应用,利用 Gemini、GPT‑5.5 和 Claude 等大语言模型 (LLM),将 UI 截图、设计稿或短视频录制转换为可直接运行的前端代码(HTML/CSS、React、Vue 等),并支持可选的资产提取和视觉预览。
yanliudesign/mono-color-skill
一个用于使用有限油墨色板和利索格拉夫、网点等机械复制技术生成专业编辑印刷品的设计系统和AI技能。
aldegad/sprite-gen
一个将单张图像转化为游戏可用精灵图集的流程,具备身份锁定生成、背景移除以及将静态帧动画化为呼吸循环的功能。
Kizzuwatnaa/DLSS5-Autopilot
DLSS 5 Autopilot 是一个 Windows 实用工具,可自动为从未搭载 NVIDIA DLSS 5 神经上采样的游戏添加该功能。它扫描已安装的游戏,根据游戏的图形 API 和用户的 RTX 20–50 GPU 选择合适的社区附加组件(原生钩子、OptiScaler、桥接、馈送器、RTX Remix 等),在运行时下载所需 DLL,写入配置文件,并可干净地卸载所有内容。支持多种启动器,提供帧生成选项,适用于视频/摄像头流,提供 CLI,包含反作弊系统的安全检查。
GangTailorUpgrade/undress-service
Dress AI Service 是一个开源、自托管的 FastAPI 应用,允许你上传衣物照片,使用 CLIP 自动打标签,结合规则逻辑与可选 LLM 推理生成穿搭建议,并通过 Stable Diffusion/FLUX 可视化穿搭效果。它可通过 Docker 或本地 Python 环境运行,数据存储于 SQLite/PostgreSQL,支持天气感知穿搭、分析功能和轻量级 HTML/Tailwind UI。
Nutlope/logocreator
LogoCreator 是一个开源 Web 应用,通过 Together AI 使用 FLUX-2 图像模型生成品牌就绪的 Logo。使用 Next.js、TypeScript、Radix 和 Tailwind 构建,无需账户,只需提供 Together AI 密钥即可运行。功能包括即时生成、FLUX-1 编辑、PNG/SVG 导出、可选的速率限制和认证,以及历史仪表板。仓库提供了清晰的设置步骤,并列出了未来任务,如尺寸选择、成本预览、参考 Logo 上传,以及著名 Logo 重设计展示。
s1dashu/ip-as-logo-skill
一种引导AI代理生成简单、可爱且具有商业价值的IP吉祥物角色的代理技能,确保构图和风格的一致性。
upscayl/upscayl
一款使用 Real-ESRGAN 和 Vulkan 技术,无损放大并增强低分辨率图像的免费开源 AI 图像放大器。
wuyoscar/GPT-Image2-Skill
GPT Image 2 的提示画廊和工具集,提供 CLI 和 Agent 技能,用于生成、编辑和反向工程图像提示。
shitagaki-lab/see-through
一个将单张动漫插画分解为最多 23 个语义不同的、经过修补的图层,并以 PSD 格式导出,用于 2.5D 动画和绑定(rigging)的框架。
ShuaixinHuang/image-multiple-angles-3d-camera
一个 3D 控制的图像生成工具,允许用户通过交互式 3D 小部件和 Qwen-Image-Edit-Plus 模型,更改上传图像的相机视角。
basketikun/chatgpt2api
一个与 OpenAI 兼容的 API 代理,通过对 ChatGPT 的 Web 功能进行逆向工程,提供带有内置账号池管理的图像生成和编辑服务。
LiamGvchi/gc-minimal-zine-poster
一个 Codex 技能,通过结构化提示编译系统将主题或照片转化为简约、纸质感的编辑海报。
T8RIN/ImageToolbox
一款提供 500 多种滤镜、AI 驱动背景移除和批量处理功能的高效 Android 图像编辑工具。
shanliuling/dsh-image-gen
DeepSeek Harness 的 AI 图像生成套件,提供基于聊天的生成、批量生产工作室、多模型对比以及本地 ComfyUI 集成。
facefusion/facefusion
FaceFusion 是一个高性能人脸操作平台,用于在图像和视频中交换和编辑人脸。
NVlabs/Sana
SANA 是 NVIDIA 推出的开源、高效导向的扩散代码库,适用于高分辨率图像和视频生成。它包含多个模型家族(SANA、SANA‑1.5、SANA‑Sprint、SANA‑Video/Video 2.0、SANA‑WM、SANA‑Streaming)和强化学习包装器(Sol‑RL)。关键技术包括线性注意力、32× 压缩自编码器(DC‑AE)、仅解码器文本编码器和 sCM 蒸馏,使 4K 图像生成和长达 1 分钟的 720p 视频生成的 GPU 成本远低于同类模型。该仓库提供训练/推理脚本、Hugging Face 上的预训练检查点、Diffusers 集成、ComfyUI 节点和演示。许可证为 Apache 2.0。
tracefinity/tracefinity
Tracefinity 是一个 AI 驱动的 Web 应用(Docker 就绪),可将纸上的工具照片转换为可 3D 打印的自定义 Gridfinity 盒子。它使用本地 ONNX 模型或远程 Gemini/Replicate 服务生成工具轮廓,支持编辑与排列,并导出 STL/3MF 文件用于打印。
CookSleep/gpt_image_playground
基于 React/TypeScript 的 Web UI,支持 OpenAI 兼容图像生成(gpt-image-2)。支持文本到图像、参考图像编辑、批量/流式处理、透明背景、多轮代理聊天、本地 IndexedDB 历史记录、多 API 配置文件,可部署于 Vercel、GitHub Pages、Cloudflare Workers、Docker 或本地。
danielgatis/rembg
一个可作为 CLI、Python 库或 HTTP 服务器使用的图像背景移除工具,支持多种 AI 模型和硬件加速。
LunarXuan/image-prompt-reverse
一个将参考图像逆向工程为高保真度正负提示的Codex技能,适用于AI图像生成工具。
worldbench/DiffusionOPSD
DiffusionOPSD 是一个开源实现,用于微调扩散图像生成器(Stable Diffusion 3.5‑M 和 Z‑Image‑Turbo)的“在线策略自蒸馏”算法。它反复从冻结的行为策略中收集低噪声状态,使用奖励梯度步创建显式的正负目标,训练新策略匹配这些目标,并通过 EMA 更新行为策略。该仓库提供安装依赖、下载奖励模型检查点、运行快速烟雾测试以及启动全规模分布式训练的脚本,支持七种公开评估器(PickScore、CLIPScore、HPSv2.1/v3、Aesthetic、ImageReward、DeQA)或混合奖励目标。报告结果表明,在 19/20 个设置上获得了更高的保留分数,且 GPU 使用时间比先前方法减少了 40‑63 %。采用 Apache 2.0 许可证。
ciddwd/overlay-translator
Screen Translator 是一款 Android 应用,可捕获屏幕,运行 OCR(ML Kit、PaddleOCR、漫画 OCR 或云服务),使用本地模型、LLM 或商用 MT API 翻译提取的文本,并在浮动窗口中叠加翻译结果(或朗读)。支持游戏、漫画和视觉小说的实时翻译,图像批量处理,单词级查词,循环自动翻译,以及丰富的 UI 自定义,所有功能均在 Apache‑2.0 许可下提供。
threerocks/hand-drawn-styles
一个工具无关的库,包含19个经验证的手绘风格提示配方,AI代理可用来生成一致且高质量的图像提示。
Comfy-Org/ComfyUI-Manager
ComfyUI‑Manager 是一个功能丰富的扩展,专为视觉 AI 工作流工具 ComfyUI 设计。它添加了一个 UI 按钮,让用户无需离开界面即可浏览、安装、更新、启用/禁用和移除来自官方注册表或社区渠道的自定义节点和模型文件。该管理器还提供安装状态的快照/恢复功能、一键分享至工作流托管网站、用于自动化的 CLI(`cm‑cli`),以及安全优先的数据存储。配置通过简单的 `config.ini` 和可选的 pip 覆盖文件完成。安装方式包括手动 git 克隆、便携式 Windows 脚本、`comfy-cli` 或 Linux venv 脚本。
HalfAI1102/anthropic-art
一个代理技能,以 Anthropic 视觉风格生成手绘编辑插图,将抽象概念转化为极简视觉隐喻。
llmsresearch/paperbanana
PaperBanana 是一个开源 Python 工具,通过多代理 LLM/VLM 流水线将方法章节文本(或数据文件)转换为出版就绪的图表和统计图,支持批量运行、会议特定样式和多种 AI 提供商。
photoprism/photoprism
PhotoPrism 是一款开源的自托管 Web 应用,利用设备端 AI 自动对个人照片和视频进行标签化、搜索和整理,同时保护所有数据隐私。
invoke-ai/InvokeAI
Invoke AI 是一个开源、本地运行的视觉媒体生成平台。它提供基于 Web 的 UI,具备统一画布、节点化工作流编辑器、画廊管理功能,并支持数十种现代文本到图像模型(Stable Diffusion、Flux、Qwen‑Image 等)。用户通过提供的启动器安装,运行本地服务器,并通过直观的浏览器界面创建或优化图像。该项目面向需要灵活、可扩展 AI 图像创作工具的艺术家、设计师和开发者。
carolinaaafy/travel-memory-sticker-card
一个将旅行照片转化为可收藏数字记忆贴纸卡片的 Codex 技能。
kijai/ComfyUI-KJNodes
ComfyUI‑KJNodes 是 ComfyUI 的一个插件,增加了实用节点、跨子图 Set/Get 处理功能以及多种键盘/鼠标快捷键,使构建和维护大型生成图谱更加轻松。
lbouaraba/comfyui-krea2edit
基于 Krea 2 的指令式图像编辑 ComfyUI 节点包,通过双重潜在与语义条件化实现高保真身份保留。
GiMi-Xiaomi/gimi-illustration-skill
一个 AI Agent 技能,可将文本文章和脚本转换为具有可定制风格和一致角色 IP 的概念图。
xororz/local-dream
一款利用 Snapdragon NPUs 进行硬件加速的 Android 应用,支持在本地运行 Stable Diffusion 图像生成。
popopo-99/zy-cinematic-realism
一种适用于LLM的电影级视觉工作流程,可将叙事构思转化为专业、模型特定的提示,用于AI图像生成,以实现真实的电影质感。
jtydhr88/ComfyUI-See-through
一个ComfyUI插件,可将单张动漫插画分解为具有深度顺序的分层2.5D模型,专为Live2D工作流设计。
Acly/krita-ai-diffusion
一个将生成式 AI 扩散模型集成到 Krita 绘画工作流的插件,提供修补、实时绘画和精确结构控制等工具。
goohai/Goohaitools-comfyui
一个包含 70 多个自定义节点的完整工具包,专为 ComfyUI 设计,用于专业图像制作,专注于批量处理、自动证件照生成和高级蒙版操作。
helblazer811/Diffusion-Explorer
一个用于教育目的的互动式可视化工具,解释扩散模型与流式生成模型的几何直觉。
wzj177/ecommerce-image-suite
一个由 AI 驱动的工具包,帮助电商卖家自动分析产品照片,并生成适用于 Amazon、Taobao、JD.com、TikTok 等多种风格和平台的完整专业营销图像集。
wnby/photo-relic-editorial
一个 Codex 技能,通过将真实照片与同一张影像的克制、纸纹版画版本配对,将照片转换为垂直的编辑艺术品。
Hugo-Dz/spritefusion-pixel-snapper
通过将像素对齐到完美的网格并将颜色量化,来修复由 AI 生成的杂乱且不一致的像素艺术的工具。
liyue-aigc/xianxia-visual-director
Codex/Agent技能的视觉方向系统,将简单想法转化为宏大东方仙侠环境的结构化、电影级图像提示。
palxiao/poster-design
一款开源的 AI 海报编辑器和在线设计工具,内置 AI 背景移除和图像生成功能,帮助用户轻松创建专业海报和社交媒体图形。
nuyoah-ai-works/nuyoah-xiezhen-prompt
一种AI人像摄影提示工程技能,通过重构专业摄影计划,实现多张照片间一致的风格和角色复现。
willmiao/ComfyUI-Lora-Manager
一个全面的 ComfyUI 管理工具,可简化 LoRA 模型和检查点的组织、从 CivitAI 下载及应用流程。