freestylefly/awesome-gpt-image-2

GPT-Image2용 프롬프트 앤 코드 시스템과 템플릿 라이브러리로, 문장형 프롬프트를 안정적이고 제어 가능한 AI 이미지 생성을 위한 구조화된 프로토콜로 변환합니다.

yang0/handraw-style

216개의 번호 매겨진 손그림 일러스트 스타일과 즉시 사용 가능한 이중 언어 프롬프트, 그리고 간단한 웹 갤러리로 구성된 컬렉션. 사용자는 스타일 ID를 선택하고 주제를 추가하기만 하면, 텍스트-이미지 AI에서 작동하는 프롬프트를 얻을 수 있으며, 스타일을 직접 설명하지 않아도 일관된 시각적 톤을 유지할 수 있습니다.

abi/screenshot-to-code

screenshot‑to‑code는 Gemini, GPT‑5.5, Claude와 같은 LLM을 사용하여 UI 스크린샷, 목업 또는 짧은 화면 녹화 영상을 즉시 실행 가능한 프론트엔드 코드(HTML/CSS, React, Vue 등)로 변환하는 오픈 소스 앱으로, 옵션으로 에셋 추출 및 시각적 미리보기를 제공합니다.

aldegad/sprite-gen

AI 생성 파이프라인을 사용하여 단일 기본 이미지를 게임용 투명 스프라이트 아틀라스 또는 애니메이션 루프로 변환하는 Python CLI 및 에이전트 스킬.

perseval-BLR/NeuralScreen

NeuralScreen은 NVIDIA의 DLSS 5 신경 업스케일링(및 선택적 프레임 생성)을 실시간으로 전체 데스크톱 또는 개별 창에 적용하는 Windows 유틸리티로, 더 선명한 시각 효과, 스크린샷/녹화 도구, 구성 가능한 오버레이 UI를 제공합니다.

s1dashu/ip-as-logo-skill

일관된 구성과 스타일을 갖춘 단순하고 귀엽고 상업적으로 활용 가능한 IP 마스코트 캐릭터를 생성하도록 AI 에이전트를 안내하는 에이전트 스킬.

upscayl/upscayl

Real-ESRGAN과 Vulkan을 사용하여 품질을 손상시키지 않고 저해상도 이미지를 확대하고 개선하는 무료 오픈소스 AI 이미지 확대기입니다.

wuyoscar/GPT-Image2-Skill

프롬프트 갤러리, 두 가지 재사용 가능한 에이전트 스킬(이미지 생성 및 프롬프트 추출), OpenAI의 GPT-Image 2/2.5 모델용 명령줄 도구.

yanliudesign/mono-color-skill

기계적 복제 미학에 중점을 두고, 1색 또는 2색 인크로 전문적인 일러스트레이션, 포스터, 패키징을 만드는 디자인 시스템과 AI 기술.

danielgatis/rembg

CLI, Python 라이브러리, HTTP 서버로 사용 가능한 이미지 배경 제거 도구로, 다양한 AI 모델과 하드웨어 가속을 지원합니다.

Nutlope/logocreator

LogoCreator는 Together AI를 통해 FLUX-2 이미지 모델을 사용하여 브랜드용 로고를 생성하는 오픈소스 웹 앱입니다. Next.js, TypeScript, Radix, Tailwind으로 구축되었으며, 계정 없이 Together AI 키만으로 작동합니다. 즉시 생성, FLUX-1 편집, PNG/SVG 내보내기, 선택적 레이트 제한 및 인증, 그리고 기록 대시보드 기능을 제공합니다. 리포지토리는 명확한 설정 단계를 제공하며, 크기 선택, 비용 미리보기, 참조 로고 업로드, 유명 로고 재디자인 쇼케이스와 같은 향후 작업 목록도 포함하고 있습니다.

basketikun/chatgpt2api

ChatGPT의 웹 기능을 리버스 엔지니어링하여 계정 풀 관리 기능과 함께 이미지 생성 및 편집 서비스를 제공하는 OpenAI 호환 API 프록시입니다.

shitagaki-lab/see-through

단일 애니메이션 일러스트를 최대 23개의 의미적으로 구분된 인페인팅 레이어로 분해하여 2.5D 애니메이션 및 리깅을 위한 PSD로 내보내는 프레임워크.

yjz211/vivid-figures-skill

Vivid Figures는 143개의 완성된 차트 템플릿과 7개의 색상 팔레트를 갖춘 Agent-Skill입니다. AI 어시스턴트에 CSV, Excel, JSON 형식의 데이터 파일과 자연어 요청을 제공하면, 적절한 플롯을 자동으로 선택하고 PNG/PDF 출력물을 생성하며, 나중에 수정할 수 있는 완전한 Python 소스 코드를 제공합니다. 오픈된 Agent Skills 사양을 따르며, Python 3.10 이상에서 작동하며, 개인적 비영리 사용에는 무료입니다.

Kizzuwatnaa/DLSS5-Autopilot

DLSS 5 Autopilot는 NVIDIA의 DLSS 5 뉴럴 업스케일링을 원래 포함하지 않은 게임에 자동으로 추가하는 Windows 유틸리티입니다. 설치된 게임을 스캔하고, 게임의 그래픽스 API와 사용자의 RTX 20–50 GPU에 따라 적절한 커뮤니티 애드온(네이티브 훅, OptiScaler, 브리지, 피더, RTX Remix 등)을 선택합니다. 런타임에 필요한 DLL을 다운로드하고 설정 파일을 작성하며, 깨끗하게 제거할 수 있습니다. 여러 런처를 지원하고 프레임 생성 옵션을 제공하며, 비디오/웹캠 스트림에도 작동하며 CLI를 제공하고, 앤티치트 시스템에 대한 안전 검사를 포함합니다.

Comfy-Org/ComfyUI-Manager

ComfyUI‑Manager는 시각적 AI 파이프라인 UI인 ComfyUI용 확장 기능입니다. 사용자가 정교한 레지스트리 또는 로컬 캐시에서 사용자 정의 노드 패키지와 모델 파일을 탐색하고, 설치, 업데이트, 활성화/비활성화, 제거할 수 있는 "매니저" 패널을 추가합니다. 원클릭 설치, 스크린샷 기반 환경 복원, 외부 사이트로의 워크플로우 공유, 컴포넌트 복사/붙여넣기, 헤드리스 사용을 위한 CLI 도구, 그리고 보안 수준, 네트워크 모드, pip/uv 처리 등 광범위한 설정을 제공하여 ComfyUI에서 Stable-Diffusion 이미지 생성을 가능하게 하는 방대한 커뮤니티 제작 노드 생태계를 간편하게 관리할 수 있도록 합니다.

T8RIN/ImageToolbox

500개 이상의 필터, AI 기반 배경 제거, 배치 처리를 지원하는 효율적인 사진 조작이 가능한 Android용 이미지 편집 도구입니다.

ostris/ai-toolkit

Ostris AI Toolkit은 소비자용 GPU에서 최신 확산 모델(이미지, 비디오, 오디오, 편집)을 미세 조정하기 위한 오픈 소스 제품군입니다. 웹 UI, 올바른 PyTorch/Node.js/FFmpeg 스택을 자동으로 설치하는 실험적 관리자, LoRA/LoKr 훈련을 위한 기성 YAML 구성을 제공합니다. 설치는 Linux/macOS/Windows용 간단한 스크립트 또는 수동 가상 환경 단계를 통해 작동합니다. 이 툴킷은 수십 개의 최근 체크포인트(FLUX-1/2, SDXL, Qwen-Image 등)를 지원하며 RunPod 및 Modal에서 클라우드 실행을 위한 가이드를 포함합니다.

SegFault42/HeliosGen

HeliosGen은 오픈소스 데스크톱 앱(맥OS 출시, 윈도우/리눅스는 준비 중)으로, AI 이미지 및 비디오 생성 파이프라인을 시각적으로 노드 기반 캔버스로 구축하고 실행할 수 있게 해줍니다. 모든 처리는 로컬에서 이루어지며, kie.ai API(또는 선택적으로 Codex CLI)로 요청을 전달하고 모든 데이터는 사용자의 기기에 저장됩니다. 다중 모델 지원, 참조 이미지, 병렬/순차 실행, 실시간 기록 등의 기능을 제공합니다. 앱은 Tauri 2(Rust)와 Next.js/React 프론트엔드로 구축되었으며, SQLite로 로컬 지속성을 구현하고, MIT 라이선스로 제공됩니다.

facefusion/facefusion

FaceFusion은 이미지 및 동영상에서 얼굴을 교체하고 편집할 수 있는 고성능 얼굴 조작 플랫폼입니다.

worldbench/DiffusionOPSD

DiffusionOPSD는 Stable Diffusion 3.5‑M 및 Z‑Image‑Turbo와 같은 확산 이미지 생성기를 위한 "온-정책 자기-분산" 알고리즘의 오픈소스 구현입니다. 이는 고정된 행동 정책에서 낮은 노이즈 상태를 반복적으로 수집하고, 보상 기울기 단계를 사용해 명시적인 긍정/부정 타겟을 생성하며, 그 타겟을 따라가도록 새로운 정책을 훈련하고, 지수이동평균(EMA)을 통해 행동 정책을 갱신합니다. 이 저장소는 종속성 설치, 보상 모델 체크포인트 다운로드, 빠른 스모크 테스트 실행, 그리고 7개의 공개 평가자(PickScore, CLIPScore, HPSv2.1/v3, Aesthetic, ImageReward, DeQA) 또는 혼합 보상 목표를 위한 전체 규모 분산 훈련을 시작할 수 있는 스크립트를 제공합니다. 보고된 결과에 따르면, 19/20의 설정에서 더 높은 검증 점수를 달성했으며, 기존 방법보다 GPU 시간을 40–63 % 절감했습니다. Apache 2.0 라이선스 하에 배포됩니다.

threerocks/hand-drawn-styles

AI 에이전트가 일관성 있고 고품질의 이미지 프롬프트를 생성할 수 있도록 도와주는, 19개의 검증된 손그림 스타일 프롬프트 레시피로 구성된 도구 비의존 라이브러리입니다.

higgsfield-ai/cli

Higgsfield의 생성형 AI 모델(이미지, 동영상, 3D, 오디오) 전체를 크로스플랫폼 명령줄로 사용 가능. React 웹앱 구축, 브라우저 게임 배포, 개인용 'Soul' 아바타 관리까지 터미널에서 완전히 처리.

LiamGvchi/gc-minimal-zine-poster

주제나 사진을 구조화된 프롬프트 컴파일 시스템을 사용해 미니멀하고 종이 질감이 느껴지는 편집 포스터로 변환하는 Codex 스킬입니다.

NVlabs/Sana

SANA는 NVIDIA에서 제공하는 오픈소스이며, 효율성에 중점을 둔 확산 코드베이스로 고해상도 이미지 및 비디오 생성에 적합합니다. SANA, SANA-1.5, SANA-Sprint, SANA-Video/Video 2.0, SANA-WM, SANA-Streaming 등의 여러 모델 패밀리와 강화학습 래퍼(Sol-RL)를 포함합니다. 주요 기술로는 선형 어텐션, 32배 압축 오토인코더(DC-AE), 디코더 전용 텍스트 인코더, sCM 증류를 사용하여 4K 이미지 생성 및 1분 길이의 720p 비디오 생성을, 유사 모델보다 훨씬 낮은 GPU 비용으로 가능하게 합니다. 리포지토리에는 트레이닝/추론 스크립트, Hugging Face의 사전 학습 체크포인트, Diffusers 통합, ComfyUI 노드, 데모가 포함되어 있으며, 라이선스는 Apache 2.0입니다.

alisaitteke/photoshop-mcp

배경 제거 및 포트레이트 리타치와 같은 작업을 자연어 명령으로 수행할 수 있도록 AI 어시스턴트가 Adobe Photoshop을 제어할 수 있는 MCP 서버.

LunarXuan/image-prompt-reverse

AI 이미지 생성 도구용으로 참조 이미지를 고정밀도의 긍정 및 부정 프롬프트로 역설계하는 Codex 스킬.

invoke-ai/InvokeAI

Invoke AI는 로컬에서 실행 가능한 오픈소스 시각 미디어 생성 플랫폼입니다. 통합 캔버스, 노드 기반 워크플로우 편집기, 갤러리 관리 기능을 제공하며, Stable Diffusion, Flux, Qwen‑Image 등 수십 가지 최신 텍스트 기반 이미지 생성 모델을 지원합니다. 사용자는 제공된 런처를 통해 설치하고 로컬 서버를 실행한 후 직관적인 브라우저 인터페이스를 통해 이미지를 생성하거나 수정할 수 있습니다. 예술가, 디자이너, 개발자들이 유연하고 확장 가능한 AI 이미지 생성 도구를 필요로 하는 경우에 적합합니다.

ciddwd/overlay-translator

Screen Translator는 화면을 캡처하고 OCR을 실행한 후, 온디바이스 모델, LLM API 또는 전통적 MT 서비스를 통해 텍스트를 번역하고 결과를 화면에 오버레이하는 안드로이드 앱입니다. 실시간 번역, 배치 이미지 처리, 단어 수준 사전 검색, TTS 및 광범위한 사용자 맞춤 설정 기능을 제공하며, 오프라인 및 클라우드 옵션을 모두 지원합니다.

Acly/krita-ai-diffusion

생성 AI 디퓨전 모델을 Krita 페인팅 워크플로에 통합하는 플러그인으로, 인페인팅, 실시간 페인팅 및 정밀 구조 제어 도구를 제공합니다.

CookSleep/gpt_image_playground

OpenAI의 gpt-image-2.5 API를 활용해 텍스트에서 이미지 생성, 마스크 기반 편집, 대화형 AI 에이전트를 통한 이미지 생성을 가능하게 하는 전문적인 웹 UI

toyxyz/ComfyUI_toyxyz_test_nodes

웹캠/스크린 캡처, 영역 마스크 생성, OpenPose 편집, 비디오 자르기/연결, MiniMax-H3 프롬프트 빌더를 포함하는 사용자 정의 ComfyUI 노드 세트로, 더 풍부한 이미지 및 비디오 생성 워크플로우를 가능하게 합니다.

shanliuling/dsh-image-gen

DeepSeek Harness용 AI 이미지 생성 스위트로, 채팅 기반 생성, 배치 생산 스튜디오, 다중 모델 비교 및 로컬 ComfyUI 통합을 제공합니다.

xororz/local-dream

Snapdragon NPU 가속을 통해 성능이 향상된 로컬에서 Stable Diffusion 이미지 생성을 가능하게 하는 Android 앱.

kijai/ComfyUI-KJNodes

ComfyUI‑KJNodes는 시각적 Stable Diffusion UI(ComfyUI)용 플러그인으로, 유틸리티 노드, 서브그래프 간 Set/Get 처리, 그리고 많은 키보드/마우스 단축키를 추가하여 대규모 생성 그래프를 더 쉽게 만들고 유지보수할 수 있도록 합니다.

Hugo-Dz/spritefusion-pixel-snapper

AI가 생성한 지저분하고 일관성 없는 픽셀 아트의 문제를 해결하기 위해 픽셀을 완벽한 그리드에 맞추고 색상을 양자화하는 도구입니다.

mcmonkeyprojects/SwarmUI

SwarmUI는 AI 이미지, 비디오, 오디오 생성 모델(Stable Diffusion, Flux 등)을 실행하기 위한 오픈소스 웹 기반 UI입니다. 초보자 친화적인 Generate 탭, 고급 Comfy 스타일 워크플로 편집기, 멀티 GPU “스웜” 지원, 확장 가능한 플러그인을 제공합니다. Windows, Linux, macOS(Apple 실리콘), Docker용 설치기가 있으며, Runpod 및 Vast.ai용 클라우드 GPU 템플릿이 있습니다. 프로젝트는 “Almost-Release” 베타 버전(v0.9.8)이며 MIT 라이선스이지만, GPL/AGPL 구성 요소를 자동 설치할 수 있습니다.

Comfy-Org/ComfyUI_frontend

ComfyUI_frontend는 ComfyUI AI 워크플로우 엔진을 위한 공식 브라우저/Electron UI입니다. 노드-그래프 에디터, 마스크 에디터, 대기열/히스토리 뷰, 다국어 UI, 그리고 커스텀 패널, 명령, 키바인딩, 토스트 메시지를 위한 JavaScript 확장 API를 제공합니다. 릴리스는 2주 개발 → 2주 프리즈 사이클을 따르며, 실행 플래그를 실행하여 매일 제공되는 나이트리 빌드(nightly builds)를 사용할 수 있습니다.

jau123/MeiGen-AI-Design-MCP

MeiGen AI Design MCP는 MCP 호환 서버(npm 패키지 또는 원격 HTTP 엔드포인트)로, AI 어시스턴트가 이미지, 비디오, 전자상거래 중심 자산(배경 제거, 제품 세부 정보 배치, 마케팅 포스터, AI 배경, 업스케일링)을 생성할 수 있도록 합니다. MeiGen 클라우드, OpenAI 호환 API, 로컬 ComfyUI를 지원하며, 1,446개의 큐레이션된 프롬프트를 제공하고, 비-MCP 환경에서도 CLI와 HTTP API를 통해 사용할 수 있습니다.

liyue-aigc/xianxia-visual-director

Codex/Agent 스킬용 시각적 디렉션 시스템으로, 단순한 아이디어를 거대한 동방 신현 환경의 구조적이고 영화적인 이미지 프롬프트로 변환합니다.

Akegarasu/lora-scripts

Stable Diffusion LoRA 및 Dreambooth 모델 훈련을 위한 GUI 및 스크립트 프리셋 컬렉션으로, 데이터셋 태깅과 훈련을 통합된 환경에서 제공합니다.

popopo-99/zy-cinematic-realism

LLM을 위한 시네마틱 비주얼 워크플로우로, 서사적 아이디어를 AI 이미지 생성기를 위한 전문적이고 모델별로 최적화된 프롬프트로 변환하여 실제적인 시네마틱 리얼리즘을 구현합니다.

lbouaraba/comfyui-krea2edit

Krea 2를 사용한 지시 기반 이미지 편집을 위한 ComfyUI 노드 팩. 이중 잠재 및 의미 기반 조건부를 통해 고정밀 정체성 보존을 가능하게 합니다.

llmsresearch/paperbanana

PaperBanana는 다중 에이전트 LLM/VLM 파이프라인을 사용하여 메서드 섹션 텍스트(또는 데이터 파일)를 출판용 다이어그램과 통계 플롯으로 변환하는 오픈소스 Python 도구로, 배치 실행, 학회별 스타일링, 다양한 AI 제공자 지원 기능을 갖추고 있습니다.

goohai/Goohaitools-comfyui

전문적인 이미지 제작을 위한 70개 이상의 커스텀 노드 툴킷으로, 배치 처리, 자동 ID 사진 생성, 고급 마스크 조작에 특화되어 있습니다.

carolinaaafy/travel-memory-sticker-card

여행 사진을 수집 가능한 디지털 메모리 스티커 카드로 변환하는 Codex 스킬입니다.

jtydhr88/ComfyUI-See-through

ComfyUI 플러그인으로 단일 애니메이션 일러스트를 깊이 순서가 있는 레이어화된 2.5D 모델로 분해하며, Live2D 워크플로우에 특화되어 설계됨.

TheJoeFin/Text-Grab

Text Grab은 Windows 전용 데스크톱 앱으로, 스크린샷, PDF, UI 요소 등 화면에 표시되는 모든 텍스트를 로컬 OCR(Windows AI, WinRT OCR, Tesseract)로 캡처하고, 내장된 정리 기능, 스프레드시트 편집, 정규표현식 기반 추출, 재사용 가능한 캡처 템플릿, 대량 폴더 처리, Chrome/Edge 확장 기능을 제공합니다. 모든 처리는 장치 내에서 수행되며, Copilot+ PC에서는 NPU 가속 추론을 선택적으로 사용할 수 있습니다. Microsoft Store, GitHub 릴리스, 패키지 매니저를 통해 설치 가능하며, Visual Studio 또는 .NET SDK로 소스에서 빌드할 수 있습니다.