photoprism/photoprism
PhotoPrism은 데이터를 프라이버시 상태로 유지하면서 AI를 사용하여 사진과 동영상을 자동으로 태그 지정, 검색 및 정리할 수 있는 오픈 소스 셀프 호스팅 웹 앱입니다.
pangxiaobin/image-matting
RMBG-1.4 모델을 사용하여 로컬에서 AI 기반 배경 제거, 배치 처리, 이미지 편집 도구를 제공하는 데스크톱 애플리케이션입니다.
AgriciDaniel/banana-claude
Banana Claude는 Claude Code 플러그인으로, 자연어 요청을 입력하고 상세한 계획(프롬프트, 모델, 비용 추정)을 확인한 후 명시적인 승인을 거쳐 Google의 Gemini 이미지 모델을 호출하여 시각 자산을 생성하거나 편집할 수 있게 해줍니다. 오프라인 우선 계획, 개인정보 보호된 API 키 처리, 일회성 승인을 통해 비용을 투명하게 유지합니다.
yolain/ComfyUI-Easy-Use
ComfyUI-Easy-Use는 ComfyUI 비주얼 에디터에서 Stable Diffusion(및 기타 확산 모델) 워크플로우 구축을 간소화하는 포괄적인 커스텀 노드 세트입니다. 원클릭 로더, 프롬프트 헬퍼, LoRA/ControlNet 스택, 루프/조건 로직, 이미지 유틸리티 및 UI 조정 기능을 추가하여 사용자가 훨씬 적은 노드로 복잡한 생성 파이프라인을 만들고 실행할 수 있게 합니다.
krea-ai/krea-2
Krea 2는 유연한 미세 조정을 위한 기반 RAW 모델과 빠르고 고품질의 텍스트-이미지 합성에 최적화된 증류된 Turbo 모델을 갖춘 오픈소스 이미지 생성 모델입니다.
palxiao/poster-design
DOM 캔버스, AI 배경 제거 기능, 완전한 관리 백엔드를 갖춘 오픈 소스 AI 포스터 디자인 도구이자 온라인 이미지 편집기입니다.
nuyoah-ai-works/nuyoah-xiezhen-prompt
AI 포트레이트 사진을 위한 프롬프트 엔지니어링 기술로, 전문적인 사진 계획을 재구성하여 여러 장의 사진에 걸쳐 일관된 스타일과 캐릭터 재현을 가능하게 합니다.
nregret/Comfyui-Anima-Tools
애니메이션 AI 아트를 위한 ComfyUI용 시각적 프롬프트 및 LoRA 선택 도구로, 4만 개 이상의 아티스트, 캐릭터, 의상 태그 데이터베이스를 제공합니다.
AHEKOT/ComfyUI_VNCCS
일관된 캐릭터 스프라이트를 생성하기 위한 ComfyUI 파이프라인으로, 사용자는 여러 이미지에 걸쳐 외모, 자세, 옷, 감정을 관리할 수 있습니다.
lucidrains/denoising-diffusion-pytorch
고품질 이미지 및 1D 시퀀스 생성을 위한 Denoising Diffusion Probabilistic Models (DDPM)의 PyTorch 구현체.
buluslan/gpt-image2-ecommerce
39개의 장면 템플릿과 기술적 사전 검사를 활용해 전문적이고 플랫폼 준수 제품 이미지를 생성하는 AI 기반 전자상거래 시각 자산 생성기입니다.
wnby/photo-relic-editorial
실제 사진과 동일한 이미지의 절제된 종이 질감 판화 버전을 짝지어 사진을 세로형 편집 아트워크로 변환하는 Codex 스킬입니다.
storytold/artcraft
ArtCraft는 아티스트가 2D 또는 3D 장면을 구성하고 AI 생성 이미지, 동영상, 오디오, 메시, 세계로 채울 수 있는 데스크톱 IDE입니다. 합성, 포즈 전이, 배경 제거, 프롬프트 기반 생성을 위한 시각적 도구를 제공하며, 내장된 62개 모델과 Midjourney, Sora와 같은 외부 제공자도 지원합니다. Windows/macOS용으로 제공되며(Linux는 소스에서), 반복 가능하고 제어 가능한 AI 아트 워크플로우를 원하는 창작자를 대상으로 합니다.
drawthingsai/draw-things-community
Draw Things 앱의 핵심 이미지 생성, 샘플링, 트레이닝 코드를 제공하는 커뮤니티 리포지토리로, 원격 추론을 위한 자체 호스팅 gRPC 서버를 포함합니다.
jtydhr88/ComfyUI-qwenmultiangle
ComfyUI용 커스텀 노드로, Qwen-Image-Edit-2511-Multiple-Angles-LoRA와 호환되는 프롬프트를 생성하기 위한 인터랙티브 3D 뷰포트를 제공합니다.
allenk/GeminiWatermarkTool
결정론적 리버스-알파 블렌딩 알고리즘을 사용하여 Google Gemini의 이미지(및 동영상) 워터마크를 제거하는 크로스 플랫폼 포터블 실행 파일. 옵션으로 GPU 가속 FDnCNN 디노이징, GUI/CLI 인터페이스, 배치 처리 및 MCP를 통한 AI 에이전트 통합을 제공합니다.
ATH-MaaS/ComfyUI-Copilot
LLM 기반 에이전트를 사용하여 ComfyUI의 이미지 생성 워크플로우 생성, 디버깅 및 최적화를 자동화하는 ComfyUI용 지능형 어시스턴트입니다.
wzj177/ecommerce-image-suite
AI 기반 툴킷으로 전자상거래 판매자가 제품 사진을 자동 분석하고 Amazon, Taobao, JD.com, TikTok 등 다양한 스타일과 플랫폼에 맞는 전문적인 마케팅 이미지 세트를 생성할 수 있습니다.
TaiT-tt/tait-crt-interface-skill
사진이나 텍스트를 초기 CRT 컴퓨터 인터페이스의 미학을 가진 레트로 일러스트레이션으로 변환하는 Codex 이미지 생성 스킬.
Fannovel16/comfyui_controlnet_aux
깊이 맵, Canny 엣지, 인체 포즈 등 ControlNet 힌트 이미지를 생성하기 위한 전처리기(preprocessors)를 제공하는 ComfyUI 노드 모음입니다.
VigoZhao/AI-Visual-Prompt-Cookbook
AI 이미지 생성을 위한 130개 이상의 JSON 기반 비주얼 스타일 프롬프트 템플릿을 큐레이션한 라이브러리입니다. 각 `style.json` 파일은 재사용 가능한 레이아웃(예: 포스터, 콜라주, 타이포그래피 아트)을 정의하며, 미리 채워야 할 자리 표시자(placeholder)를 포함합니다. 전체 파일을 멀티모달 LLM(예: ChatGPT‑4‑Vision, Gemini‑3‑Pro 등)에 붙여넣기 전에 변수를 채우면 됩니다. 리포지토리에는 미리보기 이미지, 예시 값, 검증 스크립트, 복사 프롬프트 단축키가 포함되어 있어 AI 생성 그래픽의 일관성과 반복 작업의 용이성을 높입니다.
wkentaro/labelme
labelme는 이미지나 동영상 위에 경계 상자, 다각형, 마스크 등을 그리는 크로스플랫폼 Python/Qt 데스크톱 앱입니다. 주석은 JSON으로 저장되며, VOC 또는 COCO 형식으로 내보낼 수 있어 컴퓨터 비전 모델의 학습 데이터를 만들기에 실용적입니다. pip, 유료 독립 실행형 파일, 또는 Linux 패키지를 통해 설치할 수 있으며, 최신 버전에는 AI 지원 마스크 생성(SAM, YOLO-World) 기능이 추가되었습니다.
zuruoke/watermark-removal
이미지 인페인팅을 사용하여 이미지에서 워터마크를 제거하고 매끄러운 결과를 생성하는 머신러닝 프로젝트입니다.
dacnay816y62-hub/photo-revival
일반 사진을 여백이 많고 작은 필기체 캡션이 달린 미니멀하고 시적인 수작업 일러스트로 변환하는 AI 스킬 명령어 세트입니다.
filliptm/ComfyUI_Fill-Nodes
Fill‑Nodes는 이미지 처리, 비주얼 효과, 캡션 생성, AI 모델 호출(GPT, DALL‑E, Hugging Face 등), 파일 처리(PDF, Google 드라이브), 오디오 반응형 및 비디오 유틸리티를 추가하는 대규모 커스텀 ComfyUI 노드 모음입니다. ComfyUI의 `custom_nodes` 폴더에 리포지토리를 복사하면 설치 완료됩니다. 배치 로드, 창의적 효과 적용, LLM을 통한 캡션 생성, 이미지, 비디오, PDF 또는 클라우드 저장 파일로 결과 내보내기까지 포함하는 엔드투엔드 워크플로우를 구축하는 데 사용할 수 있습니다.
six-nut/PocketMen-with-you
두 장 이상의 사진을 Codex 동반자용 일관된 애니메이션 캐릭터 스프라이트로 변환하는 로컬 생성 도구로, 오픈 가중치 이미지 모델을 사용합니다.
Hunyuan-PromptEnhancer/PromptEnhancer
Chain-of-Thought(사고의 연쇄) 재작성 방식을 사용하여 텍스트-이미지 및 이미지-이미지 편집 프롬프트를 강화하면서 사용자의 원래 의도를 보존하는 프롬프트 재작성 유틸리티입니다.
kadevin/ilab-conjure
iLab CONJURE는 여러 AI 모델(GPT-Image, Gemini, Codex)을 사용하여 이미지를 생성하고 편집하기 위한 로컬 실행 기반의 FastAPI 웹 UI(및 CLI)입니다. 작업 대기열, 영구 갤러리, 프롬프트 템플릿 칩, SQLite 기록을 제공하며, OpenAI 호환 API와 로컬 Codex OAuth 흐름을 모두 지원합니다. 소스 코드나 미리 빌드된 macOS/Windows 패키지를 통해 설치하고 API 키를 설정하면 바로 이미지 생성을 시작할 수 있습니다.
eikek/docspell
Docspell은 스캔한 종이 문서, 이메일 및 기타 파일을 정리하는 오픈소스 개인 문서 관리 시스템입니다. Stanford CoreNLP를 사용해 태그, 날짜, 발신자를 자동으로 제안하고 필요 시 OCR을 실행하며 REST API와 모바일 친화적인 Elm 웹 UI를 통해 전체 텍스트 검색을 제공합니다. Docker, Debian 패키지, Nix 또는 Helm로 설치 가능하며 AGPL-v3 라이선스입니다.
SamurAIGPT/Vibe-Workflow
Vibe Workflow는 생성형 이미지 및 비디오 파이프라인을 구축하기 위한 오픈소스이며 MIT 라이선스를 따르는 노드 기반 시각 에디터입니다. Next.js 프론트엔드, MuAPI의 생성 모델을 호출하는 FastAPI 백엔드, 재사용 가능한 워크플로우 빌더 UI 라이브러리로 구성되어 있습니다. Docker 또는 수동 설치로 자체 호스팅이 가능하며, 호스팅된 SaaS 버전도 이용할 수 있으며, 사용자 정의 노드를 통해 어떤 AI 모델이나 외부 API도 호출할 수 있습니다.
NimaNzrii/comfyui-photoshop
Photoshop 인터페이스에 ComfyUI의 AI 기능을 직접 통합하여 AI 기반 편집 워크플로우를 원활하게 구현하는 플러그인입니다.
chaiNNer-org/chaiNNer
사용자가 시각적 인터페이스를 통해 맞춤형 처리 파이프라인을 구축할 수 있는 프로그래밍 방식의 이미지 처리 및 AI 업스케일링을 위한 노드 기반 GUI입니다.
PrismML-Eng/Bonsai-Image-Demo
Apple Silicon, Linux, Windows용 크로스플랫폼 데모. 4 B 파라미터의 Bonsai 디퓨전 모델을 macOS (MLX) 또는 NVIDIA GPU (gemlite + HQQ)에서 웹 기반 스튜디오와 CLI를 통해 이미지 생성 가능.
karimz1/imgcompress
로컬 AI 기반 배경 제거, 대량 압축 및 70가지 이상의 이미지 형식 변환을 제공하는 셀프 호스팅 이미지 처리 서버입니다.
trueai-org/midjourney-proxy
개발자가 Midjourney의 이미지 생성 및 얼굴 교체 기능을 자체 애플리케이션에 프로그래밍 가능한 인터페이스를 통해 통합할 수 있도록 해주는 오픈소스 API 프록시입니다.
YanWenKun/ComfyUI-Windows-Portable
NVIDIA GPU를 탑재한 Windows 환경에서 Stable Diffusion용 노드 기반 UI인 ComfyUI를 40개 이상의 커스텀 노드와 300개 이상의 사전 컴파일된 Python 패키지와 함께 패키지화하여, AI 이미지/비디오 생성을 즉시 시작할 수 있도록 해주는 즉시 실행 가능한 Windows 패키지입니다.
Comfy-Org/comfy-cli
comfy‑cli는 오픈소스 생성 미디어 엔진인 ComfyUI를 설치, 실행, 관리하는 Python 명령줄 도구입니다. 환경 설정, 커스텀 노드 설치, 모델 다운로드, 워크플로우 실행을 처리하며, 호스팅된 Comfy Cloud 서비스로 작업을 오프로드할 수 있습니다. 빠른 `uv` 기반 종속성 해결, LLM 에이전트용 JSON 구조 출력, 쉘 완성, PR 테스트 및 백그라운드 서버 관리 기능을 포함합니다.
FireRedTeam/FireRed-Image-Edit
강력한 정체성 유지 및 다중 요소 융합 기능을 제공하며, 고정밀도 및 일관된 편집을 지원하는 범용 이미지 편집 모델입니다.
NVIDIA-RTX/NRD
GPU 가속, API 독립적인 실시간 레이 트레이싱 노이즈 제거 라이브러리 (REBLUR, RELAX, SIGMA).
GiMi-Xiaomi/gimi-illustration-skill
사용자 정의 가능한 스타일과 일관된 캐릭터 IP를 사용해 텍스트 기사 및 스크립트를 개념도로 변환하는 AI 에이전트 스킬.
LibrePhotos/librephotos
LibrePhotos는 AI로 생성된 메타데이터(얼굴, 객체, 캡션)를 자동으로 추가하고 의미 기반 검색, 지도 보기, 다중 사용자 앨범을 제공하는 자체 호스팅 사진 관리 서버입니다. Docker 컨테이너로 제공되며, Django REST 백엔드, React 웹 UI, 옵션의 React-Native Android 클라이언트를 사용하며, 모든 컴퓨터 비전 작업에 ONNX-run 모델을 사용합니다.
rupeshs/fastsdcpu
OpenVINO와 잠재적 일관성 모델을 활용해 CPU용으로 최적화된 고성능 Stable Diffusion 구현으로, 거의 실시간 이미지 생성을 가능하게 합니다.
nv-tlabs/PiD
PiD는 표준 VAE/RAE 디코더를 대체하여 잠재 표현을 단 한 번의 패스로 초해상도 2K~4K 픽셀로 변환하는 플러그 앤 플레이 확산 디코더입니다.
Gourieff/ComfyUI-ReActor
이미지와 비디오에서 빠르고 간단하게 얼굴을 교체하기 위한 ComfyUI 노드 세트로, 얼굴 복원 및 혼합 얼굴 모델 생성 기능을 특징으로 합니다.
Nerogar/OneTrainer
데이터셋 준비, 파인튜닝 및 모델 변환 도구를 제공하는 GUI 또는 CLI 기반 확산 모델 종합 교육 스위트입니다.
yurijmikhalevich/rclip
rclip는 OpenCLIP 임베딩을 사용하여 자연어 설명, 예시 이미지 또는 가중 조합을 통해 사진을 찾을 수 있는 로컬, 터미널 기반 이미지 검색 도구이며, 선택적 인터랙티브 UI와 다양한 이미지 포맷을 지원합니다.
markfulton/NanoBananaEditor
Google의 Gemini 이미지 모델을 사용하는 React 및 TypeScript 기반의 에디터로, 텍스트 기반 이미지 생성, 마스크 편집, 검색 기반 프롬프트를 지원합니다.
nihui/zimage-ncnn-vulkan
모든 Vulkan 호환 GPU에서 고성능 이미지 생성, 인페인팅, ControlNet 지원을 가능하게 하는, ncnn 기반의 포터블 Z-Image 생성기 구현입니다.