Hunyuan-PromptEnhancer/PromptEnhancer
[CVPR 2026] PromptEnhancer is a prompt-rewriting tool, refining prompts into clearer, structured versions for better image generation.
What it solves
PromptEnhancer는 단순한 사용자 프롬프트와 텍스트-이미지(T2I) 모델이 고품질의 정확한 이미지를 생성하기 위해 필요한 상세한 설명 사이의 간극을 해결합니다. 모호한 입력을 다운스트림 이미지 생성기가 더 잘 이해할 수 있는 구조화되고 설명적인 프롬프트로 변환하는 동시에 사용자의 원래 의도를 잃지 않도록 합니다.
How it works
이 프로젝트는 Chain-of-Thought(CoT) 프롬프트 재작성 방식을 사용하여 입력 프롬프트를 재구성합니다. 세 가지 주요 구현 경로를 제공합니다:
Text-to-Image Enhancement: 7B 또는 32B 파라미터 모델을 사용하여 텍스트 프롬프트를 더 명확하고 구조화된 버전으로 재작성합니다.
Image-to-Image Editing: 시각 언어 모델(Qwen2.5-VL 기반)을 사용하여 입력 이미지의 시각적 컨텍스트를 분석하여 편집 지침을 정교화합니다.
Quantized Inference: llama.cpp를 통해 32B 모델의 GGUF 버전를 제공하여 소비자용 GPU에서 VRAM 사용량을 크게 줄이면서 고품질의 프롬프트 강화를 제공합니다.
Who it’s for
- AI Artists and Designers: 복잡한 프롬프트를 수동으로 작성하지 않고 T2I 모델로부터 더 나은 결과를 얻고 싶은 사용자.
- Developers: 이미지 생성 파이프라인을 구축하는 개발자로서 사용자 입력을 정교화하는 자동화된 방식이 필요합니다.
- Researchers: 프롬프트 엔지니어링과 시각 언어 모델 간의 상호작용을 연구하는 연구자.
Highlights
Dual-Mode Support: 초기 이미지 생성(T2I)과 기존 이미지의 수정(Img2Img)을 모두 처리합니다.
Intent Preservation: 재작성 과정에서 피사체, 동작, 스타일, 레이아웃과 같은 모든 핵심 요소를 유지하도록 특별히 설계되었습니다.
Robust Parsing: 다단계 폴백(fallback) 메커니즘을 포함하여 신뢰할 수 있는 출력 생성 보장.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트