Hunyuan-PromptEnhancer/PromptEnhancer
[CVPR 2026] PromptEnhancer is a prompt-rewriting tool, refining prompts into clearer, structured versions for better image generation.
What it solves
PromptEnhancer 解决了简单用户提示词与文本到图像 (T2I) 模型生成高质量、准确图像所需的详细描述之间的差距。它在将模糊输入转换为下游图像生成器能更好理解的结构化、描述性提示词的同时,防止了原始用户意图的丢失。
How it works
该项目使用思维链 (Chain-of-Thought, CoT) 提示词重写方法来重构输入提示词。它提供三种主要的实现路径:
- Text-to-Image Enhancement: 使用 7B 或 32B 参数模型将文本提示词重写为更清晰、结构化的版本。
- Image-to-Image Editing: 使用视觉语言模型 (基于 Qwen2.5-VL) 通过分析输入图像的视觉上下文来精炼编辑指令。
- Quantized Inference: 通过 llama.cpp 提供 32B 模型的 GGUF 版本,以便在消费级 GPU 上以显著降低的 VRAM 使用量进行高质量的提示词增强。
Who it’s for
- AI Artists and Designers: 想要在无需手动编写复杂提示词的情况下,从 T2I 模型获得更好结果的用户。
- Developers: 正在构建图像生成流水线的人员,需要一种自动化的方式来精炼练用户输入。
- Researchers: 正在研究提示词工程 (prompt engineering) 和视觉语言模型之间交互作用的研究人员。
Highlights
- Dual-Mode Support: 同时处理初始图像生成 (T2I) 和现有图像的修改 (Img2Img)。
- Intent Preservation: 专门设计用于在重写过程中保持所有关键元素,如主体、动作、风格和布局。
- Flexible Deployment: 提供一系列模型大小 (7B 到 32B) 和量化等级 (Q4, Q6, Q8) 以适应不同的硬件约束。
- Robust Parsing: 包含一个多级备用机制,以确保可靠的输出生成。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目