Hunyuan-PromptEnhancer/PromptEnhancer

[CVPR 2026] PromptEnhancer is a prompt-rewriting tool, refining prompts into clearer, structured versions for better image generation.

What it solves

PromptEnhancer 解決了簡單的使用者提示詞與文字轉圖片 (T2I) 模型產生高品質、準確圖片所需的詳細描述之間的差距。它在將模糊的輸入轉換為下游圖片生成器能更好理解的結構化、描述性提示詞的同時,防止了原始使用者意圖的流失。

How it works

該專案使用思維鏈 (Chain-of-Thought, CoT) 提示詞重寫方法來重構輸入提示詞。它提供三種主要的實作路徑:

  • Text-to-Image Enhancement: 使用 7B 或 32B 參數模型將文字提示詞重寫為更清晰、結構化的版本。
  • Image-to-Image Editing: 使用視覺語言模型 (基於 Qwen2.5-VL) 透過分析輸入圖片的視覺上下文來精煉編輯指令。
  • Quantized Inference: 透過 llama.cpp 提供 32B 模型的 GGUF 版本,以便在消費級 GPU 上以顯著降低的 VRAM 使用量進行高品質的提示詞增強。

Who it’s for

  • AI Artists and Designers: 想要在不手動撰寫複雜提示詞的情況下,從 T2I 模型獲得更好結果的使用者。
  • Developers: 正在構建圖片生成流程的開發者,需要一種自動化的方式來精煉使用者輸入。
  • Researchers: 研究提示詞工程 (prompt engineering) 與視覺語言模型之間互動的研究人員。

Highlights

  • Dual-Mode Support: 同時處理初始圖片生成 (T2I) 與現有圖片的修改 (Img2Img)。
  • Intent Preservation: 特別設計用於在重寫過程中保留所有關鍵元素,如主體、動作、風格與佈局。
  • Flexible Deployment: 提供一系列模型大小 (7B 到 32B) 與量化等級 (Q4, Q6, Q8) 以適應不同的硬體限制。
  • Robust Parsing: 包含一個多層級的備援機制,以確保可靠的輸出生成。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案