Hunyuan-PromptEnhancer/PromptEnhancer
[CVPR 2026] PromptEnhancer is a prompt-rewriting tool, refining prompts into clearer, structured versions for better image generation.
What it solves
PromptEnhancer は、単純なユーザープロンプトと、高品質で正確な画像を生成するために text-to-image (T2I) モデルが必要とする詳細な記述の間のギャップをギャップを解消します。曖昧-な入力を、ダウンストリームの画像生成器がより理解しやすい構造化された記述的なプロンプトに変換することで、元のユーザーの意図を失わせることなく、プロンプトを精緻化します精緻化します。
How it works
このプロジェクトは、Chain-of-Thought (CoT) プロンプト書き換えアプローチを使用して、入力プロンプトを再構成します。主に 3 つの実現方法を提供します:
- Text-to-Image Enhancement: 7B または 32B パラメータモデルを使用して、テキストプロンプトをより明確で構造化されたバージョンに書き換えます。
- Image-to-Image Editing: 視覚言語モデル (Qwen2.5-VL ベース) を使用して、入力画像の視覚的コンテキストを分析することで、編集指示を精緻化します。
- Quantized Inference: llama.cpp を介して 32B モデルの GGUF バージョンを提供することで、コンシューマー向け GPU で VRAM 使用量を大幅に削減しつつ、高品質なプロンプト強化を実現します。
Who it’s for
- AI Artists and Designers: 手動で複雑なプロンプトを記述することなく、T2I モデルからより良い結果を得たいユーザー。
- Developers: 画像生成パイプラインを構築している開発者で、ユーザー入力を精緻化するための自動化された方法が必要な人。
- Researchers: プロンプトエンジニアリングや、視覚言語モデルと視覚的コンテキストの分析の相互作用を研究している個人。
Highlights
- Dual-Mode Support: 初期の画像生成 (T2I) と既存の画像の修正 (Img2Img) の両方を処理します。
- Intent Preservation: 書き換えプロセスにおいて、被写体、動作、スタイル、レイアウトを維持するように特別に設計されています。
- Flexible Deployment: さまざまなモデルサイズ (7B から 32B) と量子化レベル (Q4, Q6, Q8) を提供し、異なるハードウェア制約に合わせて適応可能です。
- Robust Parsing: 信頼性の高い出力生成を確保するために、マルチレベルのフォールバックメカニズムを備えています。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト