jd-opensource/JoyAI-Image
JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.
解決的問題
JoyAI-Image 彌補了圖像理解與圖像生成之間的鴻溝。它提供了一個統一的框架,使模型不僅能夠理解圖像的空間佈局和內容,還能根據精確的指令生成新圖像或編輯現有圖像,確保更改能夠保持場景結構和視覺一致性。
工作原理
該項目結合了用於理解的 8B Multimodal Large Language Model (MLLM) 和用於生成的 16B Multimodal Diffusion Transformer (MMDiT)。這創建了一種「閉環協作」,其中空間理解為落地生成和編輯提供資訊,而生成能力(如改變視角)則提供新的視覺證據來改進模型的空間推理。
適用對象
該工具專為從事多模態 AI 研究的研究人員和開發人員設計,特別是那些需要高保真圖像編輯、精確空間操作和圖像內高級文本渲染的人員。
亮點
- 統一基礎:一個處理理解、文本生成圖像和指令引導編輯的單一模型家族。
- 空間智能:支持精確的物體移動、物體旋轉至特定視角以及相機控制(yaw、pitch 和 zoom)。
- 高級文本渲染:在渲染長文本、多語言排版和漫畫等複雜佈局方面具有高性能。
- 多圖編輯:「Plus」版本支持跨圖像合成和多圖聯合操作。
- 配置支持:與 Diffusers 和 ComfyUI 原生集成。
相關
- 專案
- 專案
- 專案
- 專案
- 專案