jd-opensource/JoyAI-Image

JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.

What it solves

JoyAI-Image 解決了影像理解與生成之間的鴻溝,透過建立一個統一模型,使其能在同一框架內感知、生成與編輯影像。它特別聚焦於「空間智慧」,讓模型能處理複雜的空間推理、精確的物件操作以及視點變換,這些通常是一般影像模型難以應付的挑戰。

How it works

此專案採用混合架構,結合 8B 多模態大型語言模型(MLLM)負責理解,與 16B 多模態擴散變換器(MMDiT)負責生成。兩個元件以閉環協作方式運作:MLLM 提供場景解析與關係定位以指導生成,而生成能力(例如改變視點)則提供新的視覺證據,協助 MLLM 更精確地推理空間關係。

Who it’s for

此工具設計給多模態 AI 的研究者與開發者,特別是需要高保真影像編輯、具 3D 感知的影像合成,或是需要進階空間推理以完成 3D 重建與影片生成等任務的人員。

Highlights

  • Unified Framework: 單一模型族同時處理影像理解、文字生成影像與指令導向編輯。
  • Spatial Intelligence: 支援精確的空間編輯模式,包括將物件移動到特定區域、將物件旋轉至標準視角,以及控制相機的偏航、俯仰與縮放。
  • Advanced Typography: 為複雜文字渲染進行最佳化,支援多行文字、多語言排版與手寫風格。
  • Multi-Image Editing: 「Plus」版本支援跨影像合成與多影像的聯合操作。
  • Integration: 相容於 Hugging Face Diffusers 套件與 ComfyUI。