jd-opensource/JoyAI-Image

JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.

What it solves

JoyAI-Image 解决了图像理解和生成之间的鸿沟,通过创建一个统一模型,使其能够在单一框架内感知、生成和编辑图像。它特别关注“空间智能”,使模型能够处理复杂的空间推理、精确的对象操作以及视点变化,这些通常是标准图像模型难以应对的挑战。

How it works

该项目使用混合架构,结合 8B 多模态大型语言模型(MLLM)用于理解,和 16B 多模态扩散变换器(MMDiT)用于生成。这两个组件在闭环协作中工作:MLLM 提供场景解析和关系定位以指导生成,而生成能力(如改变视点)提供新的视觉证据,帮助 MLLM 更准确地推理空间关系。

Who it’s for

此工具面向从事多模态 AI 的研究人员和开发者,尤其是需要高保真图像编辑、具 3D 感知的图像合成,或需要高级空间推理以完成 3D 重建和视频生成等任务的用户。

Highlights

  • Unified Framework: 单一模型族同时处理图像理解、文本到图像生成以及指令引导编辑。
  • Spatial Intelligence: 支持精确的空间编辑模式,包括将对象移动到特定区域、将对象旋转到规范视角,以及控制相机的偏航、俯仰和缩放。
  • Advanced Typography: 为复杂文字渲染进行优化,支持多行文字、多语言排版和手写风格。
  • Multi-Image Editing: “Plus” 版本支持跨图像合成和多图像的联合操作。
  • Integration: 兼容 Hugging Face Diffusers 库和 ComfyUI。