jd-opensource/JoyAI-Image

JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.

解决的问题

JoyAI-Image 弥补了图像理解与图像生成之间的鸿沟。它提供了一个统一的框架,使模型不仅能够理解图像的空间布局和内容,还能根据精确的指令生成新图像或编辑现有图像,确保更改能够保持场景结构和视觉一致性。

工作原理

该项目结合了用于理解的 8B Multimodal Large Language Model (MLLM) 和用于生成的 16B Multimodal Diffusion Transformer (MMDiT)。这创建了一种“闭环协作”,其中空间理解为落地生成和编辑提供信息,而生成能力(如改变视角)则提供新的视觉证据来改进模型的空间推理。

适用对象

该工具专为从事多模态 AI 研究的研究人员和开发人员设计,特别是那些需要高保真图像编辑、精确空间操作和图像内高级文本渲染的人员。

亮点

  • 统一基础:一个处理理解、文本生成图像和指令引导编辑的单一模型家族。
  • 空间智能:支持精确的物体移动、物体旋转至特定视角以及相机控制(yaw、pitch 和 zoom)。
  • 高级文本渲染:在渲染长文本、多语言排版和漫画等复杂布局方面具有高性能。
  • 多图编辑:"Plus" 版本支持跨图像合成和多图联合操作。
  • 配置支持:与 Diffusers 和 ComfyUI 原生集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目