jd-opensource/JoyAI-Image

JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.

What it solves

JoyAI-Image는 이미지 이해와 생성 사이의 격차를 메우며, 단일 프레임워크 내에서 이미지를 인식하고 생성하며 편집할 수 있는 통합 모델을 제공합니다. 특히 "공간 지능"에 초점을 맞춰, 표준 이미지 모델이 어려워하는 복잡한 공간 추론, 정밀한 객체 조작 및 시점 변화를 처리할 수 있게 합니다.

How it works

이 프로젝트는 이해를 담당하는 8B 멀티모달 대형 언어 모델(MLLM)과 생성을 담당하는 16B 멀티모달 디퓨전 트랜스포머(MMDiT)를 결합한 하이브리드 아키텍처를 사용합니다. 두 구성 요소는 폐쇄 루프 협업으로 작동하며, MLLM은 장면 파싱과 관계 기반을 제공해 생성을 안내하고, 생성 기능(예: 시점 변경)은 새로운 시각적 증거를 제공해 MLLM이 공간 관계를 보다 정확히 추론하도록 돕습니다.

Who it’s for

이 도구는 멀티모달 AI 분야의 연구자와 개발자를 위해 설계되었으며, 특히 고품질 이미지 편집, 3D 인식 이미지 합성, 3D 재구성 및 비디오 생성과 같은 작업에 고급 공간 추론이 필요한 경우에 적합합니다.

Highlights

  • Unified Framework: 이미지 이해, 텍스트‑투‑이미지 생성, 명령 기반 편집을 모두 처리하는 단일 모델 패밀리.
  • Spatial Intelligence: 객체를 특정 영역으로 이동, 객체를 표준 뷰로 회전, 카메라의 yaw, pitch, zoom을 제어하는 정밀한 공간 편집 패턴을 지원.
  • Advanced Typography: 복잡한 텍스트 렌더링에 최적화되어 다중 라인 텍스트, 다국어 타이포그래피, 손글씨 스타일을 지원.
  • Multi-Image Editing: "Plus" 버전은 이미지 간 합성 및 다중 이미지의 공동 조작을 지원.
  • Integration: Hugging Face Diffusers 라이브러리와 ComfyUI와 호환됩니다.