jd-opensource/JoyAI-Image
JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.
해결하는 문제
JoyAI-Image는 이미지 이해와 이미지 생성 사이의 간극을 해결합니다. 이 모델은 이미지의 공간적 레이아웃과 콘텐츠를 이해할 뿐만 아니라, 정확한 지침을 기반으로 새로운 이미지를 생성하거나 기존 이미지를 편집할 수 있는 통합 프레임워크를 제공하여 변경 사항이 장면 구조와 시각적 일관성을 유지하도록 보장합니다.
작동 방식
이 프로젝트는 이해를 위한 8B Multimodal Large Language Model (MLLM)과 생성을 위한 16B Multimodal Diffusion Transformer (MMDiT)를 결합합니다. 이를 통해 공간 이해가 근거 있는 생성 및 편집에 정보를 제공하고, 생성 능력(시점 변경 등)이 모델의 공간 추론을 향상시키기 위한 새로운 시각적 증거를 제공하는 "폐쇄 루프 협업"을 생성합니다.
대상
이 도구는 멀티모달 AI 분야에서 연구하는 연구자와 개발자, 특히 고정밀 이미지 편집, 정밀한 공간 조작 및 이미지 내 고급 텍스트 렌더링이 필요한 분들을 위해 설계되었습니다.
주요 특징
- 통합 파운데이션: 이해, 텍스트-이미지 생성 및 지시 기반 편집을 처리하는 단일 모델 제품군.
- 공간 지능: 정밀한 객체 이동, 특정 뷰로의 객체 회전 및 카메라 제어(yaw, pitch, zoom)를 지원합니다.
- 고급 텍스트 렌더링: 긴 텍스트, 다국어 타이포그래피 및 만화와 같은 복잡한 레이아웃 렌더링에서 높은 성능을 발휘합니다.
- 멀티 이미지 편집: "Plus" 버전은 이미지 간 합성 및 여러 이미지에 걸친 공동 조작을 지원합니다.
- 구성 지원: Diffusers 및 ComfyUI와 네이티브 통합을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트