facebookresearch/tuna-2
Official implementation of Tuna-2: Pixel Embeddings Beat Vision Encoders for Unified Understanding and Generation
해결하는 문제
Tuna-2는 이미지를 처리하기 위해 일반적으로 Variational Autoencoders (VAEs) 또는 표현 인코더와 같은 무거운 시각적 인코딩 구성 요소에 의존하는 통합 멀티모달 모델(UMM)의 복잡성을 해결합니다. 이해 및 생성 작업 모두에서 성능을 향상시키면서 아키텍처를 단순화하는 것을 목표로 합니다.
작동 방식
이 프로젝트는 시각적 인코딩 레이어를 점진적으로 제거하여 아키텍처를 발전시킵니다. 기존 Tuna는 VAE를 사용했고 Tuna-R는 표현 인코더를 사용했지만, Tuna-2는 두 가지 모두를 제거하고 직접적인 패치 임베딩 레이어를 사용하여 원시 이미지 입력을 픽셀 임베딩으로 처리합니다. 이 간소화된 접근 방식은 모델이 시각적 데이터를 더 직접적으로 처리할 수 있게 하여 멀티모달 벤치마크에서 이전 모델보다 뛰어난 성능을 보여줍니다.
대상
통합 멀티모달 모델을 연구하는 연구자 및 개발자, 특히 효율적인 이미지 생성(text-to-image), 이미지 편집 및 전통적인 비전 인코더를 우회하는 네이티브 멀티모달 아키텍처 개발에 관심이 있는 사람들을 대상으로 합니다.
주요 특징
- 통합 아키텍처: 단일 프레임워크 내에서 이해와 생성을 모두 처리합니다.
- 픽셀 공간 처리: 복잡한 비전 인코더를 원시 이미지에 대한 직접적인 패치 임베딩으로 대체합니다。
- 다양한 작업: text-to-image 생성 및 이미지 편집을 지원합니다。
- 비디오 확장성: 비디오 생성 모델의 학습 및 추론을 위한 전체 코드베이스를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트