apple-aiml-research/ml-4m
4M: Massively Multimodal Masked Modeling
해결하는 문제
4M은 '어떤 모달리티에서든 어떤 모달리티로든' 생성이 가능한 멀티모달 기반 모델을 훈련하기 위한 프레임워크를 제공합니다. 하나의 아키텍처 안에서 수십 가지의 다양한 모달리티와 작업을 처리할 수 있도록 AI 모델을 확장하는 문제를 해결하며, 다양한 데이터 유형 간의 유연한 생성과 전이를 가능하게 합니다.
작동 방식
이 프레임워크는 다양한 모달리티를 처리하기 위해 토큰화와 마스크 모델링을 결합합니다. 서로 다른 데이터 유형을 토큰으로 변환함으로써 모델은 마스크된 토큰을 예측하도록 훈련되며, 다양한 모달리티에서 작동하는 표현을 학습할 수 있습니다. 이를 통해 RGB에서 모든 모달리티로의 생성(단일 RGB 이미지에서 여러 모달리티 생성) 또는 캡션에서 모든 모달리티로의 생성(텍스트에서 여러 모달리티 생성)과 같은 작업이 가능해집니다.
대상 사용자
이 프로젝트는 임의의 모달리티 간 생성, 비전 작업, 확장 가능한 멀티모달 훈련에 관심이 있는 멀티모달 기반 모델 개발에 종사하는 AI 연구자 및 개발자들을 위한 것입니다.
주요 특징
- 임의의 모달리티 간 생성 기능: 수십 가지 모달리티와 작업 간 생성을 지원합니다.
- 확장 가능한 아키텍처: 198M에서 2.8B 파라미터까지 다양한 크기의 모델(4M-B, 4M-L, 4M-XL) 제공.
- 다양한 모달리티 지원: RGB, 깊이, 법선, 에지, 세그멘테이션, CLIP, DINOv2, ImageBind, SAM 인스턴스, 3D 인간 자세용 토크나이저 포함.
- 특화된 변형 모델: 텍스트에서 이미지 생성 전용 모델 및 초해상도 모델 제공.
- 오픈소스: Hugging Face Hub를 통해 훈련 프레임워크와 사전 학습된 체크포인트 모두 공개.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트