apple-aiml-research/ml-flextok
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
해결하는 문제
FlexTok은 유연한 길이의 1차원 토큰 시퀀스로 이미지를 표현하는 문제를 해결합니다. 전통적인 고정 길이 토큰화와 달리, 이미지를 자르거나 조정해도 재구성에 필요한 핵심 이미지 정보를 잃지 않고, 토큰 시퀀스로 재샘플링할 수 있습니다.
작동 방식
FlexTok은 인코더-디코더 아키텍처를 사용합니다. 인코더는 이미지를 이산 토큰 시퀀스로 변환합니다. 디코더는 리크티파이드 플로우 디코더로, 이 토큰들을 사용해 이미지를 재구성합니다. 주요 특징은 이러한 토큰 시퀀스를 자를 수 있다는 점입니다 (예: 256개 토큰 중 처음 64개만 유지) 하지만 모델은 짧은 시퀀스에서도 다시 토큰화하여 이미지를 재구성할 수 있습니다.
대상 사용자
이 프로젝트는 멀티모달 AI, 이미지 토큰화, 생성 모델에 종사하는 연구자 및 개발자들을 위한 것입니다. 특히 LLM이나 기타 시퀀스 기반 모델에 이미지를 시퀀스로 활용하기 위해 유연한 표현 방식이 필요한 분들에게 적합합니다.
주요 특징
- 유연한 토큰 길이: 중첩된 방식으로 토큰 시퀀스를 자르되 재구성 능력을 유지할 수 있습니다.
- 리크티파이드 플로우 디코더: 토큰에서 고품질 이미지 재구성을 위한 리크티파이드 플로우 디코더를 사용합니다.
- 사전 학습된 모델: 다양한 구성(예: 다른 인코더/디코더 레이어 수, 잠재 채널 수)의 FlexTok 토크나이저 및 VAE(변분 오토인코더)를 제공합니다.
- Hugging Face 통합: Hugging Face Hub를 통해 사전 학습된 체크포인트를 쉽게 로드할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트