OFA: 하나의 모델을 위한 구축을 향해
OFA (One-For-All)는 다양한 모달리티에 걸친 이해와 생성 작업을 하나의 프레임워크로 통합하도록 설계된 통합 멀티모달 사전학습 모델이다. 지시 기반 멀티태스크 사전학습을 활용함으로써, OFA는 작업마다 아키텍처를 변경할 필요 없이 다양한 입력과 출력을 처리할 수 있는 제네럴리스트 모델을 만드는 것을 목표로 한다.
모달리티, 아키텍처 및 작업을 위한 통합 프레임워크
OFA는 모달리티 무관성, 작업 무관성, 작업 포괄성이라는 세 가지 핵심 축을 통해 제네럴리스트 역량을 달성한다.
모달리티 통합
다양한 입력을 처리하기 위해 OFA는 비텍스트 모달리티를 토큰으로 이산화한다. 이미지는 VQ (Vector Quantization) 토큰으로, 바운딩 박스는 pix2seq 접근법을 따라 빈(bin)으로 이산화한다. 이를 통해 모델은 모든 모달리티를 토큰 시퀀스로 취급할 수 있다.
아키텍처 통합
OFA는 T5 모델과 유사한 범용 Transformer 인코더‑디코더 아키텍처를 사용한다. 이미지 입력을 처리하기 위해 모델은 ResNet의 첫 세 블록을 활용한다. 학습 안정성과 전이 성능을 향상시키기 위해 아키텍처에 Normformer를 도입한다.
작업 통합
OFA는 지시 기반 멀티태스크 학습 접근법으로 사전학습된다. 모델은 다음 여덟 가지 서로 다른 작업에 대해 학습된다:
- 시각-언어 작업 (5): 시각적 그라운딩, 그라운드 캡셔닝, 시각 질문 응답 (VQA), 이미지‑텍스트 매칭, 이미지 캡셔닝.
- 시각 작업 (2): 객체 탐지와 이미지 인필링.
- 언어 작업 (1): 텍스트 인필링.
지시는 텍스트 설명 형태로 삽입되어 모델이 작업을 구분하도록 돕고, 새로운 지시문을 통해 보지 못한 작업에 대해 제로샷 생성이 가능하도록 한다.
모델 변형 및 규모
OFA는 다양한 배포 및 연구 요구를 충족하기 위해 다섯 가지 크기로 제공된다:
- OFA-Tiny: 33M 파라미터
- OFA-Medium: 93M 파라미터
- OFA-Base: 180M 파라미터
- OFA-Large: 470M 파라미터
- OFA-Huge: 930M 파라미터
성능 및 실험 결과
OFA는 멀티모달 및 단일모달 벤치마크에서 경쟁력 있는 성능을 보여주며, 종종 특화된 모델을 능가한다.
멀티모달 능력
- 시각-언어 이해: OFA-Huge 모델은 VQA와 SNLI-VE에서 Flamingo (80B 파라미터)와 CoCa (2B 파라미터)와 견줄 만한 성능을 달성하고, 시각적 함의(visual entailment)에서 최고 성능을 기록한다.
- 시각-언어 생성: OFA는 이미지 캡셔닝에서 교차 엔트로피와 CIDEr 최적화 모두에서 최첨단(state-of-the-art, SoTA) 성능을 달성한다. 시각적 그라운딩에서는 베이스 크기 모델이 이전 SoTA들을 능가하며, 성능이 모델 크기에 따라 일관되게 향상된다.
- 텍스트-이미지 생성: 이미지 인필링에 대한 사전학습 덕분에 OFA는 이미지 코드를 생성하고 낮은 FID 점수를 달성한다. 이는 더 큰 데이터셋에 대한 파인튜닝으로 더욱 개선된다.
단일모달 능력
- 자연어 이해 (NLU): GLUE 벤치마크에서 OFA는 RoBERTa와 DeBERTa에 견줄 만한 성능을 보인다.
- 자연어 생성 (NLG): OFA는 Gigaword 요약에서 강력한 성능을 보여 이전 멀티모달 사전학습 모델들을 능가한다.
- 시각 이해: ImageNet 분류에서 OFA는 BeiT와 MAE와 같은 자체 지도 학습 비전 모델과 유사한 성능을 달성한다.
구성적 일반화 및 전이
OFA는 구성적 일반화를 통해 학습된 역량을 보지 못한 작업과 도메인에 전이할 수 있다.
- 보지 못한 작업: 연구자들은 VQA와 그라운드 캡셔닝을 결합한 새로운 작업인 "Grounded VQA"를 도입했다. 지시문만 바꾸면 OFA는 기존 능력을 활용해 이 새로운 작업을 수행할 수 있다.
- 보지 못한 도메인: OFA는 애니메이션 데이터와 일반 도메인 시각 그라운딩에 대한 사전학습을 결합함으로써, 애니메이션 이미지에서 시각 그라운딩을 수행하는 등 보지 못한 도메인에도 효과적으로 전이된다.
결론
OFA 모델은 단일 Transformer 기반 프레임워크가 작업과 모달리티를 통합할 수 있음을 보여주며, 멀티모달 표현 학습에서 제네럴리스트 기반 모델을 개발하기 위한 유망한 길을 제시한다.