Lance 소개: 멀티모달 생성 및 이해를 위한 통합 3B 모델
생성형 AI의 지형은 오랫동안 파편화되어 있었으며, 이미지 생성, 비디오 합성, 시각적 이해를 위해 각각 별도의 모델이 사용되어 왔습니다. 전문화된 모델들이 특정 분야에서는 뛰어난 성능을 보이는 경우가 많지만, 비디오를 분석한 후 편집해야 하는 도구와 같이 단일 애플리케이션을 위해 여러 파이프라인을 유지 관리하는 것은 상당한 오버헤드를 발생시킵니다.
ByteDance는 3B-active-parameter 네이티브 통합 멀티모달 모델인 Lance를 통해 이 문제를 해결했습니다. 서로 다른 모델을 결합하는 모듈형 시스템과 달리, Lance는 이미지 및 비디오 이해, 생성, 편집을 단일 프레임워크 내에서 처리하도록 설계되어 이러한 다양한 작업 간의 시너지를 목표로 합니다.
통합 멀티모달 프레임워크
Lance는 "네이티브" 통합 모델로, 처음부터 여러 모달리티를 처리하도록 구축되었습니다. 주요 목표는 이해(판별 작업)와 생성(생성 작업) 사이의 간극을 메우는 것입니다.
주요 기술적 특징
- 효율적인 규모: 단 3B의 활성 파라미터로, Lance는 성능을 희생하지 않으면서 효율성을 위해 설계되었으며, 이는 10B 이상의 거대 파라미터 모델보다 접근성이 높습니다.
- 처음부터 학습: 기존의 ViT 및 VAE 인코더를 활용하지만, transformer backbone은 단계별 멀티태스크 레시피를 사용하여 처음부터 완전히 학습되었습니다. 이는 모델의 내부 표현이 통합된 작업의 성격에 최적화되도록 보장합니다.
- 컴퓨팅 예산: 이 모델은 128 A100 GPU라는 비교적 제한된 예산 내에서 개발되었으며, 이는 학습 효율성에 중점을 두었음을 보여줍니다.
다재다능한 능력
Lance의 아키텍처는 다양한 미디어 유형에 걸쳐 광범위한 작업을 수행할 수 있게 합니다. 모델은 이러한 다양한 요청을 처리하기 위한 통합 명령줄 인터페이스를 제공합니다:
1. 생성
- Text-to-Image (t2i): 텍스트 프롬프트로부터 고정밀 이미지를 생성합니다.
- Text-to-Video (t2v): 텍스트 설명으로부터 비디오 시퀀스(최대 121 프레임)를 생성합니다.
2. 편집
- Image Editing: 텍스트 지침에 따라 기존 이미지를 수정합니다.
- Video Editing: 비디오 콘텐츠에 변화를 적용하며, 모델이 여러 번의 연속적인 편집 과정에서도 일관성을 유지하는 multi-turn consistency editing을 지원합니다.
3. 이해
- Image Understanding (x2t_image): 시각적 질의응답(VQA) 및 복잡한 이미지 기반 추론(예: 파이 차트 분석 또는 번호판 읽기)을 수행합니다.
- Video Understanding (x2t_video): 비디오에 대해 간결하거나 상세한 캡션을 제공하고, 클립 내의 동작 및 객체에 대한 특정 질문에 답합니다.
성능 벤치마크
Lance는 생성 전용 모델 및 기타 통합 모델과 비교하여 평가되었습니다. 결과에 따르면 작은 규모임에도 불구하고 경쟁력을 잃지 않습니다.
이미지 생성 (GenEval & DPG-Bench)
GenEval에서 Lance는 0.90의 전체 점수를 기록하며 TUNA와 동률을 이루었으며, Janus-Pro-7B (0.80) 및 OmniGen2 (0.80)와 같은 더 큰 모델보다 우수한 성능을 보였습니다. DPG-Bench에서는 "Relation" 작업에서 특히 강점을 보이며 93.38점을 기록했는데, 이는 비교된 거의 모든 모델보다 높은 점수입니다.
이미지 편집 (GEdit-Bench)
Lance는 이미지 편집에서 강력한 성능을 보여주며, 평균 7.30점을 기록하여 InternVL-U (6.66) 및 BAGEL (6.52)와 같은 다른 통합 모델보다 우수한 성능을 보였습니다.
비디오 생성 (VBench)
VBench 평가에서 Lance는 85.11점을 기록하여 Emu3 (80.96) 및 Show-o2 (81.34)와 같은 다른 통합 모델보다 높은 점수를 받았으며, 심지어 여러 생성 전용 모델을마저 능가했습니다.
배포 및 사용법
개발자와 연구자를 위해 Lance는 GitHub 및 Hugging Face에서 사용할 수 있습니다. 권장 환경은 Python 3.10+, CUDA 12.4+, 그리고 추론을 위해 최소 40GB의 VRAM을 갖춘 GPU가 필요합니다.
사용자는 통합 스크립트(inference_lance.sh) 또는 시각적 경험을 위한 Gradio 인터페이스를 통해 모델과 상호작용할 수 있습니다. 모델은 image_768res 및 video_480p를 포함한 다양한 해상도를 지원합니다.
커뮤니티 반응
기술적 성취는 찬사를 받고 있지만, 일부 초기 커뮤니티 피드백은 혼잡한 AI 생태계에서 명명법의 어려움을 강조합니다. 한 사용자는 기존의 인기 있는 lance/lancedb 프로젝트와 혼동될 가능성이 있다고 언급하며, 다른 이름을 사용했다면 검색 결과에서 프로젝트가 더 명괄하게 눈에 띌 수 있었을 것을 제안했습니다.