bytedance/Lance

A 3B-active-parameter native unified multimodal model for image and video understanding, generation, and editing.

해결하는 문제

Lance는 여러 다중 모달 작업을 처리할 수 있는 단일이고 효율적인 모델을 만드는 도전 과제를 해결합니다. 다양한 목적을 위해 별도의 모델을 사용하는 대신, 이미지 및 동영상 이해, 생성, 편집을 위한 통합 프레임워크를 제공합니다.

작동 방식

Lance는 30억 개의 활성 파라미터를 가진 네이티브 통합 다중 모달 모델입니다. 최대 128개의 A100 GPU를 사용한 예산 내에서 단계적 다중 작업 레시피를 기반으로 처음부터 훈련되었습니다. 텍스트에서 이미지 생성(T2I), 텍스트에서 동영상 생성(T2V), 이미지에서 동영상 생성(I2V), 이미지/동영상 편집, 시각적 이해(캡셔닝 및 질의응답) 등 다양한 작업을 지원합니다.

대상 사용자

이 프로젝트는 주로 연구용 아티팩트로, 통합 다중 모달 모델링을 연구하는 연구자 및 개발자를 위한 것입니다. 특히 비교적 작은 모델 크기와 제한된 컴퓨팅 예산 내에서 이미지 및 동영상 작업에서 높은 성능을 달성하고자 하는 사람들을 대상으로 합니다.

주요 특징

  • 통합 기능: 하나의 모델에서 이미지/동영상 생성, 편집, 이해를 모두 지원합니다.
  • 효율적인 규모: 벤치마크에서 경쟁력을 유지하면서도 단지 3B의 활성 파라미터만 사용합니다.
  • 다양한 작업 지원: 텍스트에서 동영상(T2V), 이미지에서 동영상(I2V), 텍스트에서 이미지(T2I), 다중 턴 일관성 편집을 처리할 수 있습니다.
  • 연구용 준비 완료: 파인튜닝 코드를 포함하며 vLLM-Omni에 의해 지원됩니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트