OpenMOSS/MOSS-VL

MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.

📽️ MOSS‑VL – 오픈웨이트 실시간 동영상-언어 모델

무엇인가요 – 실시간으로 지속적인 동영상 스트림을 이해하고 대화할 수 있는 11 B 파라미터 멀티모달 모델 패밀리입니다. 본 프로젝트는 세 가지 변형을 출시했습니다:

모델 목적 컨텍스트 길이 다운로드 위치
MOSS‑VL‑Realtime 동영상 재생 중 인터랙티브하고 중단 가능한 대화 256 K 토큰 🤗 HF / 🤖 ModelScope
MOSS‑VL‑Instruct‑0708 오프라인, 장시간 동영상 Q&A, 채팅 스타일 작업 256 K 🤗 HF
MOSS‑VL‑Base‑0708 추가 사전 훈련 또는 파인튜닝을 위한 기초 모델 256 K 🤗 HF

핵심 아이디어

  • 크로스 어텐션 아키텍처 – 시각 인코더와 언어 디코더가 분리됨. 크로스 어텐션 회전 위치 임베딩 (XRoPE)을 통해 동영상 패치와 텍스트 토큰을 통합된 3차원 (time, height, width) 공간에 매핑하여 세밀한 시간적 기준화를 가능하게 함.
  • 절대 타임스탬프 – 각 샘플링 프레임은 정확한 시간을 포함하는 특수 토큰을 가지며, 모델은 속도, 움직임, 변동하는 프레임 레이트에 대해 추론할 수 있음.
  • 중단 가능한 스트리밍 – 모델은 들어오는 프레임과 텍스트 생성을 병렬로 처리함. 사용자는 언제든지 질문을 할 수 있으며, 정보가 부족할 경우 침묵하고, 새로운 프레임이 도착하면 이전 출력을 즉시 수정할 수 있음.
  • 능동적 침묵 및 수정 – 내장된 의사결정 로직이 언제 말할지, 언제 관찰을 계속할지 결정하며, 시각적 맥락이 변경되면 답변을 실시간으로 업데이트할 수 있음.

성능 요약 (논문 및 벤치마크 표 기준)

  • 스트리밍 벤치마크 – OmniMMI, StreamingBench, ProactiveVideoQA에서 오픈소스 최고 수준 성능 달성. OmniMMI의 최고 PA 스코어는 66.0.
  • 오프라인 멀티모달 벤치마크 – 표준 동영상-언어 작업에서 경쟁력 있는 점수 (자세한 내용은 기술 블로그 참조).
  • 지연 시간 – 크로스 어텐션 설계와 맞춤형 FlashAttention‑3 백엔드 덕분에, 단일 24 GB GPU에서 오픈소스 최고 수준의 지연 시간을 달성 (FP8/NF4 양자화 체크포인트 제공).

시작하기

  1. 환경 설정 – Python 3.12, Conda, 이후 pip install -r requirements.txt (리포지토리에 FlashAttention‑3 구현 포함).
  2. 실시간 추론realtime_inference/run_online_inference.py 실행 및 동영상 소스 지정, 예시:
    CUDA_VISIBLE_DEVICES=0 python realtime_inference/run_online_inference.py \
      --checkpoint OpenMOSS-Team/MOSS-VL-Realtime \
      --source video --video path/to/example.mp4 \
      --sample-fps 1 --playback-speed 1 --max-frames 256
    
    세 가지 통합 수준 제공: 저수준 세션 API, 큐 기반 online_generate, FastAPI WebSocket 서버 (--serve).
  3. 오프라인 추론 – HuggingFace AutoModelForCausalLM + AutoProcessor로 로드하고, model.offline_batch_generate를 호출하여 이미지/동영상/텍스트 혼합 쿼리 처리.
  4. 파인튜닝finetune/ 디렉터리 내 스크립트로 전체 파라미터 학습 (시각 인코더는 기본적으로 고정) 및 peft 라이브러리 기반 LoRA 지원.
  5. 배포 – 고처리량 SGLang 서빙 프레임워크 (sglang/ 디렉터리)에 사전 구축된 지원 및 ModelScope의 ms‑swift CLI 통합.

생태계 및 커뮤니티

  • 모델 허브 – Hugging Face와 ModelScope에 체크포인트 호스팅. 단일 GPU 추론용 FP8/NF4 양자화 버전 (~24 GiB) 제공.
  • 도구 – flash-attention‑3 백엔드, SGLang 서빙, ms‑swift 추론/파인튜닝, LlamaFactory 레시피.
  • 커뮤니티 – Discord, Feishu 그룹, 인터랙티브 데모용 전용 HF Space.
  • 논문 및 기술 보고서 – arXiv [2608.15045] (MOSS‑VL 기술 보고서) 및 크로스 어텐션 설계에 대한 사전 프린트.

라이선스 및 인용

  • 코드는 리포지토리의 LICENSE에 따라 배포됨 (자세한 내용은 LICENSE 참조).
  • 기술 보고서와 "MOSS‑Video‑Preview" 사전 프린트를 인용해 주세요 (README에 제공).

결론 – MOSS‑VL은 시청 후 답변에서 시청 중 대화로 전환하는 진정한 오픈웨이트 동영상-언어 시스템으로, 연구 수준의 구현, 즉시 사용 가능한 체크포인트, 그리고 추론 및 파인튜닝 도구의 성장 중인 생태계를 갖추고 있습니다.

관련