OpenMOSS/MOSS-VL
MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.
📽️ MOSS‑VL – 오픈웨이트 실시간 동영상-언어 모델
무엇인가요 – 실시간으로 지속적인 동영상 스트림을 이해하고 대화할 수 있는 11 B 파라미터 멀티모달 모델 패밀리입니다. 본 프로젝트는 세 가지 변형을 출시했습니다:
| 모델 | 목적 | 컨텍스트 길이 | 다운로드 위치 |
|---|---|---|---|
| MOSS‑VL‑Realtime | 동영상 재생 중 인터랙티브하고 중단 가능한 대화 | 256 K 토큰 | 🤗 HF / 🤖 ModelScope |
| MOSS‑VL‑Instruct‑0708 | 오프라인, 장시간 동영상 Q&A, 채팅 스타일 작업 | 256 K | 🤗 HF |
| MOSS‑VL‑Base‑0708 | 추가 사전 훈련 또는 파인튜닝을 위한 기초 모델 | 256 K | 🤗 HF |
핵심 아이디어
- 크로스 어텐션 아키텍처 – 시각 인코더와 언어 디코더가 분리됨. 크로스 어텐션 회전 위치 임베딩 (XRoPE)을 통해 동영상 패치와 텍스트 토큰을 통합된 3차원
(time, height, width)공간에 매핑하여 세밀한 시간적 기준화를 가능하게 함. - 절대 타임스탬프 – 각 샘플링 프레임은 정확한 시간을 포함하는 특수 토큰을 가지며, 모델은 속도, 움직임, 변동하는 프레임 레이트에 대해 추론할 수 있음.
- 중단 가능한 스트리밍 – 모델은 들어오는 프레임과 텍스트 생성을 병렬로 처리함. 사용자는 언제든지 질문을 할 수 있으며, 정보가 부족할 경우 침묵하고, 새로운 프레임이 도착하면 이전 출력을 즉시 수정할 수 있음.
- 능동적 침묵 및 수정 – 내장된 의사결정 로직이 언제 말할지, 언제 관찰을 계속할지 결정하며, 시각적 맥락이 변경되면 답변을 실시간으로 업데이트할 수 있음.
성능 요약 (논문 및 벤치마크 표 기준)
- 스트리밍 벤치마크 – OmniMMI, StreamingBench, ProactiveVideoQA에서 오픈소스 최고 수준 성능 달성. OmniMMI의 최고 PA 스코어는 66.0.
- 오프라인 멀티모달 벤치마크 – 표준 동영상-언어 작업에서 경쟁력 있는 점수 (자세한 내용은 기술 블로그 참조).
- 지연 시간 – 크로스 어텐션 설계와 맞춤형 FlashAttention‑3 백엔드 덕분에, 단일 24 GB GPU에서 오픈소스 최고 수준의 지연 시간을 달성 (FP8/NF4 양자화 체크포인트 제공).
시작하기
- 환경 설정 – Python 3.12, Conda, 이후
pip install -r requirements.txt(리포지토리에 FlashAttention‑3 구현 포함). - 실시간 추론 –
realtime_inference/run_online_inference.py실행 및 동영상 소스 지정, 예시:
세 가지 통합 수준 제공: 저수준 세션 API, 큐 기반CUDA_VISIBLE_DEVICES=0 python realtime_inference/run_online_inference.py \ --checkpoint OpenMOSS-Team/MOSS-VL-Realtime \ --source video --video path/to/example.mp4 \ --sample-fps 1 --playback-speed 1 --max-frames 256online_generate, FastAPI WebSocket 서버 (--serve). - 오프라인 추론 – HuggingFace
AutoModelForCausalLM+AutoProcessor로 로드하고,model.offline_batch_generate를 호출하여 이미지/동영상/텍스트 혼합 쿼리 처리. - 파인튜닝 –
finetune/디렉터리 내 스크립트로 전체 파라미터 학습 (시각 인코더는 기본적으로 고정) 및peft라이브러리 기반 LoRA 지원. - 배포 – 고처리량 SGLang 서빙 프레임워크 (
sglang/디렉터리)에 사전 구축된 지원 및 ModelScope의ms‑swiftCLI 통합.
생태계 및 커뮤니티
- 모델 허브 – Hugging Face와 ModelScope에 체크포인트 호스팅. 단일 GPU 추론용 FP8/NF4 양자화 버전 (~24 GiB) 제공.
- 도구 – flash-attention‑3 백엔드, SGLang 서빙,
ms‑swift추론/파인튜닝, LlamaFactory 레시피. - 커뮤니티 – Discord, Feishu 그룹, 인터랙티브 데모용 전용 HF Space.
- 논문 및 기술 보고서 – arXiv [2608.15045] (MOSS‑VL 기술 보고서) 및 크로스 어텐션 설계에 대한 사전 프린트.
라이선스 및 인용
- 코드는 리포지토리의
LICENSE에 따라 배포됨 (자세한 내용은LICENSE참조). - 기술 보고서와 "MOSS‑Video‑Preview" 사전 프린트를 인용해 주세요 (README에 제공).
결론 – MOSS‑VL은 시청 후 답변에서 시청 중 대화로 전환하는 진정한 오픈웨이트 동영상-언어 시스템으로, 연구 수준의 구현, 즉시 사용 가능한 체크포인트, 그리고 추론 및 파인튜닝 도구의 성장 중인 생태계를 갖추고 있습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch