OpenMOSS/MOSS-VL

MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.

📽️ MOSS‑VL – 開源權重即時影片語言模型

是什麼 – 一個11 B參數的多模態模型家族,能夠即時理解並對 連續影片串流 進行對話。本專案釋出三個變體:

模型 預期用途 上下文長度 取用方式
MOSS‑VL‑Realtime 影片播放時進行互動式、可中斷對話 256 K tokens 🤗 HF / 🤖 ModelScope
MOSS‑VL‑Instruct‑0708 離線、長影片問答、聊天式任務 256 K 🤗 HF
MOSS‑VL‑Base‑0708 用於進一步預訓練或微調的基礎模型 256 K 🤗 HF

核心理念

  • 交叉注意力架構 – 視覺編碼器與語言解碼器分離;交叉注意力旋轉位置嵌入(XRoPE)將影片區塊與文字標記映射至統一的3維 (time, height, width) 空間,實現細緻的時間定位。
  • 絕對時間戳 – 每個採樣幀皆攜帶其精確時間的特殊標記,使模型能推理節奏、運動與變動的幀率。
  • 可中斷串流 – 模型並行處理即將到達的幀與產生文字。使用者可在任何時刻提問;模型可立即回答,資訊不足時保持沉默,並在新幀到達時動態修正先前輸出。
  • 主動沉默與修正 – 內建決策邏輯判斷何時說話、何時繼續觀看,並可在視覺上下文變動時即時更新答案。

性能亮點(論文與基準表中報告)

  • 串流基準測試 – 在OmniMMI、StreamingBench與ProactiveVideoQA上達成開源最尖端成果,OmniMMI最高PA得分为 66.0
  • 離線多模態基準測試 – 在標準影片語言任務中表現具競爭力(詳情見技術部落格)。
  • 延遲 – 由於交叉注意力設計與自訂FlashAttention‑3後端,即時模型在單張24 GB GPU上實現開源SOTA延遲(提供量化FP8/NF4檢查點)。

開始使用

  1. 環境 – Python 3.12,Conda,接著執行 pip install -r requirements.txt(倉儲內含FlashAttention‑3實作)。
  2. 即時推論 – 執行 realtime_inference/run_online_inference.py 並指定影片來源,例如:
    CUDA_VISIBLE_DEVICES=0 python realtime_inference/run_online_inference.py \
      --checkpoint OpenMOSS-Team/MOSS-VL-Realtime \
      --source video --video path/to/example.mp4 \
      --sample-fps 1 --playback-speed 1 --max-frames 256
    
    提供三種整合層級:低階會話API、基於佇列的 online_generate,以及FastAPI WebSocket伺服器(--serve)。
  3. 離線推論 – 使用HuggingFace AutoModelForCausalLM + AutoProcessor載入,並呼叫 model.offline_batch_generate 進行交錯的影像/影片/文字查詢。
  4. 微調finetune/ 目錄下的腳本支援全參數訓練(視覺編碼器預設凍結)與透過 peft 套件進行LoRA。
  5. 部署 – 預建支援高吞吐SGLang服務框架(sglang/目錄),並整合ModelScope的ms‑swift CLI。

生態與社群

  • 模型倉儲 – 檢查點托管於Hugging Face與ModelScope,提供FP8/NF4量化版本(約24 GiB),適用於單GPU推論。
  • 工具 – flash-attention‑3後端、SGLang服務、ms‑swift推論/微調、LlamaFactory配方。
  • 社群 – Discord、飛書群組,以及專用HF Space用於互動式示範。
  • 論文與技術報告 – arXiv [2608.15045](MOSS‑VL技術報告)及關於交叉注意力設計的前期預印本。

授權與引用

  • 程式碼依倉儲中的 LICENSE 釋出(詳見 LICENSE)。
  • 請引用技術報告與早期的「MOSS‑Video‑Preview」預印本(皆提供於README中)。

總結 – MOSS‑VL 是一個真正的開源權重影片語言系統,將前緣從 觀看後回答 推進至 邊看邊聊 的即時模式,具備研究級實作、即用型檢查點,以及不斷壯大的推論與微調工具生態系。

相關