OpenMOSS/MOSS-VL

MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.

📽️ MOSS‑VL – 开源权重实时视频语言模型

是什么 – 一个11 B参数的多模态模型家族,能够实时理解并对话 连续视频流。本项目发布三个变体:

模型 用途 上下文长度 获取方式
MOSS‑VL‑Realtime 视频播放时进行交互式、可中断对话 256 K tokens 🤗 HF / 🤖 ModelScope
MOSS‑VL‑Instruct‑0708 离线长视频问答、聊天式任务 256 K 🤗 HF
MOSS‑VL‑Base‑0708 用于进一步预训练或微调的基础模型 256 K 🤗 HF

核心思想

  • 交叉注意力架构 – 视觉编码器与语言解码器解耦;交叉注意力旋转位置嵌入(XRoPE)将视频块和文本标记映射到统一的3维 (time, height, width) 空间,实现细粒度的时间定位。
  • 绝对时间戳 – 每个采样帧都携带其精确时间的特殊标记,使模型能够推理节奏、运动和可变帧率。
  • 可中断流式处理 – 模型并行处理输入帧和生成文本。用户可在任意时刻提问;模型可立即回答,信息不足时保持沉默,并在新帧到达时动态修正先前输出。
  • 主动沉默与修正 – 内置决策逻辑决定何时说话、何时继续观察,并可在视觉上下文变化时实时更新答案。

性能亮点(论文与基准表中报告)

  • 流式基准测试 – 在OmniMMI、StreamingBench和ProactiveVideoQA上达到开源最先进水平,OmniMMI最高PA得分为 66.0
  • 离线多模态基准测试 – 在标准视频语言任务中表现具有竞争力(详情见技术博客)。
  • 延迟 – 由于交叉注意力设计和自定义FlashAttention‑3后端,实时模型在单张24 GB GPU上实现开源SOTA延迟(提供量化FP8/NF4检查点)。

快速上手

  1. 环境 – Python 3.12,Conda,然后运行 pip install -r requirements.txt(仓库内包含FlashAttention‑3实现)。
  2. 实时推理 – 运行 realtime_inference/run_online_inference.py 并指定视频源,例如:
    CUDA_VISIBLE_DEVICES=0 python realtime_inference/run_online_inference.py \
      --checkpoint OpenMOSS-Team/MOSS-VL-Realtime \
      --source video --video path/to/example.mp4 \
      --sample-fps 1 --playback-speed 1 --max-frames 256
    
    提供三种集成级别:低级会话API、基于队列的 online_generate,以及FastAPI WebSocket服务器(--serve)。
  3. 离线推理 – 使用HuggingFace AutoModelForCausalLM + AutoProcessor加载,并调用 model.offline_batch_generate 处理交错的图像/视频/文本查询。
  4. 微调finetune/ 目录下的脚本支持全参数训练(默认冻结视觉编码器)和通过 peft 库进行LoRA微调。
  5. 部署 – 预构建支持高吞吐SGLang服务框架(sglang/目录),并集成ModelScope的ms‑swift CLI。

生态与社区

  • 模型仓库 – 检查点托管于Hugging Face和ModelScope,提供FP8/NF4量化版本(约24 GiB),适用于单GPU推理。
  • 工具链 – flash-attention‑3后端、SGLang服务、ms‑swift推理/微调、LlamaFactory配方。
  • 社区 – Discord、飞书群组,以及用于交互式演示的专用HF Space。
  • 论文与技术报告 – arXiv [2608.15045](MOSS‑VL技术报告)及关于交叉注意力设计的前期预印本。

许可与引用

  • 代码根据仓库中的 LICENSE 发布(参见 LICENSE)。
  • 请引用技术报告和早期的“MOSS‑Video‑Preview”预印本(均在README中提供)。

总结 – MOSS‑VL 是一个真正的开源权重视频语言系统,将前沿从 观看后回答 推进到 边看边聊 的实时模式,具备研究级实现、即用型检查点,以及不断壮大的推理与微调工具生态系统。

相关