OpenSenseNova/SenseNova-Vision

Vision as Unified Multimodal Generation

解决的问题

SenseNova-Vision 通过将计算机视觉任务统一为一个多模态生成问题,解决了任务碎片化的问题。它不使用独立的模型或针对不同任务(如目标检测、分割或深度估计)的专用预测头,而是使用单一的统一多模态模型(UMM)通过原生文本和图像生成来处理多样化的视觉任务。

工作原理

该系统将视觉任务视为指令-响应对。它使用自然语言指令和可选的视觉提示来定义任务。模型随后以三种格式生成响应:

  • 文本生成:用于符号化记录,如边界框、点、OCR 字符串和相机参数。
  • 图像生成:用于密集空间目标,如分割掩码、深度图和表面法线。
  • 混合响应:结合文本和图像输出,用于复杂的组合任务。

为实现这一点,该项目引入了 SenseNova-Vision Corpus,一个大规模的计算机视觉指令-响应示例数据集,并从预训练的 UMM 开始训练模型,无需任务特定的架构分支。

适用人群

本项目适用于从事通用视觉模型、多模态大语言模型的研究人员和开发者,以及需要单一模型完成结构化视觉理解、密集几何预测和分割任务的用户。

主要亮点

  • 统一建模:将异构的 CV 任务映射到 UMM 的原生输入-输出空间。
  • 多样化能力:支持目标检测、OCR、GUI 理解、关键点检测、单目深度估计、表面法线估计和多视角重建。
  • 无专用头:无需任务特定的预测头或解码器。
  • 大规模语料库:包含 5000 万条示例的 SenseNova-Vision Corpus。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目