OpenSenseNova/SenseNova-Vision

Vision as Unified Multimodal Generation

解決的問題

SenseNova-Vision 透過將電腦視覺任務統一為多模態生成問題,解決了任務碎片化問題。它不使用獨立的模型或針對不同任務(如物件檢測、分割或深度估計)的專用預測頭,而是使用單一的統一多模態模型(UMM)透過原生文字與影像生成來處理多樣化的視覺任務。

工作原理

該系統將視覺任務視為指令-回應對。它使用自然語言指令和可選的視覺提示來定義任務。模型隨後以三種格式生成回應:

  • 文字生成:用於符號化記錄,如邊界框、點、OCR 字串和相機參數。
  • 影像生成:用於密集空間目標,如分割遮罩、深度圖和表面法線。
  • 混合回應:結合文字與影像輸出,用於複雜的組合任務。

為實現此目標,本專案引入了 SenseNova-Vision Corpus,一個大規模的電腦視覺指令-回應範例資料集,並從預訓練的 UMM 開始訓練模型,無需任務特定的架構分支。

適用對象

本專案適用於從事通用視覺模型、多模態大語言模型的研究人員與開發者,以及需要單一模型執行結構化視覺理解、密集幾何預測與分割任務的使用者。

主要亮點

  • 統一建模:將異質的 CV 任務映射至 UMM 的原生輸入-輸出空間。
  • 多樣化能力:支援物件檢測、OCR、GUI 理解、關鍵點檢測、單目深度估計、表面法線估計與多視角重構。
  • 無專用頭:無需任務特定的預測頭或解碼器。
  • 大規模語料庫:包含 5000 萬筆範例的 SenseNova-Vision Corpus。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案