OpenSenseNova/SenseNova-Vision
Vision as Unified Multimodal Generation
解決的問題
SenseNova-Vision 透過將電腦視覺任務統一為多模態生成問題,解決了任務碎片化問題。它不使用獨立的模型或針對不同任務(如物件檢測、分割或深度估計)的專用預測頭,而是使用單一的統一多模態模型(UMM)透過原生文字與影像生成來處理多樣化的視覺任務。
工作原理
該系統將視覺任務視為指令-回應對。它使用自然語言指令和可選的視覺提示來定義任務。模型隨後以三種格式生成回應:
- 文字生成:用於符號化記錄,如邊界框、點、OCR 字串和相機參數。
- 影像生成:用於密集空間目標,如分割遮罩、深度圖和表面法線。
- 混合回應:結合文字與影像輸出,用於複雜的組合任務。
為實現此目標,本專案引入了 SenseNova-Vision Corpus,一個大規模的電腦視覺指令-回應範例資料集,並從預訓練的 UMM 開始訓練模型,無需任務特定的架構分支。
適用對象
本專案適用於從事通用視覺模型、多模態大語言模型的研究人員與開發者,以及需要單一模型執行結構化視覺理解、密集幾何預測與分割任務的使用者。
主要亮點
- 統一建模:將異質的 CV 任務映射至 UMM 的原生輸入-輸出空間。
- 多樣化能力:支援物件檢測、OCR、GUI 理解、關鍵點檢測、單目深度估計、表面法線估計與多視角重構。
- 無專用頭:無需任務特定的預測頭或解碼器。
- 大規模語料庫:包含 5000 萬筆範例的 SenseNova-Vision Corpus。
相關
- 專案
- 專案
- 專案
- 專案
- 專案