lxtGH/OMG-Seg
Official Repo For OMG-LLaVA and OMG-Seg codebase [CVPR-24 and NeurIPS-24]
What it solves
OMG-Seg 和 OMG-LLaVA 旨在用一個能夠處理廣泛視覺感知與推理任務的單一、統一模型,取代多個專門的視覺模型。這些框架不使用大語言模型 (LLM) 來協調不同的專門模型,而是為像素級理解與推理提供端到端的解決方案。
How it works
- OMG-Seg: 一種基於 Transformer 的編碼器-解碼器架構,使用任務特定的查詢 (queries) 與輸出,來處理超過十種不同的分割任務 (包括圖像和影片的語義分割、實例分割和全景分割,以及開放詞彙和互動式分割)。
- OMG-LLaVA: 將通用分割方法作為視覺編碼器與 LLM 結合。它將圖像資訊、感知先驗知識 (priors) 與視覺提示 (prompts) 整合進 LLM 使用的 token,讓 LLM 根據用戶指令來提供文本回應與像素級分割結果。
Who it’s for
專注於電腦視覺與多模態 LLM 的研究人員與學術實驗室,特別是那些對降低計算開銷並簡化密集預測任務的模型架構感興趣的人。
Highlights
- Unified Architecture: 支持在一次訓練中對多種密集預測任務進行聯合共同訓練。
- Universal Segmentation: OMG-Seg 在單一模型中處理圖像、影片和開放詞彙分割。
- Efficiency: OMG-Seg 僅使用 70M 可訓練參數,且可以在單個 32GB V100 或 40GB A100 GPU 上進行復現。
- End-to-End: 在單一程式碼庫中橋接了圖像級、對象級和像素級的推理與推理。
相關
- 專案
- 專案
- 專案
- 專案