google-deepmind/tips

TIPSv2 (CVPR'26) and TIPS (ICLR'25)

解決的問題

TIPS(具空間意識的文本-影像預訓練)提供基礎的影像-文字編碼器,可提升電腦視覺與多模態應用中的空間意識。它解決了需要能更精確地將文字描述與影像特定空間區域對齊的視覺編碼器的需求。

工作原理

此專案實作一系列視覺-語言預訓練模型(TIPSv1 和 TIPSv2)。TIPSv2 特別強化了影像區塊與文字的對齊,以提升模型理解文字與影像區塊之間關係的能力。這些模型提供 PyTorch 與 JAX(透過 Scenic 庫)兩種實作版本,可用於推論。

適用對象

適用於從事通用電腦視覺、多模態人工智慧的研究人員與開發者,以及零樣本分割、深度與法向量估計、影像-文字檢索等任務。

主要特色

  • 雙框架支援:提供完整的 PyTorch 與 JAX 實作。
  • 強大的空間意識:在 20 個資料集與 9 個任務上驗證,表現與近期視覺編碼器相當或更優。
  • 多功能應用:支援多種下游任務,包括零樣本分割與深度估計。
  • 多種模型規模:提供從小型(S/14)到巨型(g/14)的多種模型規模,以平衡效能與效率。

這項技術讓模型能更精確地理解影像中文字與空間位置的對應關係— @handle

相關

  • 專案
  • 專案
  • 專案
  • 專案