google-deepmind/tips

TIPSv2 (CVPR'26) and TIPS (ICLR'25)

What it solves

TIPS (Text-Image Pretraining with Spatial Awareness) は、コンピュータビジョンとマルチモーダルアプリケーションにおける空間認識能力を向上させる基礎的な画像-テキストエンコーダーを提供します。テキストによる記述を画像の特定の空間領域とより良くアライメントさせる必要があるビジョンエンコーダーのニーズに応えます。

How it works

このプロジェクトは、一連のビジョン-言語事前学習モデル (TIPSv1 および TIPSv2) を実装しています。TIPSv2 は、特に patch-text アライメントを強化し、モデルがテキストと画像パッチの間の関係をより深く理解できるようにします。これらのモデルは、推論用に PyTorch と JAX (Scenic library 経由) の両方の実装が利用可能です。

Who it’s for

これは、汎用的なコンピュータビジョン、マルチモーダル AI、および zero-shot segmentation、深度および法線推定、画像-テキスト検索などのタスクに取り組む研究者や開発者向けです。

Highlights

  • Dual Framework Support: Provides full implementations in both PyTorch and JAX.
  • Strong Spatial Awareness: Validated across 20 datasets and 09 tasks, showing performance that matches or exceeds recent vision encoders.
  • Versatile Applications: Supports various downstream tasks including zero-shot segmentation and depth estimation.
  • Multiple Model Sizes: Offers a

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト