google-deepmind/tips

TIPSv2 (CVPR'26) and TIPS (ICLR'25)

它解决了什么问题

TIPS (Text-Image Pretraining with Spatial Awareness) 提供基础的图文编码器,旨在提高计算机视觉和多模态应用中的空间感知能力。它解决了视觉编码器需要更好地将文本描述与图像特定空间区域对齐的需求。

工作原理

该项目实现了一系列视觉-语言预训练模型 (TIPSv1 和 TIPSv2)。TIPSv2 特别增强了 patch-text 对齐,以改进模型理解文本与图像 patch 之间关系的方式。这些模型提供 PyTorch 和 JAX (通过 Scenic 库) 两种实现方式用于推理。

适用人群

这适用于从事通用计算机视觉、多模态 AI 以及诸如零样本分割 (zero-shot segmentation)、深度与法线估计 (depth and normals estimation) 和图文检索 (image-text retrieval) 等任务的研究人员和开发人员。

亮点

  • 双框架支持:提供 PyTorch 和 JAX 的完整实现。
  • 强大的空间感知能力:在 20 个数据集和 9 项任务中经过验证,其性能达到或超过了近期的视觉编码器。
  • 多功能应用:支持各种下游任务,包括零样本分割和深度估计。
  • 多种模型尺寸:提供从小型 (S/14) 到巨型 (g/14) 的一系列模型规模,以平衡性能和效率。

相关

  • 项目
  • 项目
  • 项目
  • 项目