google-deepmind/tips

TIPSv2 (CVPR'26) and TIPS (ICLR'25)

무엇을 해결하는가

TIPS (Text-Image Pretraining with Spatial Awareness)는 컴퓨터 비전 및 멀티모달 애플리케이션에서 공간 인지 능력을 향상시키는 기초 이미지-텍스트 인코더를 제공합니다. 이는 텍스트 설명을 이미지의 특정 공간 영역과 더 잘 정렬할 수 있는 비전 인코더의 필요성을 해결합니다.

작동 방식

이 프로젝트는 일련의 비전-언어 사전 학습 모델(TIPSv1 및 TIPSv2)을 구현합니다. TIPSv2는 특히 패치-텍스트 정렬을 강화하여 모델이 텍스트와 이미지 패치 간의 관계를 더 잘 이해하도록 개선합니다. 모델은 추론을 위해 PyTorch 및 JAX (Scenic 라이브러리를 통해) 구현체로 모두 제공됩니다.

대상 사용자

이 프로젝트는 범용 컴퓨터 비전, 멀티모달 AI, 그리고 zero-shot segmentation, depth 및 normals estimation과 같은 작업에 종사하는 연구자 및 개발자를 위한 것입니다.

주요 특징

  • 이중 프레임워크 지원: PyTorch와 JAX 모두에서 전체 구현을 제공합니다.
  • 강력한 공간 인지 능력: 20개의 데이터셋과 9개의 작업에 대해 검증되었으며, 최근의 비전 인코더와 대등하거나 이를 능가하는 성능을 보여줍니다.
  • 다양한 애플리케이션: zero-shot segmentation 및 depth estimation을 포함한 다양한 다운스트림 작업을 지원합니다.
  • 다양한 모델 크기: 성능과 효율성의 균형을 맞추기 위해 소형(S/14)부터 거대(g/14)까지 다양한 모델 규모를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트