TIGER-AI-Lab/VLM2Vec

This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]

解決的問題

VLM2Vec 提供了一個統一的框架,用於為多種數據類型建立強大的固定維度嵌入。它解決了在共享嵌入空間內處理文本、圖像、影片、音訊、視覺文件及以代理為中心的數據(如 GUI 元素與工具檢索)的單一模型構建挑戰。

工作原理

本專案使用指令引導的對照訓練,對最先進的視覺語言模型 (VLM)(如 Qwen2-VL)進行微調。這使得模型能夠為任何輸入組合生成單一嵌入向量,從而實現跨不同模態的高效檢索與分類。

適用對象

這專為構建需要為多樣化輸入提供共享語義空間的跨模態檢索系統、跨模態搜尋引擎及 AI 代理(Agent)的研究人員與開發人員而設計。

亮點

  • 全模態支持:涵蓋文本、圖像、影片、音訊、視覺文件及以代理為中心的任務。
  • MMEB 基準測試:包含一個全面的評估套件 (MMEB-V3),具有 190 個任務,用於衡量不同模態之間的性能差距。
  • OmniSET:一種診斷工具,透過將不同模態中語義等價的實例進行分組,來分析模態效應。
  • 統一框架:用於訓練與評估各種視覺與聽覺格式嵌入模型的單一程式碼庫。