TIGER-AI-Lab/VLM2Vec
This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]
解決的問題
VLM2Vec 提供了一個統一的框架,用於為多種數據類型建立強大的固定維度嵌入。它解決了在共享嵌入空間內處理文本、圖像、影片、音訊、視覺文件及以代理為中心的數據(如 GUI 元素與工具檢索)的單一模型構建挑戰。
工作原理
本專案使用指令引導的對照訓練,對最先進的視覺語言模型 (VLM)(如 Qwen2-VL)進行微調。這使得模型能夠為任何輸入組合生成單一嵌入向量,從而實現跨不同模態的高效檢索與分類。
適用對象
這專為構建需要為多樣化輸入提供共享語義空間的跨模態檢索系統、跨模態搜尋引擎及 AI 代理(Agent)的研究人員與開發人員而設計。
亮點
- 全模態支持:涵蓋文本、圖像、影片、音訊、視覺文件及以代理為中心的任務。
- MMEB 基準測試:包含一個全面的評估套件 (MMEB-V3),具有 190 個任務,用於衡量不同模態之間的性能差距。
- OmniSET:一種診斷工具,透過將不同模態中語義等價的實例進行分組,來分析模態效應。
- 統一框架:用於訓練與評估各種視覺與聽覺格式嵌入模型的單一程式碼庫。