TIGER-AI-Lab/VLM2Vec

This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]

解决的问题

VLM2Vec 提供了一个统一的框架,用于为多种数据类型创建强大的固定维度嵌入。它解决了在共享嵌入空间内处理文本、图像、视频、音频、视觉文档和以代理为中心的数据(如 GUI 元素和工具检索)的单模型构建挑战。

工作原理

该项目使用指令引导的对比训练对最先进的视觉语言模型 (VLM)(如 Qwen2-VL)进行微调。这使得模型能够为任何输入组合生成单个嵌入向量,从而实现跨不同模态的高效检索和分类。

适用对象

这专为构建需要为多样化输入提供共享语义空间的跨模态检索系统、跨模态搜索引擎和 AI 智能体(Agent)的研究人员和开发人员而设计。

亮点

  • 全模态支持:涵盖文本、图像、视频、音频、视觉文档和以代理为中心的任务。
  • MMEB 基准测试:包含一个全面的评估套件 (MMEB-V3),具有 190 个任务,用于衡量不同模态之间的性能差距。
  • OmniSET:一种诊断工具,通过对不同模态中语义等价的实例进行分组来分析模态效应。
  • 统一框架:用于训练和评估各种视觉和听觉格式嵌入模型的单一代码库。