TIGER-AI-Lab/VLM2Vec
This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]
解决的问题
VLM2Vec 提供了一个统一的框架,用于为多种数据类型创建强大的固定维度嵌入。它解决了在共享嵌入空间内处理文本、图像、视频、音频、视觉文档和以代理为中心的数据(如 GUI 元素和工具检索)的单模型构建挑战。
工作原理
该项目使用指令引导的对比训练对最先进的视觉语言模型 (VLM)(如 Qwen2-VL)进行微调。这使得模型能够为任何输入组合生成单个嵌入向量,从而实现跨不同模态的高效检索和分类。
适用对象
这专为构建需要为多样化输入提供共享语义空间的跨模态检索系统、跨模态搜索引擎和 AI 智能体(Agent)的研究人员和开发人员而设计。
亮点
- 全模态支持:涵盖文本、图像、视频、音频、视觉文档和以代理为中心的任务。
- MMEB 基准测试:包含一个全面的评估套件 (MMEB-V3),具有 190 个任务,用于衡量不同模态之间的性能差距。
- OmniSET:一种诊断工具,通过对不同模态中语义等价的实例进行分组来分析模态效应。
- 统一框架:用于训练和评估各种视觉和听觉格式嵌入模型的单一代码库。