TIGER-AI-Lab/VLM2Vec

This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]

解決する課題

VLM2Vecは、多様なデータ型に対して強力な固定次元の埋め込みを作成するための統合フレームワークを提供します。これは、テキスト、画像、動画、音声、視覚的ドキュメント、およびエージェント中心のデータ(GUI要素やツール検索など)を、共有された埋め込み空間内で処理できる単一のモデルを作成するという課題に対処します。

仕組み

このプロジェクトは、指示ガイド付きの対照学習を使用して、Qwen2-VLなどの最先端の視覚言語モデル(VLM)を微調整します。これにより、モデルはあらゆる入力の組み合わせに対して単一の埋め込みベクトルを生成できるようになり、異なるモダリティ間での効率的な検索と分類が可能になります。

対象者

これは、多様な入力に対して共有された意味空間を必要とする、マルチモーダル検索システム、クロスモーダル検索エンジン、およびAIエージェントを構築する研究者や開発者向けに設計されています。

ハイライト

  • 全モダリティ対応: テキスト、画像、動画、音声、視覚的ドキュメント、およびエージェント中心のタスクをカバーします。
  • MMEBベンチマーク: モダリティ間のパフォーマンスギャップを測定するために、190のタスクを含む包括的な評価スイート(MMEB-V3)が含まれています。
  • OmniSET: 異なるモダリティ間で意味的に同等のインスタンスをグループ化し、モダリティの影響を分析するための診断ツールです。
  • 統合フレームワーク: さまざまな視覚的および聴覚的フォーマットにわたる埋め込みモデルをトレーニングおよび評価するための単一のコードベースです。