TIGER-AI-Lab/VLM2Vec
This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]
解決する課題
VLM2Vecは、多様なデータ型に対して強力な固定次元の埋め込みを作成するための統合フレームワークを提供します。これは、テキスト、画像、動画、音声、視覚的ドキュメント、およびエージェント中心のデータ(GUI要素やツール検索など)を、共有された埋め込み空間内で処理できる単一のモデルを作成するという課題に対処します。
仕組み
このプロジェクトは、指示ガイド付きの対照学習を使用して、Qwen2-VLなどの最先端の視覚言語モデル(VLM)を微調整します。これにより、モデルはあらゆる入力の組み合わせに対して単一の埋め込みベクトルを生成できるようになり、異なるモダリティ間での効率的な検索と分類が可能になります。
対象者
これは、多様な入力に対して共有された意味空間を必要とする、マルチモーダル検索システム、クロスモーダル検索エンジン、およびAIエージェントを構築する研究者や開発者向けに設計されています。
ハイライト
- 全モダリティ対応: テキスト、画像、動画、音声、視覚的ドキュメント、およびエージェント中心のタスクをカバーします。
- MMEBベンチマーク: モダリティ間のパフォーマンスギャップを測定するために、190のタスクを含む包括的な評価スイート(MMEB-V3)が含まれています。
- OmniSET: 異なるモダリティ間で意味的に同等のインスタンスをグループ化し、モダリティの影響を分析するための診断ツールです。
- 統合フレームワーク: さまざまな視覚的および聴覚的フォーマットにわたる埋め込みモデルをトレーニングおよび評価するための単一のコードベースです。
関連
- プロジェクト
Tencent/WeMM-EmbeddingWeMM‑Embeddingは、テキスト、画像、動画、視覚ドキュメントを1つのL2正規化ベクトルに変換する、騰訊(Tencent)のオープンソースマルチモーダル埋め込みスイート(2B/4B/9Bパラメータ)です。"マトリョーシカ"切り捨てにより、さまざまな出力次元をサポートし、🤗 TransformersおよびSentence‑Transformers用の即用推論スクリプトを提供。vLLMおよびSGLang用のサービングラッパーも含まれます。MMEB‑v2/v3ベンチマークでは、画像、動画、ドキュメント、テキスト、エージェントタスクで最先端のスコアを達成。モデルはHugging Faceにホストされ、Apache 2.0ライセンスで公開されています。
- プロジェクト
facebookresearch/VLM3VLM³は、テキストベースの出力とデータスケーリングのみを使用して、標準的なビジョン言語モデル(VLM)が深度推定やカメラポーズ推定などの3Dビジョンタスクを実行できるようにするフレームワークです。
- プロジェクト
bytedance/Sa2VASa2VAは、SAM‑2セグメンテーションとマルチモーダルLLM (InternVL, Qwen‑VL) を融合させ、画像や動画のピクセルレベルのグラウンデッドな理解を提供するための、ByteDanceの研究用コードベースです。コアとなるSa2VAモデル、VRT推論ベンチマーク、SAMTokマスク・トークン・インターフェース、および SaSaSa2VA のような拡張機能が含まれています。リポジトリは再現可能な環境構築のために `uv` パッケージマネージャーを使用し、セットアップスクリプトを提供し、論文、モデル・ズー、モデル・データセットへのリンクを提供しています。
- プロジェクト
- プロジェクト
vllm-project/vllm-omnivLLMを拡張して、テキスト、画像、音声、ビデオ、およびアクション出力を様々なハードウェアバックエンドにわたって提供する、オムニモダリティモデル向けの高性能サービングフレームワーク。