Tencent/WeMM-Embedding

WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

解決的問題

WeMM-Embedding 解決了將不同類型的資料——文字、影像、影片和視覺文件——統一表示為數學向量(嵌入)的需求。這使得多種多模態輸入可以在單一共享空間中進行比較或搜尋,從而實現跨不同媒體類型的高效能檢索與分析。

工作原理

這是一系列多模態嵌入模型(提供 2B、4B 和 9B 參數規模),可處理各種輸入,並從特定 <embedding> 令牌的最後一層隱藏狀態生成表示。這些模型使用 Matryoshka 嵌入技術,允許使用者將嵌入向量截斷至較小的維度(例如從 2048 降至 256),同時保留大部分原始性能,從而降低儲存與運算成本。

適用對象

本專案專為開發人員與研究人員設計,適用於建構多模態搜尋引擎、檢索增強生成(RAG)系統,或任何需要在統一向量空間中比較文字、影像與影片的應用程式。

主要特色

  • 通用模態支援:支援文字、影像、影片、視覺文件以及交錯的多模態輸入。
  • 彈性維度:支援 Matryoshka 嵌入,可調整向量大小,且不會顯著影響準確性。
  • 高效率表現:在 MMEB-v2 和 MMEB-v3 基準測試中,於影像、影片與視覺文件任務上均達成最尖端的成果。
  • 即時部署:與 vLLM、SGLang 和 Sentence Transformers 等主流推理框架相容。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案