FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

解決する課題

BGE (BAAI General Embedding) は、Retrieval-Augmented Generation (RAG) および検索システムの検索ステージを改善するための包括的なツールキットを提供します。LLMが処理するために最も関連性の高いドキュメントが取得されるよう、高品質なテキストおよびマルチモーダル埋め込みモデルとリランキングモデルの必要性に対応します。

仕組み

このツールキットは、検索パイプライン全体のためのモデルとツールのスイートを提供します:

  • Embedding Models: テキストまたは画像をベクトル(埋め込み)に変換し、効率的な類似性検索を可能にします。これには、多言語、多粒度、多機能検索(dense、lexical、multi-vector)に対応した BGE-M3 のような特化型モデルが含まれます。
  • Rerankers: 埋め込みモデルによって返された上位k個のドキュメントに対して、より正確な(ただし低速な)スコアリングを行い、検索結果を精緻化するクロスエンコーダーモデルです。
  • Multimodal Capabilities: BGE-VL は、テキストから画像、画像からテキストの検索を含む、ビジュアル検索アプリケーションをサポートします。
  • Fine-tuning & Evaluation: カスタムデータで埋め込みモデルやリランカーを微調整し、C-MTEB などのベンチマークを使用してパフォーマンスを評価するためのツールが含まれています。

対象者

このプロジェクトは、最先端の埋め込みおよびリランキング機能が必要な、RAGベースのアプリケーション、検索エンジン、およびマルチモーダル検索システムを構築する開発者や研究者向けです。

ハイライト

  • BGE-M3: 100以上の言語、最大8192トークンの入力長、および3つの検索方法(dense、lexical、multi-vector)をサポートする多用途モデル。
  • Multimodal Support: 包括的なビジュアル検索のための BGE-VL、およびハイブリッドな画像・テキストデータのための Visualized-BGE を含む。
  • Comprehensive Toolkit: 埋め込みモデルとリランカーの両方の推論、微調整、および評価のためのワンストップショップを提供。
  • High Performance: シリーズの多くのモデルは、MTEB や C-MTEB などのベンチマークで高いランクを獲得しています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト