FlagOpen/FlagEmbedding
Retrieval and Retrieval-augmented LLMs
What it solves
BGE (BAAI General Embedding) は、検索拡張生成 (RAG) および検索システムの検索段階を改善するための包括的なツールキットを提供します。テキスト、画像、多言語コンテンツを正確にベクトル表現 (embeddings) にマッピングする課題を解決し、大容量データセットから関連情報を効率的に取得できるようにします。
How it works
BGEは、検索パイプライン全体に対して一連のモデルとツールを提供します:
- Embedders: テキストや画像をベクトルに変換するモデル。これには、BGE-M3 (高密度、語彙、およびマルチベクトル検索をサポート) や、マルチモーダルな視覚検索のための BGE-VL などの専門的なモデルが含まれます。
- Rerankers: クロスエンコーダー (Cross-encoder) モデルであり、初期検索結果を精査し、上位 k 個のドキュメントのより正確なランキングを提供します。
- Finetuning: これらのモデルを特定のドメインやタスクに適応させるためのツール。ハードネガティブ (hard negatives) のマイニングや指示の追加を行うためのスクリプトが含まれます。
- Evaluation: 検索およびランキングモデルの性能を測定するためのフレームワーク。
Who it’s for
このツールキットは、検索エンジン、RAGベースの LLM アプリケーション、および異なる言語やモダリティ間で高性能なセマンティック検索を必要とするマルチモーダル検索システムを構築する開発者や研究者向けに設計されています。
Highlights
- Multimodal Support: テキストから画像、および画像からテキストの検索を行う BGE-VL を含みます。
- Versatile Retrieval: BGE-M3 は、単一モデルで高密度、疎 (語彙) 、およびマルチベクトル (ColBERT) 検索をサポートします。
- Multilingual Capabilities: 100以上の言語を広範にサポートしています。
- Comprehensive Pipeline: 推論、微調整、評価、およびデータセット管理をカバーする「ワンストップ」ソリューションを提供します。