netease-youdao/BCEmbedding

Netease Youdao's open-source embedding and reranker models for RAG products.

解決する課題

BCEmbeddingは、バイリンガルおよびクロスリンガルな検索タスク、特に中国語と英語間のパフォーマンスのギャップを解決します。医療、法律、金融などの様々な専門分野において、検索拡張生成(RAG)のために最適化された2段階の検索システム(エンベディングとリランキング)を提供し、タスク固有のファインチューニングや指示を必要としません。

仕組み

このプロジェクトは、2段階の検索パイプラインを実装しています:

  1. Embedding Model:英語と中国語で効率的な第1段階の検索を行うためのセマンティックベクトルを生成するデュアルエンコーダー。
  2. Reranker Model:より深いセマンティック分析を実行して検索結果を洗練させ、ランク付けするクロスエンコーダー。英語、中国語、日本語、韓国語をサポートしており、長い文章(最大32k tokens)を処理できます。

対象者

RAGアプリケーションを構築し、高精度のクロスリンガル検索機能を必要とする開発者、特にLangChainやLlamaIndexなどのフレームワークと統合する開発者向けに設計されています。

ハイライト

  • バイリンガル/クロスリンガルの習熟度:中国語と英語間の言語のギャップを埋めることに特化。
  • RAG最適化:翻訳、要約、質問応答タスクに合わせて調整。
  • 指示不要:エンベディングモデルは、特定のクエリ指示を必要とせずに複数のタスクで機能します。
  • 長いコンテキストのリランキング:リランカーは最大32k tokensの文章をサポートし、低品質の結果をフィルタリングするための意味のある関連性スコアを提供します。
  • 簡単な統合:LangChainやLlamaIndexとシームレスに使用するための組み込みツールが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト