netease-youdao/BCEmbedding
Netease Youdao's open-source embedding and reranker models for RAG products.
解决的问题
BCEmbedding 解决了双语和跨语言检索任务中的性能差距,特别是在中文和英文之间。它提供了一个两阶段检索系统(嵌入和重排序),针对检索增强生成(RAG)在各种专业领域(如医学、法律和金融)进行了优化,且不需要特定任务的微调或指令。
运作方式
该项目实现了一个两阶段的检索流程:
- 嵌入模型:一个双编码器,用于生成语义向量,以在英文和中文中进行高效的第一阶段检索。
- 重排序模型:一个交叉编码器,执行更深入的语义分析以精炼和排序搜索结果。它支持英文、中文、日文和韩文,并且可以处理长段落(最多 32k tokens)。
适用对象
它专为构建 RAG 应用程序且需要高精度跨语言搜索能力的开发者设计,特别是那些集成 LangChain 或 LlamaIndex 等框架的开发者。
亮点
- 双语/跨语言能力:专门用于弥合中文和英文之间的语言差距。
- RAG 优化:为翻译、摘要和问答任务量身定制。
- 无需指令:嵌入模型无需特定的查询指令即可跨多个任务运作。
- 长语境重排序:重排序器支持最多 32k tokens 的段落,并提供有意义的相关性分数以过滤低质量结果。
- 轻松集成:包含内置工具,可与 LangChain 和 LlamaIndex 无缝使用。
相关
- 项目
- 项目
- 项目
- 项目