Mistral AI Search Toolkit 公测版
Mistral AI 已发布 Search Toolkit 公测版。这个开源的可组合框架允许开发者通过在统一的接口下整合摄取、检索和评估,来构建生产级的搜索流水线,从而减少了将不同工具缝合在一起时产生的工程开销。
统一的搜索基础设施
Search Toolkit 解决了当前检索系统中存在的碎片化问题,即摄取、检索和评估通常依赖于具有不同数据假设的独立工具链。这种碎片化往往导致数周的集成工作,并使得难以衡量检索器是否返回了正确的结果。
Search Toolkit 提供了一个单一的框架,使团队能够:
- 标准化摄取:在各种源类型(例如内部维基、支持工单和代码库)中实现一致的处理和索引模式,而无需为每个新源重新构建流水线。
- 隔离检索质量:使用内置的评估工具,独立于生成质量来衡量检索器的性能,从而允许团队确定 RAG 系统的失败是由于检索还是生成引起的。
- 支持特定领域的需求:为法律、医疗或金融数据等专业领域提供一种结构化的替代方案,而不是从头开始构建自定义检索基础设施。
技术组件与能力
Search Toolkit 设计为与基础设施无关,可在云端、本地或边缘环境中运行。它由三个主要模块组成,这些模块共享一个通用的配置接口:
摄取
Search Toolkit 管理文档解析、分块和嵌入生成。它利用标准适配器接口,允许集成自定义文档格式和预处理步骤。
检索
该框架支持多种检索配置,包括:
- BM25 稀疏检索
- 基于密集嵌入的检索
- 混合配置(结合稀疏检索和密集检索)
评估
为了在不同版本之间跟踪质量并比较配置,该工具包包含用于衡量搜索质量的内置指标,特别是召回率 (recall)、精确度 (precision)、MRR (Mean Reciprocal Rank) 和 NDCG (Normalized Discounted Cumulative Gain)。
与 AI Agent 的集成
Search Toolkit 为 AI Agent 提供了一条高质量的索引搜索路径。虽然 Agent 可以使用 Connectors 和 MCP 集成来从 CRM 或生产力工具中提取实时数据,但 Search Toolkit 允许它们在大规模文档语料库中执行低延迟的语义搜索。
实际应用与实现
Search Toolkit 已在制造业、公共部门、金融服务业以及媒体和娱乐行业进行了测试。例如,CMA CGM 使用该工具包配合 Voxtral 来检测假新闻,通过处理来自三个不同数据源的音频,并在 15 秒内返回警报。
入门指南
开发者可以使用 GitHub 上提供的入门应用模板来实施 Search Toolkit。该项目需要 Docker 和 uv 进行安装。该模板提供:
- 预配置的 Vespa 索引
- 混合检索(BM25 + 向量)
- 示例数据和摄取流水线
高级优化
除了基础设置之外,该框架还允许进行以下优化:
- 摄取微调:为特定文件类型配置解析器、分块策略和嵌入模型。
- Vespa 管理:优化索引和排名 profiles。
- 检索增强:实现 LLM 查询重写、重排序 (reranking) 和混合检索。
Sources
- OriginalIntroducing Search Toolkit
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目