Mistral AI Search Toolkit 公测版

Mistral AI 已发布 Search Toolkit 公测版。这个开源的可组合框架允许开发者通过在统一的接口下整合摄取、检索和评估,来构建生产级的搜索流水线,从而减少了将不同工具缝合在一起时产生的工程开销。

统一的搜索基础设施

Search Toolkit 解决了当前检索系统中存在的碎片化问题,即摄取、检索和评估通常依赖于具有不同数据假设的独立工具链。这种碎片化往往导致数周的集成工作,并使得难以衡量检索器是否返回了正确的结果。

Search Toolkit 提供了一个单一的框架,使团队能够:

  • 标准化摄取:在各种源类型(例如内部维基、支持工单和代码库)中实现一致的处理和索引模式,而无需为每个新源重新构建流水线。
  • 隔离检索质量:使用内置的评估工具,独立于生成质量来衡量检索器的性能,从而允许团队确定 RAG 系统的失败是由于检索还是生成引起的。
  • 支持特定领域的需求:为法律、医疗或金融数据等专业领域提供一种结构化的替代方案,而不是从头开始构建自定义检索基础设施。

技术组件与能力

Search Toolkit 设计为与基础设施无关,可在云端、本地或边缘环境中运行。它由三个主要模块组成,这些模块共享一个通用的配置接口:

摄取

Search Toolkit 管理文档解析、分块和嵌入生成。它利用标准适配器接口,允许集成自定义文档格式和预处理步骤。

检索

该框架支持多种检索配置,包括:

  • BM25 稀疏检索
  • 基于密集嵌入的检索
  • 混合配置(结合稀疏检索和密集检索)

评估

为了在不同版本之间跟踪质量并比较配置,该工具包包含用于衡量搜索质量的内置指标,特别是召回率 (recall)、精确度 (precision)、MRR (Mean Reciprocal Rank) 和 NDCG (Normalized Discounted Cumulative Gain)。

与 AI Agent 的集成

Search Toolkit 为 AI Agent 提供了一条高质量的索引搜索路径。虽然 Agent 可以使用 Connectors 和 MCP 集成来从 CRM 或生产力工具中提取实时数据,但 Search Toolkit 允许它们在大规模文档语料库中执行低延迟的语义搜索。

实际应用与实现

Search Toolkit 已在制造业、公共部门、金融服务业以及媒体和娱乐行业进行了测试。例如,CMA CGM 使用该工具包配合 Voxtral 来检测假新闻,通过处理来自三个不同数据源的音频,并在 15 秒内返回警报。

入门指南

开发者可以使用 GitHub 上提供的入门应用模板来实施 Search Toolkit。该项目需要 Docker 和 uv 进行安装。该模板提供:

  • 预配置的 Vespa 索引
  • 混合检索(BM25 + 向量)
  • 示例数据和摄取流水线

高级优化

除了基础设置之外,该框架还允许进行以下优化:

  • 摄取微调:为特定文件类型配置解析器、分块策略和嵌入模型。
  • Vespa 管理:优化索引和排名 profiles。
  • 检索增强:实现 LLM 查询重写、重排序 (reranking) 和混合检索。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目