Mistral AI Search Toolkit 公開預覽版

Mistral AI 已發佈 Search Toolkit 的公開預覽版。這個開源的可組合框架允許開發者透過在共享介面下統一攝取、檢索與評估,來構建生產級搜尋管道,從而減少與拼湊不同工具相關的工程開銷。

統一的搜尋基礎設施

Search Toolkit 解決了目前檢索系統中的碎片化問題,在目前的系統中,攝取、檢索與評估通常依賴於具有不同數據假設的分離工具鏈。這種碎片化往往導致數週的整合工作,並使得難以衡量檢索器是否正在返回正確的結果。

Search Toolkit 提供了一個單一框架,使團隊能夠:

  • 標準化攝取:在各種來源類型(例如內部維基、支援票證與代碼庫)中實施一致的處理與索引模式,而無需為每個新來源重新構建管道。
  • 隔離檢索品質:使用內建的評估工具來獨立於生成品質來衡量檢索器性能,從而允許團隊判斷 RAG 系統的失敗是由於檢索還是生成造成的。
  • 支援領域特定需求:為法律、醫療或金融數據等專業領域提供結構化的替代方案,而無需從頭開始構建自定義檢索基礎設施。

技術組件與能力

Search Toolkit 的設計是與基礎設施無關的,可以在雲端、地端或邊緣環境中運行。它由三個主要模組組成,這些模組共享一個共同的配置介面:

Ingestion

Search Toolkit 管理文件解析、分塊與嵌入生成。它利用標準適配器介面來允許整合自定義文件格式與預處理步驟。

Retrieval

該框架支援多種檢索配置,包括:

  • BM25 稀疏檢索
  • 基於密集嵌入的檢索
  • 混合配置(結合了稀疏與密集檢索)

Evaluation

為了追蹤各個版本的品質,並比較配置,該工具包包含用於衡量搜尋品質的內建指標,特別是 recall、precision、MRR (Mean Reciprocal Rank) 與 NDCG (Normalized Discounted Cumulative Gain)。

與 AI Agent 的整合

Search Toolkit 為 AI Agent 提供了一條高品質的索引化搜尋路徑。雖然 Agent 可以使用 Connectors 與 MCP 整合來從 CRM 或生產力工具中提取即時數據,但 Search Toolkit 允許它們在大型文件語料庫中執行低延遲的語義搜尋。

真實世界應用與實施

Search Toolkit 已在製造業、公共部門、金融服務業、媒體與娛樂業等垂直領域進行了測試。例如,CMA CGM 使用該工具包搭配 Voxtral 來偵測假新聞,透過處理來自三個不同數據源的音訊,並在 15 秒內返回警報。

入門指南

開發者可以使用 GitHub 上提供的入門應用程式模板來實施 Search Toolkit。該專案需要 Docker 與 uv 進行安裝。該模板提供:

  • 預配置的 Vespa 索引化
  • 混合檢索(BM25 + vector)
  • 範例數據與攝取管道

進階優化

除了基礎設置之外,該框架還允許進行以下優化:

  • Ingestion Tuning:為特定文件類型配置解析器、分塊策略與嵌入模型。
  • Vespa Management:優化索引化與排序配置文件。
  • Retrieval Enhancement:實施 LLM 查詢重寫、重排序與混合檢索。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案