Mistral AI Search Toolkit 公開預覽版
Mistral AI 已發佈 Search Toolkit 的公開預覽版。這個開源的可組合框架允許開發者透過在共享介面下統一攝取、檢索與評估,來構建生產級搜尋管道,從而減少與拼湊不同工具相關的工程開銷。
統一的搜尋基礎設施
Search Toolkit 解決了目前檢索系統中的碎片化問題,在目前的系統中,攝取、檢索與評估通常依賴於具有不同數據假設的分離工具鏈。這種碎片化往往導致數週的整合工作,並使得難以衡量檢索器是否正在返回正確的結果。
Search Toolkit 提供了一個單一框架,使團隊能夠:
- 標準化攝取:在各種來源類型(例如內部維基、支援票證與代碼庫)中實施一致的處理與索引模式,而無需為每個新來源重新構建管道。
- 隔離檢索品質:使用內建的評估工具來獨立於生成品質來衡量檢索器性能,從而允許團隊判斷 RAG 系統的失敗是由於檢索還是生成造成的。
- 支援領域特定需求:為法律、醫療或金融數據等專業領域提供結構化的替代方案,而無需從頭開始構建自定義檢索基礎設施。
技術組件與能力
Search Toolkit 的設計是與基礎設施無關的,可以在雲端、地端或邊緣環境中運行。它由三個主要模組組成,這些模組共享一個共同的配置介面:
Ingestion
Search Toolkit 管理文件解析、分塊與嵌入生成。它利用標準適配器介面來允許整合自定義文件格式與預處理步驟。
Retrieval
該框架支援多種檢索配置,包括:
- BM25 稀疏檢索
- 基於密集嵌入的檢索
- 混合配置(結合了稀疏與密集檢索)
Evaluation
為了追蹤各個版本的品質,並比較配置,該工具包包含用於衡量搜尋品質的內建指標,特別是 recall、precision、MRR (Mean Reciprocal Rank) 與 NDCG (Normalized Discounted Cumulative Gain)。
與 AI Agent 的整合
Search Toolkit 為 AI Agent 提供了一條高品質的索引化搜尋路徑。雖然 Agent 可以使用 Connectors 與 MCP 整合來從 CRM 或生產力工具中提取即時數據,但 Search Toolkit 允許它們在大型文件語料庫中執行低延遲的語義搜尋。
真實世界應用與實施
Search Toolkit 已在製造業、公共部門、金融服務業、媒體與娛樂業等垂直領域進行了測試。例如,CMA CGM 使用該工具包搭配 Voxtral 來偵測假新聞,透過處理來自三個不同數據源的音訊,並在 15 秒內返回警報。
入門指南
開發者可以使用 GitHub 上提供的入門應用程式模板來實施 Search Toolkit。該專案需要 Docker 與 uv 進行安裝。該模板提供:
- 預配置的 Vespa 索引化
- 混合檢索(BM25 + vector)
- 範例數據與攝取管道
進階優化
除了基礎設置之外,該框架還允許進行以下優化:
- Ingestion Tuning:為特定文件類型配置解析器、分塊策略與嵌入模型。
- Vespa Management:優化索引化與排序配置文件。
- Retrieval Enhancement:實施 LLM 查詢重寫、重排序與混合檢索。
Sources
- OriginalIntroducing Search Toolkit
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 專案