追蹤與評估 smolagents 與 Arize Phoenix

Hugging Face 詳細說明了一套將 Arize Phoenixsmolagents 函式庫整合的工作流程,以提供 AI 代理的即時可觀測性與系統化評估。此整合讓開發者能視覺化代理的逐步決策過程,並使用基於 LLM 的評判來衡量其工具輸出的相關性與正確性。

代理可觀測性的即時追蹤

追蹤提供了代理內部工作流程的細粒度視圖,使開發者能透過追蹤每一步(從工具呼叫到最終回應產生)來除錯問題與優化效能。

smolagents 中實作追蹤時,開發者使用 OpenTelemetryOpenInference 進行儀表化,並以 Arize Phoenix 作為可視化平台。設定步驟包括安裝 smolagents[telemetry] 模組,並註冊指向 Phoenix 實例的 tracer provider。配置完成後,每一次代理呼叫都會自動被捕獲為 Phoenix 儀表板中的一筆追蹤,讓使用者得以「X 光」般檢視代理的決策過程。

透過 LLM-as-a-Judge 進行系統化評估

評估(evals)用於衡量代理在檢索、處理與呈現資訊方面的效能。主要方法是「LLM-as-a-judge」方式,即使用高效能模型(例如 GPT-4o)為另一模型或工具的表現打分。

評估工具相關性

在實作中,可依照以下步驟評估搜尋工具(如 DuckDuckGoSearchTool)的相關性:

  1. 取得執行 Span:使用 SpanQuery 抽取呼叫該工具的特定追蹤,並分離輸入(查詢)與輸出(結果)。
  2. 套用提示模板:使用專門的提示模板,例如 RAG_RELEVANCY_PROMPT_TEMPLATE,來指導評判 LLM。
  3. 分類結果:評判 LLM 會分析輸入與輸出,將結果分類為「相關」或「不相關」。
  4. 記錄結果:將二元分數(相關為 1,不相關為 0)回寫至 Arize Phoenix,以供系統化分析。

多樣化的評估模板

Arize Phoenix 提供了一系列預先編寫、測試過的評估模板,可依不同代理類型與使用情境調整。只要更換提示模板,開發者即可測量超越單純相關性的各種效能指標。

評估模板 適用代理類型
幻覺偵測 RAG 代理、一般聊天機器人、知識型助理
檢索資料問答 RAG 代理、研究助理、文件搜尋工具
RAG 相關性 RAG 代理、基於搜尋的 AI 助理
摘要生成 摘要工具、文件精要器、會議記錄產生器
程式碼生成 程式碼助理、AI 程式設計機器人
毒性偵測 內容審查機器人、過濾 AI
AI vs Human(真實標準) 評估與基準測試工具、AI 生成內容驗證器
參考(引用)連結 研究助理、引用工具、學術寫作輔助
SQL 生成評估 資料庫查詢代理、SQL 自動化工具
代理函式呼叫評估 多步推理代理、API 呼叫 AI、任務自動化機器人

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案