追蹤與評估 smolagents 與 Arize Phoenix
Hugging Face 詳細說明了一套將 Arize Phoenix 與 smolagents 函式庫整合的工作流程,以提供 AI 代理的即時可觀測性與系統化評估。此整合讓開發者能視覺化代理的逐步決策過程,並使用基於 LLM 的評判來衡量其工具輸出的相關性與正確性。
代理可觀測性的即時追蹤
追蹤提供了代理內部工作流程的細粒度視圖,使開發者能透過追蹤每一步(從工具呼叫到最終回應產生)來除錯問題與優化效能。
在 smolagents 中實作追蹤時,開發者使用 OpenTelemetry 與 OpenInference 進行儀表化,並以 Arize Phoenix 作為可視化平台。設定步驟包括安裝 smolagents[telemetry] 模組,並註冊指向 Phoenix 實例的 tracer provider。配置完成後,每一次代理呼叫都會自動被捕獲為 Phoenix 儀表板中的一筆追蹤,讓使用者得以「X 光」般檢視代理的決策過程。
透過 LLM-as-a-Judge 進行系統化評估
評估(evals)用於衡量代理在檢索、處理與呈現資訊方面的效能。主要方法是「LLM-as-a-judge」方式,即使用高效能模型(例如 GPT-4o)為另一模型或工具的表現打分。
評估工具相關性
在實作中,可依照以下步驟評估搜尋工具(如 DuckDuckGoSearchTool)的相關性:
- 取得執行 Span:使用
SpanQuery抽取呼叫該工具的特定追蹤,並分離輸入(查詢)與輸出(結果)。 - 套用提示模板:使用專門的提示模板,例如
RAG_RELEVANCY_PROMPT_TEMPLATE,來指導評判 LLM。 - 分類結果:評判 LLM 會分析輸入與輸出,將結果分類為「相關」或「不相關」。
- 記錄結果:將二元分數(相關為 1,不相關為 0)回寫至 Arize Phoenix,以供系統化分析。
多樣化的評估模板
Arize Phoenix 提供了一系列預先編寫、測試過的評估模板,可依不同代理類型與使用情境調整。只要更換提示模板,開發者即可測量超越單純相關性的各種效能指標。
| 評估模板 | 適用代理類型 |
|---|---|
| 幻覺偵測 | RAG 代理、一般聊天機器人、知識型助理 |
| 檢索資料問答 | RAG 代理、研究助理、文件搜尋工具 |
| RAG 相關性 | RAG 代理、基於搜尋的 AI 助理 |
| 摘要生成 | 摘要工具、文件精要器、會議記錄產生器 |
| 程式碼生成 | 程式碼助理、AI 程式設計機器人 |
| 毒性偵測 | 內容審查機器人、過濾 AI |
| AI vs Human(真實標準) | 評估與基準測試工具、AI 生成內容驗證器 |
| 參考(引用)連結 | 研究助理、引用工具、學術寫作輔助 |
| SQL 生成評估 | 資料庫查詢代理、SQL 自動化工具 |
| 代理函式呼叫評估 | 多步推理代理、API 呼叫 AI、任務自動化機器人 |
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 專案