langwatch/scenario
Agentic testing for agentic codebases
解決的問題
Scenario 是一個代理測試框架,旨在透過模擬真實的使用者互動來評估 AI 代理的行為。它解決了在不需要手動測試或靜態資料集的情況下測試多輪對話和邊緣案例的挑戰,讓開發者能夠驗證代理是否遵循特定標準或能處理對抗性攻擊。
運作方式
該框架使用一個模擬迴圈,其中 UserSimulatorAgent(由 LLM 驅動)會根據情境描述產生訊息。此模擬器會與受測代理進行互動。可以整合 JudgeAgent 來根據一組標準即時評估對話,決定模擬應該繼續還是以最終判定結束。開發者可以讓模擬在「自動駕駛」模式下執行,或使用腳本 DSL 來精確控制對話流程,包括硬編碼訊息、自訂斷言(例如檢查工具呼叫)和外部評估。
適用對象
它是為建構 AI 代理的開發者所打造,特別是使用 Python、TypeScript 或 Go 的開發者,他們需要一種可靠的方式將代理測試整合到其 CI/CD 管道中。
亮點
- 多輪模擬:在各種情境中模擬使用者,以測試真實世界的代理行為。
- 整合式評判:使用
JudgeAgent自動根據特定標準評估回應。 - 紅隊測試:包含
RedTeamAgent,用於提示洩漏和拒絕偵測等對抗性攻擊。 - 語音代理支援:為語音代理提供一流支援,具備適用於 ElevenLabs、OpenAI Realtime 等的轉接器,包括延遲和中斷測試。
- 無關設計:透過簡單的
call()方法與任何 LLM 評估框架或自訂代理實作整合。 - 快取:為模擬器的輸入和代理的內部 LLM 呼叫提供快取,以確保測試可重複性並降低成本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案