future-agi/future-agi

Open-source, end-to-end platform for evaluating, observing, and improving LLM and AI agent applications. Tracing · Evals · Simulations · Datasets · Gateway · Guardrails. Self-hostable. Apache 2.0.

解決的問題

AI 代理經常因為幻覺和不可預測的行為而在生產環境中失敗。大多數團隊正掙扎於碎片化的工作流,必須將用於可觀測性、評估與護欄的獨立工具拼湊在一起。Future AGI 將這些功能整合進單一的回饋循環,使代理變得可靠並具備自我改進能力。

工作原理

該平台透過六大核心支柱運行:

  • Simulate: 針對現實的人設與邊緣情況(包括文本與語音)執行數千次多輪對話。
  • Evaluate: 使用 LLM-as-judge、啟發式演算法與機器學習來提供超過 50 項指標,如落地性(groundedness)與工具使用正確性。
  • Protect: 提供內建掃描器與供應商適配器,以防止越獄、注入與 PII 洩漏。
  • Monitor: 使用 OpenTelemetry 原生追蹤來追蹤各種框架的延遲、成本與跨度圖(span graphs)。
  • Command Center: 作為具有高性能路由與語義快取的 OpenAI 相容閘道。
  • Optimize: 採用六種提示詞優化演算法,將生產環境的追蹤數據轉化為用於提升性能的訓練數據。

適用對象

  • 客戶支援團隊: 構建值得信賴的客服 AI。
  • 語音 AI 開發人員: 測試並改進端到端語音代理。
  • 企業開發人員: 構建可靠的內部 Copilot 與自主代理。
  • RAG 開發人員: 確保回答的落地性與經過驗證的引用。
  • 程式碼編寫與電腦使用代理開發人員: 構建能夠自信地編寫程式碼或與介面互動的代理。

亮點

  • 開源(Apache 2.0)並可透過 Docker 自託管。
  • 基於 Go 的高性能閘道,處理能力約為 ~29k req/s。
  • 支援 50 多個代理框架(LangChain, LlamaIndex, CrewAI 等)。
  • 與 100 多個 LLM 提供商及主流向量資料庫整合。