Arize-ai/phoenix
AI Observability & Evaluation
해결하는 문제
Phoenix는 LLM 애플리케이션을 모니터링하고 최적화하는 데 따르는 어려움을 해결합니다. 트레이싱을 통해 애플리케이션 런타임에 대한 가시성을 제공하고, 평가를 통해 성능 벤치마킹을 가능하게 하며, 프롬프트 엔지니어링 및 실험의 반복 프로세스 관리를 돕습니다.
작동 방식
Phoenix는 OpenTelemetry 기반의 인스트루멘테이션을 사용하여 LLM 애플리케이션 런타임을 트레이싱합니다. LLM을 활용하여 응답 및 검색 품질에 대한 평가를 수행합니다. 사용자는 실험을 위한 버전 관리된 데이터셋을 생성할 수 있으며, 내장된 AI 엔지니어링 에이전트(PXI)를 사용하여 트레이스를 디버깅하고 프롬프트를 반복 개선할 수 있습니다. 벤더에 종속되지 않으며 LangChain, LlamaIndex, CrewAI와 같은 다양한 프레임워크와 OpenAI, Anthropic과 같은 제공업체를 지원합니다.
대상 사용자
- LLM 애플리케이션을 구축하고 디버깅하는 AI 엔지니어.
- RAG (Retrieval-Augmented Generation) 성능 벤치마킹이 필요한 개발자.
- 체계적인 프롬프트 관리 및 버전 관리가 필요한 팀.
- MCP를 통해 트레이스 및 데이터셋을 쿼리하고자 하는 코딩 에이전트(Cursor 또는 Claude Code 등) 사용자.
주요 특징
- Tracing: OpenTelemetry 기반의 런타임 인스트루멘테이션.
- Evaluation: 응답 및 검색을 위한 LLM 기반 벤치마킹.
- Experimentation: 프롬프트, 모델 및 검색 변경 사항을 추적하기 위한 도구.
- Prompt Management: 버전 관리 및 태깅을 통한 체계적인 테스트.
- AI Agent Integration: 코딩 에이전트에서 데이터를 쿼리하기 위한 원격 MCP 서버 지원.