livekit/agents

A framework for building realtime voice AI agents 🤖🎙️📹

해결하는 문제

LiveKit Agents는 서버에서 실행되는 실시간 프로그래밍 가능 AI 참가자를 구축하기 위한 프레임워크를 제공합니다. 서버 측 실행 및 사용자 연결의 복잡성을 처리하면서 보고, 듣고, 이해할 수 있는 멀티모달 음성 에이전트의 생성을 단순화합니다.

작동 방식

이 프레임워크는 AgentServer를 사용하여 작업 스케줄링을 조정하고 사용자 세션을 위한 에이전트를 실행합니다. 개발자는 특정 지침과 도구가 포함된 Agent를 정의하고 AgentSession이 상호 작용을 관리합니다. 이 시스템을 통해 개발자는 유연한 플러그인 시스템을 통해 다양한 음성 인식(STT), 대규모 언어 모델(LLM) 및 음성 합성(TTS) 제공업체를 혼합하여 사용할 수 있으며, 호스팅된 모델을 위한 통합 API를 사용할 수도 있습니다.

대상

저지연 상호 작용 및 서버 측 오케스트레이션이 필요한 실시간 AI 음성 비서, 멀티모달 에이전트 및 전화 통합 AI 애플리케이션을 구축하는 개발자.

주요 특징

  • 유연한 통합: 특정 유스케이스에 맞춰 STT, LLM, TTS 제공업체를 혼합하여 사용할 수 있습니다.
  • 전화 통합: LiveKit의 SIP 스택을 통해 에이전트를 전화 통화에 원활하게 연결합니다.
  • 의미론적 턴 감지(Semantic Turn Detection): 트랜스포머 모델을 사용하여 사용자가 말을 마쳤을 때를 감지함으로써 중단을 줄입니다.
  • MCP 지원: Model Context Protocol (MCP) 서버와 네이티브 통합되어 최소한의 코드로 도구를 추가할 수 있습니다.
  • 내장 테스트: 에이전트 성능을 보장하기 위해 LLM 기반 판독기가 포함된 테스트 프레임워크를 제공합니다。
  • 멀티 에이전트 핸드오프: 서로 다른 전문 에이전트 간의 상호 작용 전환을 지원합니다.