livekit/agents

A framework for building realtime voice AI agents 🤖🎙️📹

해결하는 문제

LiveKit Agents는 서버에서 실행되는 실시간, 프로그래머블 참가자를 구축하기 위한 프레임워크를 제공합니다. 낮은 지연 시간 상호작용을 위한 복잡한 인프라를 처리하면서, 보는 것, 듣는 것, 이해하는 능력을 갖춘 다중 모달 음성 에이전트를 쉽게 만들 수 있도록 도와줍니다.

작동 방식

이 프레임워크는 AgentServer를 사용하여 작업 스케줄링을 조정하고 사용자 세션용 에이전트를 시작합니다. 개발자는 특정 지침과 도구를 가진 Agent를 정의하고, AgentSession이 상호작용을 관리합니다. 시스템은 Speech-to-Text (STT), Large Language Models (LLMs), Text-to-Speech (TTS)에 대해 다양한 제공자를 혼합하여 사용하거나, 이러한 서비스를 위한 통합 API를 사용할 수 있습니다. 또한 WebRTC 클라이언트와 전화 통신 스택(SIP)과의 통합을 지원하여 음성 통화를 가능하게 합니다.

대상 사용자

음성 보조자, 외부 전화 호출기, AI 아바타와 같은 대화형 AI 애플리케이션을 개발하고 있으며, 실시간 다중 모달 상호작용을 관리하기 위해 확장 가능한 서버 측 프레임워크가 필요한 개발자들입니다.

주요 기능

  • 유연한 통합: 다양한 STT, LLM, TTS 제공자 지원.
  • 의미 기반 전환 감지: 사용자가 말을 마쳤는지 감지하기 위해 트랜스포머 모델을 사용하여 간섭을 줄입니다.
  • MCP 지원: Model Context Protocol (MCP) 서버와의 네이티브 통합을 통해 최소한의 코드로 도구를 추가할 수 있습니다.
  • 전화 통신 통합: SIP를 통해 전화 통화를 걸고 받을 수 있습니다.
  • 내장 테스트: 비결정적 LLM 동작을 검증하기 위한 판사가 포함된 네이티브 테스트 프레임워크.
  • 다중 에이전트 전달: 서로 다른 전문적인 에이전트 간에 사용자 세션을 전달하는 것을 지원합니다.

"이 프레임워크는 실시간 다중 모달 음성 에이전트를 쉽게 구축할 수 있도록 도와줍니다." — @livekit

"MCP 통합은 도구 추가를 매우 간단하게 만들어 줍니다." — @livekit

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트