livekit/agents-js

Build realtime multimodal AI agents with Node.js

해결하는 문제

실시간으로 프로그래밍 가능한 AI 참가자(에이전트)를 서버에서 실행할 수 있는 프레임워크를 제공합니다. 실시간 환경에서 사용자의 음성, 시각, 이해를 처리할 수 있는 멀티모달 음성 에이전트를 구축하는 데 있어 복잡성을 해결합니다.

작동 방식

이 프레임워크는 LiveKit Agents 프레임워크의 Node.js 배포판으로 작동합니다. 작업 스케줄링 및 사용자 세션용 에이전트 시작을 조율하는 'Worker' 프로세스를 사용합니다. 사용자가 방에 참여하면 LiveKit 서버가 작업을 워커에 할당하고, 해당 방에 에이전트를 참가자로 인스턴스화합니다.

다음과 같은 플러그인을 조합하여 에이전트를 구축합니다:

  • STT (음성-텍스트 변환): 사용자 음성을 텍스트로 변환.
  • LLM (대규모 언어 모델): 입력을 처리하고 응답을 생성.
  • TTS (텍스트-음성 변환): 텍스트를 다시 음성으로 변환.
  • VAD (음성 활동 감지): 사용자가 말하고 있는 시점을 결정.

또한 트랜스포머 모델을 통한 의미적 턴 감지 기능을 지원하여 간섭을 줄이고, 외부 도구 통합을 위한 네이티브 MCP(모델 컨텍스트 프로토콜) 지원도 제공합니다.

대상 사용자

실시간 음성 AI 애플리케이션, 대화형 어시스턴트, WebRTC를 통해 저지연 상호작용이 필요한 멀티모달 AI 에이전트를 개발하는 개발자.

주요 특징

  • 유연한 플러그인 생태계: OpenAI, Google, Deepgram, ElevenLabs, Mistral AI 등 다양한 제공업체를 자유롭게 조합 가능.
  • 다중 에이전트 전환 기능: 사용자 세션을 한 전문 에이전트에서 다른 에이전트로 원활하게 이관 가능.
  • 프로덕션 대응 오케스트레이션: 상태 유지 세션에 대한 SIGTERM 처리를 내장하고, 확장 가능한 워커-작업 시스템 제공.
  • WebRTC 통합: LiveKit의 오픈소스 미디어 서버 및 클라이언트 SDK와 원활하게 연동.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트