TEN-framework/ten-framework

Open-source framework for conversational voice AI agents

What it solves

TEN은 실시간 멀티모달 대화형 AI 에이전트를 구축하기 위한 프레임워크를 제공합니다. 음성 비서나 립싱크 아바타 또는 실시간 전사 도구와 같이 오디오, 텍스트 및 시각적 입출력을 동시에 처리할 수 있는 저지연 어시스턴트를 만드는 데 따르는 복잡성을 해결합니다.

How it works

TEN은 오케스트레이션 레이어로 작동하여 개발자가 STT(speech-to-text), LLM(large language models), TTS(text-to-speech)를 위한 다양한 확장 기능을 체인으로 연결할 수 있게 합니다. RTC 및 WebSocket 연결을 모두 지원하며, ESP32-S3와 같은 하드웨어와 통합할 수 있습니다. 프레임워크에는 에이전트 속성을 구성하고 확장을 시각적으로 관리하는 설계 도구 (TMAN Designer) 가 포함되어 있습니다.

Who it’s for

음성 비서, 대화형 아바타 또는 하드웨어 통합형 AI 통신 도구와 같이 실시간 AI 에이전트를 구축하는 개발자 중 저지연 멀티모달 파이프라인이 필요한 분들입니다.

Highlights

  • Multimodal Capabilities: 오디오, 텍스트 및 시각적 출력을 지원하며, HeyGen, Tavus와 같은 립싱크 아바타 벤더와의 통합을 포함합니다.
  • Low Latency: 실시간 대화형 AI를 위해 특별히 설계되었습니다.
  • Extensible Ecosystem: 전이중 대화(full-duplex dialogue)를 가능하게 하기 위한 VAD(Voice Activity Detection) 및 Turn Detection을 위한 전문화된 컴포넌트가 포함되어 있습니다.
  • Hardware Integration: ESP32-S3 Korvo V3와 같은 개발 보드에서 에이전트를 실행하기 위한 가이드를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트