TEN-framework/ten-framework

Open-source framework for conversational voice AI agents

What it solves

TEN 提供了一個用於構建即時、多模態對話式 AI 代理的框架。它解決了創建低延遲助手(例如具有對口型功能的虛擬化身或即時轉錄工具)的複雜性,這些助手可以同時處理音訊、文本和視覺的輸入與輸出。

How it works

TEN 作為一個編排層,允許開發者將語音轉文本 (STT)、大型語言模型 (LLM) 和文本轉語音 (TTS) 的各種擴展功能串聯起來。它支持 RTC 和 WebSocket 連接,並可以與 ESP32-S3 等硬體集成。該框架包含一個設計工具 (TMAN Designer) 用於視覺化地配置代理屬性並管理擴展功能。

Who it’s for

開發者正在構建即時 AI 代理,例如語音助手、互動式虛擬化身或硬體集成式 AI 通訊工具,且需要低延遲多模態流水線的開發者。

Highlights

  • Multimodal Capabilities: 支持音訊、文本和視覺輸出,包括與對口型虛擬化身供應商 (例如, HeyGen, Tavus) 的集成。
  • Low Latency: 專為即時對話式 AI 設計。
  • Extensible Ecosystem: 包含用於語音活動檢測 (VAD) 和輪次檢測 (Turn Detection) 的專用組件,以實現全雙工對話。
  • Hardware Integration: 為在 ESP32-S3 Korvo V3 等開發板上運行代理提供指南。"},

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案