TEN-framework/ten-framework
Open-source framework for conversational voice AI agents
What it solves
TEN 提供了一個用於構建即時、多模態對話式 AI 代理的框架。它解決了創建低延遲助手(例如具有對口型功能的虛擬化身或即時轉錄工具)的複雜性,這些助手可以同時處理音訊、文本和視覺的輸入與輸出。
How it works
TEN 作為一個編排層,允許開發者將語音轉文本 (STT)、大型語言模型 (LLM) 和文本轉語音 (TTS) 的各種擴展功能串聯起來。它支持 RTC 和 WebSocket 連接,並可以與 ESP32-S3 等硬體集成。該框架包含一個設計工具 (TMAN Designer) 用於視覺化地配置代理屬性並管理擴展功能。
Who it’s for
開發者正在構建即時 AI 代理,例如語音助手、互動式虛擬化身或硬體集成式 AI 通訊工具,且需要低延遲多模態流水線的開發者。
Highlights
- Multimodal Capabilities: 支持音訊、文本和視覺輸出,包括與對口型虛擬化身供應商 (例如, HeyGen, Tavus) 的集成。
- Low Latency: 專為即時對話式 AI 設計。
- Extensible Ecosystem: 包含用於語音活動檢測 (VAD) 和輪次檢測 (Turn Detection) 的專用組件,以實現全雙工對話。
- Hardware Integration: 為在 ESP32-S3 Korvo V3 等開發板上運行代理提供指南。"},
相關
- 專案
- 專案
- 專案
- 專案
- 專案