TEN-framework/ten-framework

Open-source framework for conversational voice AI agents

What it solves

TEN 提供了一个用于构建实时、多模态对话式 AI 智能体的框架。它解决了创建低延迟助手(例如具有对口型功能的虚拟化身或实时转录工具)的复杂性,这些助手可以同时处理音频、文本和视觉的输入与输出。

How it works

TEN 作为一个编排层,允许开发者将语音转文本 (STT)、大语言模型 (LLM) 和文本转语音 (TTS) 的各种扩展功能串联起来。它支持 RTC 和 WebSocket 连接,并可以与 ESP32-S3 等硬件集成。该框架包含一个设计工具 (TMAN Designer) 用于可视化地配置智能体属性并管理扩展功能。

Who it’s for

开发者正在构建实时 AI 智能体,例如语音助手、交互式虚拟化身或硬件集成式 AI 通信工具,且需要低延迟多模态流水线。

Highlights

  • Multimodal Capabilities: 支持音频、文本和视觉输出,包括与对口型虚拟化身供应商 (例如, HeyGen, Tavus) 的集成。
  • Low Latency: 专门为实时对话式 AI 设计。
  • Extensible Ecosystem: 包含用于语音活动检测 (VAD) and 轮次检测 (Turn Detection) 以实现全双工对话。
  • Hardware Integration: 提供在 ESP32-S3 Korvo V3 等开发板上运行智能体的指南。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目