TEN-framework/ten-framework

Open-source framework for conversational voice AI agents

What it solves

TENは、リアルタイム・マルチモーダル対話型AIエージェントを構築するためのフレームワークを提供します。音声、テキスト、および視覚の入出力が同時に行える低遅延アシスタント(例:リップシンク対応のアバターメント、リアルタイム文字起こしツール)の作成における複雑さを解消します。

How it works

TENはオーケストレーション層として機能し、開発者が音声からテキストへの変換 (STT)、大規模言語モデル (LLM)、およびテキストから音声への変換 (TTS) のさまざまな拡張機能をチェーン化できるようにします。RTC と WebSocket 接続の両方をサポートし、ESP32-S3 のようなハードウェアとも統合可能です。フレームワークには、エージェントのプロパティを構成し、拡張機能を視覚的に管理するための設計ツール (TMAN Designer) が含まれています。

Who it’s for

音声アシスタント、インタラクティブ・アバター、またはハードウェア統合型AI通信ツールなど、リアルタイムAIエージェントを構築する開発者で、低遅延マルチモーダル・パイプラインが必要な方。

Highlights

  • Multimodal Capabilities: 音声、テキスト、および視覚の出力をサポートし、HeyGen や Tavus などのリップシンク・アバターベンダーとの統合も可能です。

  • Low Latency: リアルタイム対話型AIのために特別に設計されています。

  • Extensible Ecosystem: 全二重対話を実現するために、音声活動検知 (VAD) やターン検知 (Turn Detection) のための専門的なコンポーネントが含まれています。

  • Hardware Integration: ESP32-S3 Korvo V3 のような開発ボード上でエージェントを実行するためのガイドを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト