TEN-framework/ten-framework
Open-source framework for conversational voice AI agents
What it solves
TENは、リアルタイム・マルチモーダル対話型AIエージェントを構築するためのフレームワークを提供します。音声、テキスト、および視覚の入出力が同時に行える低遅延アシスタント(例:リップシンク対応のアバターメント、リアルタイム文字起こしツール)の作成における複雑さを解消します。
How it works
TENはオーケストレーション層として機能し、開発者が音声からテキストへの変換 (STT)、大規模言語モデル (LLM)、およびテキストから音声への変換 (TTS) のさまざまな拡張機能をチェーン化できるようにします。RTC と WebSocket 接続の両方をサポートし、ESP32-S3 のようなハードウェアとも統合可能です。フレームワークには、エージェントのプロパティを構成し、拡張機能を視覚的に管理するための設計ツール (TMAN Designer) が含まれています。
Who it’s for
音声アシスタント、インタラクティブ・アバター、またはハードウェア統合型AI通信ツールなど、リアルタイムAIエージェントを構築する開発者で、低遅延マルチモーダル・パイプラインが必要な方。
Highlights
Multimodal Capabilities: 音声、テキスト、および視覚の出力をサポートし、HeyGen や Tavus などのリップシンク・アバターベンダーとの統合も可能です。
Low Latency: リアルタイム対話型AIのために特別に設計されています。
Extensible Ecosystem: 全二重対話を実現するために、音声活動検知 (VAD) やターン検知 (Turn Detection) のための専門的なコンポーネントが含まれています。
Hardware Integration: ESP32-S3 Korvo V3 のような開発ボード上でエージェントを実行するためのガイドを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト