livekit/agents

A framework for building realtime voice AI agents 🤖🎙️📹

解決する課題

LiveKit Agentsは、サーバー上で動作するリアルタイムでプログラマブルなAI参加者を構築するためのフレームワークを提供します。サーバー側での実行やユーザーの接続といった複雑な処理を処理しながら、視覚、聴覚、理解が可能なマルチモーダル音声エージェントの作成を簡素化します。

仕組み

このフレームワークは、AgentServerを使用してジョブのスケジューリングを調整し、ユーザーセッションのためにエージェントを起動します。開発者は特定の指示とツールを持つAgentを定義し、AgentSessionがインタラクションを管理します。このシステムにより、開発者は柔軟なプラグインシステムを通じて、さまざまな音声認識(STT)、大規模言語モデル(LLM)、音声合成(TTS)プロバイダーを組み合わせて使用したり、ホスト型モデル用の統合APIを使用したりすることができます。

対象者

低遅延のインタラクションとサーバー側でのオーケストレーションを必要とする、リアルタイムAI音声アシスタント、マルチモーダルエージェント、および電話統合AIアプリケーションを構築する開発者。

ハイライト

  • 柔軟な統合: 特定のユースケースに合わせて、STT、LLM、TTSプロバイダーを自由に組み合わせることができます。
  • 電話統合: LiveKitのSIPスタックを介して、エージェントを電話回線にシームレスに接続します。
  • セマンティック・ターン検出: Transformerモデルを使用して、ユーザーが話し終えたタイミングを検出し、割り込みを軽減します。
  • MCPサポート: Model Context Protocol (MCP) サーバーとのネイティブ統合により、最小限のコードでツールを追加できます。
  • 組み込みテスト: エージェントのパフォーマンスを確保するため、LLMベースの判定器を備えたテストフレームワークが含まれています。
  • マルチエージェント・ハンドオフ: 異なる特化型エージェント間でのインタラクションの移行をサポートします。