livekit/agents-js

Build realtime multimodal AI agents with Node.js

解決的問題

提供一個用於在伺服器上執行即時可程式化 AI 參與者(代理)的框架。特別針對在即時環境中建構能聽、看、理解使用者的多模態語音代理所帶來的複雜性提出解決方案。

運作方式

此框架是 LiveKit Agents 框架的 Node.js 版本。它使用「Worker」程序來協調工作排程並啟動使用者會話的代理。當使用者加入房間時,LiveKit 伺服器會將工作指派給一個 worker,該 worker 會將代理實例化為該房間的參與者。

代理是透過組合以下各類插件所建構而成:

  • STT(語音轉文字):將使用者語音轉換為文字。
  • LLM(大型語言模型):處理輸入並產生回應。
  • TTS(文字轉語音):將文字重新轉換為語音。
  • VAD(語音活動偵測):判斷使用者何時正在說話。

它也支援透過 Transformer 模型進行語意輪次偵測,以減少中斷,並原生支援 MCP(模型上下文協定),用於整合外部工具。

適用對象

開發即時語音 AI 應用、對話式助理,以及需要透過 WebRTC 實現低延遲互動的多模態 AI 代理的開發者。

主要特色

  • 彈性插件生態系:可自由組合 OpenAI、Google、Deepgram、ElevenLabs 和 Mistral AI 等提供者。
  • 多代理交接:可將使用者會話從一個專精代理無縫轉移至另一個代理。
  • 生產就緒的編排能力:內建對狀態化會話的 SIGTERM 處理,以及可擴展的 worker-job 系統。
  • WebRTC 集成:與 LiveKit 的開源媒體伺服器和客戶端 SDK 無縫協作。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案