livekit/agents-js
Build realtime multimodal AI agents with Node.js
解決的問題
提供一個用於在伺服器上執行即時可程式化 AI 參與者(代理)的框架。特別針對在即時環境中建構能聽、看、理解使用者的多模態語音代理所帶來的複雜性提出解決方案。
運作方式
此框架是 LiveKit Agents 框架的 Node.js 版本。它使用「Worker」程序來協調工作排程並啟動使用者會話的代理。當使用者加入房間時,LiveKit 伺服器會將工作指派給一個 worker,該 worker 會將代理實例化為該房間的參與者。
代理是透過組合以下各類插件所建構而成:
- STT(語音轉文字):將使用者語音轉換為文字。
- LLM(大型語言模型):處理輸入並產生回應。
- TTS(文字轉語音):將文字重新轉換為語音。
- VAD(語音活動偵測):判斷使用者何時正在說話。
它也支援透過 Transformer 模型進行語意輪次偵測,以減少中斷,並原生支援 MCP(模型上下文協定),用於整合外部工具。
適用對象
開發即時語音 AI 應用、對話式助理,以及需要透過 WebRTC 實現低延遲互動的多模態 AI 代理的開發者。
主要特色
- 彈性插件生態系:可自由組合 OpenAI、Google、Deepgram、ElevenLabs 和 Mistral AI 等提供者。
- 多代理交接:可將使用者會話從一個專精代理無縫轉移至另一個代理。
- 生產就緒的編排能力:內建對狀態化會話的 SIGTERM 處理,以及可擴展的 worker-job 系統。
- WebRTC 集成:與 LiveKit 的開源媒體伺服器和客戶端 SDK 無縫協作。
相關
- 專案
- 專案
- 專案
- 專案
- 專案