livekit/agents-js
Build realtime multimodal AI agents with Node.js
解决的问题
提供一个用于在服务器上运行实时可编程AI参与者(代理)的框架。特别解决了在实时环境中构建能够听、看、理解用户的多模态语音代理的复杂性。
工作原理
该框架是 LiveKit Agents 框架的 Node.js 版本。它使用一个「Worker」进程来协调任务调度并启动用户会话的代理。当用户加入房间时,LiveKit 服务器会将一个任务分配给一个 worker,该 worker 会将代理实例化为该房间的参与者。
代理通过组合以下各类插件构建而成:
- STT(语音转文本):将用户语音转换为文本。
- LLM(大语言模型):处理输入并生成响应。
- TTS(文本转语音):将文本重新转换为语音。
- VAD(语音活动检测):判断用户何时在说话。
它还支持通过 Transformer 模型实现语义轮次检测,以减少打断,并原生支持 MCP(模型上下文协议),用于集成外部工具。
适用人群
开发实时语音 AI 应用、对话式助手以及需要通过 WebRTC 实现低延迟交互的多模态 AI 代理的开发者。
主要亮点
- 灵活的插件生态系统:可自由组合 OpenAI、Google、Deepgram、ElevenLabs 和 Mistral AI 等提供商。
- 多代理交接:支持将用户会话从一个专业代理无缝切换到另一个代理。
- 生产就绪的编排能力:内置对状态化会话的 SIGTERM 处理,以及可扩展的 worker-job 系统。
- WebRTC 集成:与 LiveKit 的开源媒体服务器和客户端 SDK 无缝协作。
相关
- 项目
- 项目
- 项目
- 项目
- 项目