agents: 一个用于构建具有集成任务调度功能的实时可编程多模态语音智能体的框架

它解决了什么问题

LiveKit Agents 提供了一个用于构建在服务器上运行的实时、可编程 AI 参与者的框架。它简化了创建能够看、听、并理解的多模态语音智能体的过程,同时处理了服务器端执行和用户连接的复杂性。

它是如何工作的

该框架使用 AgentServer 来协调任务调度并为用户会话启动智能体。开发者定义一个带有特定指令和工具的 Agent,并由 AgentSession 管理交互。该系统允许开发者通过灵活的插件系统混合使用各种 Speech-to-Text (STT)、Large Language Model (LLM) 和 Text-to-Speech (TTS) 提供商,或者使用统一的 API 来调用托管模型。

它是面向谁的

构建实时 AI 语音助手、多模态智能体以及需要低延迟交互和服务器端编排的电话集成 AI 应用的开发者。

亮点

  • 灵活的集成:混合使用 STT、LLM 和 TTS 提供商以适应特定的用例。
  • 电话集成:通过 LiveKit 的 SIP stack 无缝地将智能体连接到电话通话中。
  • 语义轮次检测:使用 transformer 模型来减少中断,通过检测用户何时完成说话来识别轮次。
  • MCP 支持:与 Model Context Protocol (MCP) 服务器原生集成,以便通过极少的代码添加工具。
  • 内置测试:包含一个带有基于 LLM 的评判者的测试框架,以确保智能体性能。
  • 多智能体交接:支持在不同的专业化智能体之间进行交互转换。

Sources