xzf-thu/VoiceMem

Infrastructure for the next generation of voice agents, designed to provide universal memory. It is divided into a left brain and a right brain, storing information and emotions respectively, while a fully streaming architecture eliminates latency at the fundamental level.

解决的问题

VoiceMem 为实时语音代理提供专门设计的长期记忆系统。它解决了传统记忆检索带来的高延迟和高令牌成本问题,同时使代理不仅能记住事实信息,还能记住用户的人格、情绪和关系。

工作原理

VoiceMem 采用「流式双脑」架构,将记忆分离并处理:

  • 左脑:管理按模式和实体组织的事实信息,实现高精度检索。
  • 右脑:使用独立和跨实体节点处理情感智能、人格和关系数据。

系统在流式管道中运行,用户说话时实时对音频进行分段、转录和分析(ASR、说话人识别、情绪检测)。它使用推测性预取(0–300 毫秒)在用户说完句子前检索相关记忆,仅将最相关的 Top-K 条记忆注入模型上下文,以最小化令牌使用量。

适用人群

需要模型具备持久、低延迟、情感感知的长期记忆,但又不希望上下文窗口过度膨胀的实时语音 AI 代理开发者。

主要亮点

  • 低延迟:响应时间仅 134 毫秒,显著快于 Mem0 等替代方案。
  • 高准确率:仅使用 Top-5 记忆,在 LoCoMo 基准测试中达到 91.2% 的准确率。
  • 多模态记忆:能够从音频中记忆语音、说话人、声音事件和音乐。
  • 令牌高效:每查询仅使用约 430 个记忆令牌,远低于其他系统数千的用量。
  • 集成管道:将 ASR、说话人识别和情绪感知整合到记忆摄入流程中。

相关

  • 项目
  • 项目
  • 项目
  • 项目