xzf-thu/VoiceMem
Infrastructure for the next generation of voice agents, designed to provide universal memory. It is divided into a left brain and a right brain, storing information and emotions respectively, while a fully streaming architecture eliminates latency at the fundamental level.
解決的問題
VoiceMem 提供專為即時語音代理設計的長期記憶系統。解決傳統記憶檢索所帶來的高延遲與高令牌成本問題,同時讓代理不僅能記住事實資訊,還能記住使用者的性格、情緒與關係。
工作原理
VoiceMem 採用「串流雙腦」架構,將記憶分離並處理:
- 左腦:管理依模式與實體組織的事實資訊,實現高精度檢索。
- 右腦:使用獨立且跨實體的節點處理情感智慧、性格與關係資料。
系統在串流管道中運作,使用者說話時即時對音訊進行分段、轉錄與分析(ASR、說話人辨識、情緒偵測)。它使用預測性預取(0–300 毫秒)在使用者說完句子前就檢索相關記憶,僅將最相關的 Top-K 條記憶注入模型上下文,以最小化令牌使用量。
適用對象
需要模型具備持久、低延遲、情感感知的長期記憶,但又不希望上下文視窗過度膨脹的即時語音 AI 代理開發者。
主要亮點
- 低延遲:回應時間僅 134 毫秒,顯著快於 Mem0 等替代方案。
- 高準確率:僅使用 Top-5 記憶,在 LoCoMo 基準測試中達成 91.2% 的準確率。
- 多模態記憶:能從音訊中記住語音、說話人、聲音事件與音樂。
- 令牌高效:每查詢僅使用約 430 個記憶令牌,遠低於其他系統的數千用量。
- 整合管道:將 ASR、說話人辨識與情緒感知整合至記憶吸入流程中。
相關
- 專案
- 專案
- 專案
- 專案