xzf-thu/VoiceMem

Infrastructure for the next generation of voice agents, designed to provide universal memory. It is divided into a left brain and a right brain, storing information and emotions respectively, while a fully streaming architecture eliminates latency at the fundamental level.

何を解決するか

VoiceMem は、リアルタイム音声エージェントに特化した長期記憶システムを提供します。従来の記憶取得における高遅延と高トークンコストという問題を解決しつつ、ユーザーの性格、感情、関係性といった情報を単なる事実情報だけでなく記憶可能にします。

動作方法

VoiceMem は「ストリーミング・デュアルブレイン」アーキテクチャを採用し、記憶を分離・処理します:

  • 左脳:スキーマとエンティティで整理された事実情報を管理し、高精度な検索を実現します。
  • 右脳:独立したノードおよびエンティティ間の関係を用いて、感情知能、性格、関係性データを処理します。

システムはストリーミングパイプラインで動作し、ユーザーが話している最中に音声をセグメント化、音声認識(ASR)、話者識別、感情検出を行い分析します。ユーザーが発話を終える前に、予測的プリフェッチ(0–300 ms)により関連する記憶を取得し、モデルコンテキストに注入するのはTop-Kの最も関連性の高い記憶のみで、トークン使用量を最小限に抑えます。

対象ユーザー

リアルタイム音声AIエージェントを開発する開発者で、コンテキストウィンドウが肥大化することなく、持続的で低遅延かつ感情に配慮した長期記憶を持つモデルを必要とする人。

特徴

  • 低遅延:134 msの応答時間。Mem0などの代替手段よりも大幅に高速。
  • 高精度:Top-5の記憶のみを使用してLoCoMoベンチマークで91.2%の精度を達成。
  • マルチモーダル記憶:音声、話者、音響イベント、音楽を音声から記憶可能。
  • トークン効率:他のシステムが数千トークンを使用するのに対し、約430トークン/クエリで運用。
  • 統合パイプライン:ASR、話者識別、感情認識を記憶インジェストプロセスに統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト