vb000/LookOnceToHear

A novel human-interaction method for real-time speech extraction on headphones.

何を解決するか

騒音環境における特定話者の音声を聞き取る課題に対処し、ユーザーが数秒間その話者を見つめることで、聞きたい特定の話者を選択できるようにします。

動作方法

システムは音声と視覚の両方の手がかりを組み合わせて使用します。Scaperツールキットを用いてリアルタイムで生成された合成音声ミックスを用いて学習しており、クリーンな音声、背景ノイズ、および頭部関連伝達関数(HRTFs)やバイナリルームインパルス応答(BRIRs)といった空間音響特性を含んでいます。

対象ユーザー

インテリジェントなヘアブル(耳に装着するデバイス)や音響空間認識、マルチモーダルAIシステムによる聴覚支援に取り組む研究者や開発者。

特徴

  • CHI 2024でベストペーパー奨励賞受賞。
  • 学習データとして合成音声生成を活用。
  • 実世界の音響環境を再現するためにバイナリュール音声処理をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト