vb000/LookOnceToHear

A novel human-interaction method for real-time speech extraction on headphones.

解決的問題

解決嘈雜環境中聽取目標說話者聲音的挑戰,使用者只需凝視目標說話者數秒,即可選擇想要聆聽的特定說話者。

工作原理

系統結合音訊與視覺線索。使用 Scaper 工具包即時生成的合成音訊混合資料進行訓練,包含清晰語音、背景雜訊,以及頭部相關傳遞函數(HRTFs)和雙耳房間脈衝響應(BRIRs)等空間音訊特性。

適用對象

從事智慧可穿戴裝置、音訊空間感知,以及多模態AI聽覺輔助系統的研究人員與開發者。

主要亮點

  • 獲得 CHI 2024 最佳論文榮譽提名。
  • 使用合成音訊生成作為訓練資料。
  • 支援雙耳音訊處理,以模擬真實世界的聲學環境。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案