vb000/LookOnceToHear
A novel human-interaction method for real-time speech extraction on headphones.
解決的問題
解決嘈雜環境中聽取目標說話者聲音的挑戰,使用者只需凝視目標說話者數秒,即可選擇想要聆聽的特定說話者。
工作原理
系統結合音訊與視覺線索。使用 Scaper 工具包即時生成的合成音訊混合資料進行訓練,包含清晰語音、背景雜訊,以及頭部相關傳遞函數(HRTFs)和雙耳房間脈衝響應(BRIRs)等空間音訊特性。
適用對象
從事智慧可穿戴裝置、音訊空間感知,以及多模態AI聽覺輔助系統的研究人員與開發者。
主要亮點
- 獲得 CHI 2024 最佳論文榮譽提名。
- 使用合成音訊生成作為訓練資料。
- 支援雙耳音訊處理,以模擬真實世界的聲學環境。
相關
- 專案
- 專案
- 專案
- 專案
- 專案