vb000/LookOnceToHear
A novel human-interaction method for real-time speech extraction on headphones.
解决的问题
解决在嘈杂环境中听清目标说话者的问题,用户只需注视目标说话者几秒钟,即可选择想要聆听的特定说话者。
工作原理
系统结合了音频和视觉线索。使用 Scaper 工具包实时生成的合成音频混合数据进行训练,包含清晰语音、背景噪声以及头相关传输函数(HRTFs)和双耳房间脉冲响应(BRIRs)等空间音频特性。
适用人群
从事智能可穿戴音频设备、音频空间感知以及多模态AI听力辅助系统的研究人员和开发者。
主要亮点
- 获得 CHI 2024 最佳论文荣誉提名。
- 使用合成音频生成作为训练数据。
- 支持双耳音频处理,以模拟真实世界的声学环境。
相关
- 项目
- 项目
- 项目
- 项目
- 项目