vb000/LookOnceToHear
A novel human-interaction method for real-time speech extraction on headphones.
해결하는 문제
소음이 많은 환경에서 특정 화자에게 집중하는 문제를 해결하며, 사용자가 몇 초 동안 특정 화자를 바라보기만 하면 원하는 화자의 음성을 선택할 수 있도록 합니다.
작동 방식
시스템은 음성과 시각적 신호를 결합하여 작동합니다. Scaper 툴킷을 사용해 실시간으로 생성된 합성 음성 믹스를 기반으로 학습하며, 클리어한 음성, 배경 잡음, 그리고 머리관련 전달함수(HRTFs)와 바이너리 룸 임펄스 응답(BRIRs)과 같은 공간 음향 특성을 포함합니다.
대상 사용자
지능형 헤어블 기기, 음향-공간 인지, 청각 보조를 위한 다모달 AI 시스템 개발에 종사하는 연구자 및 개발자.
주요 특징
- CHI 2024 최우수 논문 영예의 언급 수상.
- 학습 데이터로 합성 음성 생성을 활용.
- 실제 세계의 음향 환경을 시뮬레이션하기 위해 이음성 음성 처리를 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트