jcvasquezc/DisVoice

feature extraction from speech signals

何を解決するか

DisVoiceは、音声ファイルから音響的および言語的特徴を標準化された方法で抽出するためのフレームワークであり、声の副言語的側面を特定するのに役立ちます。主に感情の認識や、パーキンソン病、ハンチントン病、喉頭がん、口蓋裂などの発声障害によって引き起こされるコミュニケーション障害の検出に使用されます。また、うつ病などの気分障害の検出にも応用されます。

動作方法

このフレームワークは、持続母音と連続音声の両方から広範な音声特徴を計算します。以下の複数の抽出戦略を活用しています:

  • 声門、発声、発音、プロソディ:伝統的な音響分析。
  • 音韻論:音声の音の分析。
  • 表現学習:オートエンコーダーを用いて音声データから特徴表現を学習する。

PraatやKaldiなどの外部ツールと統合されており、信号処理や音韻論的分析の基盤を提供しています。

対象ユーザー

音声病理学、音声を用いた医療診断、感情認識に注力する研究者および臨床医。

特徴

  • 声門、発声、発音、プロソディ、音韻論的特徴の抽出をサポート。
  • 表現学習にオートエンコーダーを使用。
  • 持続母音と連続音声の両方を分析可能。
  • 病的音声および気分関連パターンの分類に設計されている。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト