audeering/opensmile-python

Python package for openSMILE

解決的問題

本專案提供 openSMILE 工具包的 Python 接口,讓使用者能從音訊檔案中提取標準化的音訊特徵,用於音訊-視覺訊號的機器學習。

運作方式

該程式庫允許使用者指定特徵集(例如 ComParE 2016、GeMAPS 或 eGeMAPS)和特徵層級(低階描述子或函數性特徵)。接著處理音訊檔案以提取這些特定的聲學特徵,可作為機器學習模型的輸入。

適用對象

從事音訊分析與音訊-視覺訊號機器學習的研究人員與開發者,需要標準化、高維度音訊特徵提取者。

主要亮點

  • 標準化特徵集:支援 ComParE 2016(超過 6,000 個特徵)、GeMAPS 與 eGeMAPS。
  • 多種提取層級:支援低階描述子(LDD)與函數性特徵,以及 ComParE 2016 的 LLD 差分。
  • 簡易 Python API:僅需幾行程式碼即可從音訊檔案中提取特徵。
  • 社群擴充:社群已新增額外的特徵集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案