HeartMuLa/heartlib

HeartMuLa Official Repo: The Most Powerful Open-Source Music Generation Model of 2026

解決的問題

HeartMuLa 提供了一套開源音樂基礎模型,旨在根據歌詞和標籤生成高品質音樂。它解決了對可控、多語言音樂生成和高保真音訊重建的需求,為音樂音訊的創作與分析提供了工具。

運作原理

該專案包含四個主要組件:

  • HeartMuLa:一個音樂語言模型,根據提供的歌詞和標籤生成音訊,並支援多種語言。
  • HeartCodec:一個 12.5 Hz 音樂編解碼器,將音訊轉換為離散標記,並以高保真度重建 48 kHz 立體聲音訊。
  • HeartTranscriptor:一個基於 Whisper 的模型,專門針對從音訊中轉錄歌詞進行了微調。
  • HeartCLAP:一個音訊-文字對齊模型,為音樂描述和跨模態檢索創建了統一的嵌入空間。

此外,該專案還包括 MuLaCover,這是一個用於可控翻唱和音樂混音的模型,它使用符號旋律與和聲來保留音樂特徵,同時允許更改流派、情緒和樂器編制。

目標用戶

此工具包適用於音樂製作人、音訊/音樂生成領域的 AI 研究人員,以及需要高保真、可控音樂合成與轉錄功能的音樂應用開發者。

特色亮點

  • 多語言支援:基於幾乎所有語言的歌詞生成音樂。
  • 高保真度:HeartCodec 支援 48 kHz 立體聲音訊的重建。
  • 可控性:透過強化學習 (RL) 優化,實現對音樂風格和標籤的精確控制。
  • 完整生態系統:包含生成、標記化、重建和轉錄工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案