gdstudio-org/Embeat
Content-based music recommendation system, training on Spotify 45M tracks & 1.8M playlists. (Spotify track ID / ISRC in, similar songs out)
解決的問題
Embeat 透過結合音訊相似性(歌曲聽起來如何)與協同過濾(使用者實際喜好的內容),解決高品質音樂推薦的挑戰。它特別致力於為各種語言與類型的熱門歌曲與長尾小眾歌曲,提供穩定可靠的推薦。
工作原理
該系統採用多通道召回策略,基於種子歌曲生成推薦結果:
- 音訊編碼:
EmbeatMLP模型將 Spotify 音訊特徵(如節奏、能量與情緒)編碼為 64 維向量,以找出聲音相似的歌曲。 - 協同過濾:
Track2Vec模型(基於 Word2Vec Skip-Gram)分析數百萬個播放清單,學習共現模式,識別大眾傾向一起組合的曲目。 - 類型整合:使用超過 6,000 個微類型標籤,確保小眾音樂能被準確處理。
- 多通道召回:從五個通道收集推薦結果:音訊相似性、同類型流行度、同一藝術家、相似藝術家、播放清單協同過濾。這些結果隨後去重並重新排序,生成最終輸出。
適用對象
專為開發音樂探索應用的開發者,或對音訊特徵編碼與音訊內容協同過濾感興趣的研究人員設計。
核心亮點
- 混合方法:結合雙塔 MLP 用於音訊特徵,以及 Skip-Gram 模型用於使用者行為。
- 高性能量:在盲測 LLM 評估中,對 Netease Cloud Music 的勝率高達 84–95%。
- 高效部署:支援低記憶體環境(如 2GB+ RAM 的 VPS),回應時間快速(30–200ms)。
- 豐富資料:包含 4500 萬首歌曲的資料集,以及預先建構的 Qdrant 向量資料庫,用於向量搜尋。
相關
- 專案
- 專案
- 專案
- 專案