gdstudio-org/Embeat
Content-based music recommendation system, training on Spotify 45M tracks & 1.8M playlists. (Spotify track ID / ISRC in, similar songs out)
해결하는 문제
Embeat은 음악의 소리 특성(음악이 어떻게 들리는지)과 사용자 실제 선호도(협업 필터링)를 결합함으로써 고품질 음악 추천의 과제를 해결합니다. 특히 다양한 언어와 장르에서 히트곡과 장미(장꼬리) 음악 모두에 대해 안정적인 추천을 제공하는 것을 목표로 합니다.
작동 방식
이 시스템은 시드 트랙을 기반으로 추천을 생성하기 위해 다중 채널 리콜 전략을 사용합니다:
- 음향 인코딩:
EmbeatMLP모델은 Spotify의 음향 특징(템포, 에너지, 분위기 등)을 64차원 벡터로 인코딩하여 소리가 유사한 곡을 찾습니다. - 협업 필터링:
Track2Vec모델(Word2Vec Skip-Gram 기반)은 수백만 개의 플레이리스트를 분석하여 공존 패턴을 학습하고, 대중이 자연스럽게 함께 묶는 트랙을 식별합니다. - 장르 통합: 6,000개 이상의 마이크로 장르 태그를 사용하여 장르에 민감한 음악을 정확히 처리합니다.
- 다중 채널 리콜: 음향 유사성, 동일 장르 인기, 동일 아티스트, 유사 아티스트, 플레이리스트 기반 협업 필터링의 다섯 가지 채널에서 추천을 수집합니다. 이 결과는 중복 제거 후 재순위 지정되어 최종 출력됩니다.
대상 사용자
음악 탐색 애플리케이션을 개발하는 개발자 또는 음향 특징 인코딩과 오디오 콘텐츠를 위한 협업 필터링에 관심 있는 연구자에게 적합합니다.
주요 특징
- 하이브리드 접근법: 음향 특징용 이중 타워 MLP와 사용자 행동용 Skip-Gram 모델을 결합합니다.
- 고성능: 블라인드 LLM 평가에서 네이처 클라우드 뮤직과 비교해 84–95%의 높은 승률을 주장합니다.
- 효율적인 배포: 2GB 이상 RAM을 가진 VPS와 같은 저메모리 환경에서도 작동 가능하며, 응답 시간은 30–200ms로 매우 빠릅니다.
- 풍부한 데이터: 4,500만 곡의 데이터셋과 벡터 검색용으로 사전 구축된 Qdrant 데이터베이스를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트