Deep-unlearning/smol-audio
Practical, Colab-friendly notebooks for fine-tuning and running audio AI models
해결하는 문제
자동 음성 인식(ASR) 및 음성 캡셔닝과 같은 전문적인 작업을 위해 모델을 축소하고 최적화하는 데 중점을 둔, 음성 AI 모델의 실용적이고 실습 중심의 가이드를 제공합니다.
작동 방식
이 프로젝트는 Hugging Face 생태계를 사용하여 다양한 음성 모델을 파인튜닝하는 방법을 보여주는 Jupyter 노트북 모음으로 구성되어 있습니다. Whisper, Granite Speech, Audio Flamingo 3, Parakeet, Voxtral 등의 여러 모델 아키텍처에서 전체 파인튜닝과 저랭크 적응(LoRA)과 같은 다양한 기술을 다룹니다.
대상 사용자
기존 음성 모델을 커스텀 언어, 특정 도메인, 또는 음성-비디오 검색 및 분류와 같은 새로운 작업에 맞게 조정하고자 하는 개발자 및 AI 전문가.
주요 특징
- Whisper, Granite Speech, Parakeet, Voxtral 등 여러 모델에서 ASR 파인튜닝 지원.
- Audio Flamingo 3를 활용한 음성 캡셔닝 가이드.
- 효율적인 모델 맞춤화를 위한 전체 파인튜닝 및 LoRA 구현.
- Meta의 Perception Encoder for Audio-Video(PE-AV)를 사용한 제로샷 비디오 분류 및 음성-텍스트 검색 예시.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 프로젝트