Deep-unlearning/smol-audio

Practical, Colab-friendly notebooks for fine-tuning and running audio AI models

何を解決するか

音声AIモデルの最適化とカスタマイズの実践的で実践的なガイドを提供し、特に自動音声認識(ASR)や音声キャプションなどの専門的なタスク向けにモデルの小型化とファインチューニングに焦点を当てています。

仕組み

このプロジェクトは、Hugging Faceエコシステムを使用してさまざまな音声モデルをファインチューニングする方法を示すJupyterノートブックのコレクションで構成されています。Whisper、Granite Speech、Audio Flamingo 3、Parakeet、Voxtralなどの複数のモデルアーキテクチャにおいて、フルファインチューニングと低ランク適応(LoRA)などのさまざまな技術をカバーしています。

対象ユーザー

既存の音声モデルをカスタム言語、特定のドメイン、または音声・動画検索や分類などの新しいタスクに適応させたい開発者やAI実践者。

主な特徴

  • Whisper、Granite Speech、Parakeet、Voxtralなど複数のモデルでのASRファインチューニング対応。
  • Audio Flamingo 3を用いた音声キャプションのガイド。
  • 効率的なモデルカスタマイズのためのフルファインチューニングとLoRAの実装。
  • MetaのPerception Encoder for Audio-Video(PE-AV)を用いたゼロショット動画分類および音声・テキスト検索の例。

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト