QwenAudio/Fun-ASR
Open-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.
何を解決するか
Fun-ASR は、現実世界の困難な音声データを処理できる高精度なエンドツーエンド音声認識(ASR)を提供します。特に、強い背景ノイズが混在する音声、遠方からの音声収集(会議室や車内など)および多様な中国語方言や地域訛りの複雑さに対応しています。
動作方法
このプロジェクトは、特に 800M パラメータの Nano チェックポイントを含むモデル群を提供します。これらのモデルは、数千万時間に及ぶ大規模なデータセットで学習されており、堅牢性を確保しています。システムは以下の方法でデプロイ可能です:
- PyTorch ネイティブ: 一般的な用途向けの標準的な推論。
- vLLM エンジン: バッチ処理において 3~5 倍高速な高スループットパスであり、リアルタイム字幕用の生産レベルの WebSocket ストリーミングもサポート。
- llama.cpp/GGUF: Pythonランタイムを必要とせず、CPUやエッジデバイスでモデルを実行できる自己完結型バイナリバージョン。
- 組み合わせパイプライン: Nano モデルはネイティブで話者ラベルやタイムスタンプを処理できませんが、別途モデル(例:FSMN-VAD による音声活動検出、CAM++ による話者ダイアライゼーション)と組み合わせることで、ラベル付きのトランスクリプトを生成できます。
対象ユーザー
ノイズが多い環境での高精度な音声認識を必要とする、東アジアおよび東南アジア諸語を幅広くサポートする、またはリソース制約のあるエッジハードウェアにデプロイ可能な音声認識アプリケーションを開発する開発者やエンジニア向けです。
主な特徴
- 広範な言語対応: 31 言語をサポートするマルチリンガルチェックポイントと、中国語、英語、日本語、および 7 種類の主要中国語方言を専門的に扱う専用 Nano チェックポイントを提供。
- ノイズ耐性: 遠方音声および高ノイズ環境に最適化され、認識精度が最大 93% に達します。
- 専門的な認識能力: 音楽のバックグラウンドがある状況でも、歌詞やラップ音声を認識可能。
- 高性能: vLLM 統合により、バッチトランスクリプションにおいて PyTorch ネイティブ比で最大 16 倍の高速化を実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト