modelscope/FunASR
Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
何を解決するか
FunASR は、オフライン、ストリーミング、エッジデプロイ向けに設計された産業用音声認識ツールキットで、高パフォーマンスなエンドツーエンド ASR(自動音声認識)を提供します。ユーザーがトランスクリプション、音声活動検出(VAD)、句読点補完、話者ダイアライゼーションに特化したモデルを自由に組み合わせられる柔軟なツールキットの必要性に対応しており、単一のモノリシックモデルに依存するのではなく、目的に応じて最適なモデルを選択できます。
仕組み
このツールキットは、複数の専門モデルを調整する AutoModel パイプラインを使用しています。たとえば、一般的なプロダクションパイプラインでは、トランスクリプションモデル(Paraformer や Fun-ASR-Nano など)と VAD モデル(fsmn-vad)、話者識別モデル(cam++)を組み合わせます。GPUアクセラレーション(vLLM経由)、OpenAI互換APIサーバー、および GGUFフォーマットを用いた高効率CPUおよびエッジデプロイ向けの C++ランタイム(llama.cppベース)をサポートしています。
対象ユーザー
音声対応アプリケーション、AIエージェント、産業用音声サービスを開発する開発者やエンジニア向けです。低レイテンシ、高精度(特に中国語、英語、日本語)を要求する場面で、高級GPUからエッジデバイスまで多様なハードウェアにデプロイ可能な能力が求められます。
特徴
- 高パフォーマンス:Fun-ASR-Nano と vLLM を使用して、最大 340x 実時間速度を達成。
- 多様なモデルズーライブラリ:ASR、感情認識、音声イベント、話者ダイアライゼーションに特化したモデルを提供。
- マルチプラットフォームデプロイ:Python、Docker、および standalone C++バイナリ(llama.cpp経由)で Windows、Linux、macOS に対応。
- 広範な言語対応:31言語以上のチェックポイントを提供。特に中国語の方言や地域訛りに強み。
- エージェント対応:Claude/Cursor 用の MCP サーバー、LangChain および Dify 用の OpenAI互換エンドポイントを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト