modelscope/FunASR

Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.

何を解決するか

FunASR は、オフライン、ストリーミング、エッジデプロイ向けに設計された産業用音声認識ツールキットで、高パフォーマンスなエンドツーエンド ASR(自動音声認識)を提供します。ユーザーがトランスクリプション、音声活動検出(VAD)、句読点補完、話者ダイアライゼーションに特化したモデルを自由に組み合わせられる柔軟なツールキットの必要性に対応しており、単一のモノリシックモデルに依存するのではなく、目的に応じて最適なモデルを選択できます。

仕組み

このツールキットは、複数の専門モデルを調整する AutoModel パイプラインを使用しています。たとえば、一般的なプロダクションパイプラインでは、トランスクリプションモデル(Paraformer や Fun-ASR-Nano など)と VAD モデル(fsmn-vad)、話者識別モデル(cam++)を組み合わせます。GPUアクセラレーション(vLLM経由)、OpenAI互換APIサーバー、および GGUFフォーマットを用いた高効率CPUおよびエッジデプロイ向けの C++ランタイム(llama.cppベース)をサポートしています。

対象ユーザー

音声対応アプリケーション、AIエージェント、産業用音声サービスを開発する開発者やエンジニア向けです。低レイテンシ、高精度(特に中国語、英語、日本語)を要求する場面で、高級GPUからエッジデバイスまで多様なハードウェアにデプロイ可能な能力が求められます。

特徴

  • 高パフォーマンス:Fun-ASR-Nano と vLLM を使用して、最大 340x 実時間速度を達成。
  • 多様なモデルズーライブラリ:ASR、感情認識、音声イベント、話者ダイアライゼーションに特化したモデルを提供。
  • マルチプラットフォームデプロイ:Python、Docker、および standalone C++バイナリ(llama.cpp経由)で Windows、Linux、macOS に対応。
  • 広範な言語対応:31言語以上のチェックポイントを提供。特に中国語の方言や地域訛りに強み。
  • エージェント対応:Claude/Cursor 用の MCP サーバー、LangChain および Dify 用の OpenAI互換エンドポイントを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト