AutoArk/GPA

[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!

何を解決するか

GPA(General Purpose Audio)は、自動音声認識(ASR)、音声合成(TTS)、音声変換(VC)といった複数の主要な音声タスクを1つのモデルで処理できる統合型モデルの必要性に対応しています。各機能に専用の別々のモデルに依存するのではなく、統合的なアプローチを提供します。

動作方法

GPAは自己回帰型Transformerアーキテクチャを用いて、音声の理解と生成を統合しています。最新バージョンのGPA-v1.5は、推論および学習のためのネイティブPyTorchおよびHugging Faceワークフローを提供しています。デプロイメントには、CLIツール、FastAPIサービス、ブラウザベースのUIをサポートするONNX Runtimeを用意しています。また、Mac、Linux、エッジデバイス向けに最適化された、軽量でスタンドアロンのGPA-TTSランタイムも提供しており、量子化(INT4/INT8)によりメモリ使用量を削減しています。

対象ユーザー

このプロジェクトは、ASRおよびTTSで準SOTA(最先端)性能を発揮する統合音声モデルを求めるAI研究者や開発者、または軽量でエッジ対応の音声クローン用TTSシステムを探しているユーザー向けです。

主な特徴

  • 統合アーキテクチャ:ASRとTTSを1つのモデルに統合(VCは今後の計画)。
  • 準SOTA性能:より大きなモデルと比較しても、ASRおよびTTSベンチマークで競争力のある結果を提供。
  • エッジ対応TTS:ゼロショット音声クローンを備えたスタンドアロンのGPA-TTSランタイム、選択可能なデコーダ精度(INT8、FP16、FP32)。
  • 広範なデプロイメント対応:torch、vLLM、llama-cpp、sglang、mlx-lmと互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト