AutoArk/GPA
[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!
何を解決するか
GPA(General Purpose Audio)は、自動音声認識(ASR)、音声合成(TTS)、音声変換(VC)といった複数の主要な音声タスクを1つのモデルで処理できる統合型モデルの必要性に対応しています。各機能に専用の別々のモデルに依存するのではなく、統合的なアプローチを提供します。
動作方法
GPAは自己回帰型Transformerアーキテクチャを用いて、音声の理解と生成を統合しています。最新バージョンのGPA-v1.5は、推論および学習のためのネイティブPyTorchおよびHugging Faceワークフローを提供しています。デプロイメントには、CLIツール、FastAPIサービス、ブラウザベースのUIをサポートするONNX Runtimeを用意しています。また、Mac、Linux、エッジデバイス向けに最適化された、軽量でスタンドアロンのGPA-TTSランタイムも提供しており、量子化(INT4/INT8)によりメモリ使用量を削減しています。
対象ユーザー
このプロジェクトは、ASRおよびTTSで準SOTA(最先端)性能を発揮する統合音声モデルを求めるAI研究者や開発者、または軽量でエッジ対応の音声クローン用TTSシステムを探しているユーザー向けです。
主な特徴
- 統合アーキテクチャ:ASRとTTSを1つのモデルに統合(VCは今後の計画)。
- 準SOTA性能:より大きなモデルと比較しても、ASRおよびTTSベンチマークで競争力のある結果を提供。
- エッジ対応TTS:ゼロショット音声クローンを備えたスタンドアロンのGPA-TTSランタイム、選択可能なデコーダ精度(INT8、FP16、FP32)。
- 広範なデプロイメント対応:torch、vLLM、llama-cpp、sglang、mlx-lmと互換性があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト