kigner/audio.cpp-webui

audio.cpp with a full-task WebUI - pure C++ audio-model inference engine powered by ggml. TTS, ASR/STT, VAD, voice conversion, speaker diarization, music generation. No Python dependency.

解決する課題

このプロジェクトは、さまざまなオーディオAIモデルをローカルで実行するための、高性能でポータブルなC++ランタイムを提供します。Windows、Linux、macOSで動作する共有ネイティブランタイムを提供し、NVIDIA、AMD、Apple Siliconハードウェアをサポートすることで、複雑なPython環境や依存関係の競合を排除します。

仕組み

ggmlの上に構築されたこのフレームワークは、オーディオモデル向けに最適化された実行パスを提供します。GGUFのロードと量子化(例:Q8)をサポートしており、これによりVRAMの使用量を削減し、推論速度を向上させます。システムには、モデル管理と実行のためのGradioベースのWebUI、およびCLIとサーバーのエントリポイントが含まれています。また、ノイズ除去、リサンプリング、音質向上のための組み込みオーディオユーティリティも備えています。

対象ユーザー

最先端のオーディオモデル(TTS、ASR、ボイスクローニング)を、最小限のセットアップオーバーヘッドで効率的にローカル実行したい開発者やユーザー。特に、単なるデモではなく、プロダクションレベルのエンドツーエンドの実行を目指す方に適しています。

ハイライト

  • 幅広いモデルサポート: Text-to-Speech (TTS)、Automatic Speech Recognition (ASR)、ボイスクローニング、音源分離、音楽生成などのタスクにわたり、40以上のモデルファミリーをサポートしています。
  • 極めて高いパフォーマンス: Pythonのリファレンスパスと比較して大幅な高速化を実現しており、一部のモデルはCUDA上で最大200倍のリアルタイム実行が可能です。
  • ハードウェアのポータビリティ: CUDA、HIP/ROCm、Vulkan、Metal、およびCPUバックエンドをネイティブにサポートしています。
  • GGUF統合: 効率的なモデルロードとメモリフットプリントの削減のために、GGUFを広範に使用しています。
  • 統合されたWebUI: CLIコマンドを使用せずに、ダウンロードの管理やオーディオワークフローの実行ができるユーザーフレンドリーなインターフェースを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト