gemelo-ai/vocos
Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis
何を解決するか
Vocos は、音声特徴(メルスペクトログラムや EnCodec トークンなど)から高品質な音声波形を合成するためのニューラルボコーダーです。時間領域とフーリエベースのニューラルボコーダーのギャップを埋め、高速かつ高忠実度の音声再構成を実現することを目指しています。
動作方法
従来の GAN ベースのボコーダーが時間領域で音声サンプルをモデル化するのに対し、Vocos はスペクトル係数を生成します。これらの係数は逆フーリエ変換を使用して音声波形に変換され、1回の順伝播で音声を生成できるため、高速な再構成が可能になります。
対象ユーザー
音声合成システムの開発者や研究者、テキストから音声(TTS)パイプラインの構築者、または Bark などの他の音声モデルと統合したい開発者向けです。
特徴
- 高速合成: 1回の順伝播で波形を生成します。
- スペクトル領域モデリング: 時間領域モデリングではなく、スペクトル係数と逆フーリエ変換を使用します。
- GANベースの学習: 生成的敵対ネットワーク(GAN)の目的関数を使用して学習されています。
- 柔軟な入力: メルスペクトログラムと EnCodec トークンの両方からの再構成をサポートしています。
関連
- プロジェクト
- プロジェクト
RchGrav/claudeboxClaudeBoxは、AnthropicのClaude Code AIコーディングアシスタントを隔離されたコンテナ内で起動するDockerベースのツールです。プロジェクトごとのDockerイメージ、永続的な認証/履歴、および事前設定された開発プロファイル(C/C++、Python、Rust、Goなど)を提供します。マルチインスタンスサポート、ファイアウォール許可リスト、macOSクリップボードブリッジ、tmux統合、シンプルなタスクエンジンなどの機能を備えています。インストールは自己解凍型の.runインストーラーで行い、必要に応じてDockerも自動設定されます。ユーザーはプロジェクトごとに「スロット」(永続的なClaudeセッション)を作成し、プロファイルを追加し、カスタムフラグを指定してClaudeを実行できます。これらすべてを行いながら、プロジェクトデータを隔離し、再現性を維持することが可能です。
- プロジェクト
Tencent-Hunyuan/AuKAuKは、音声生成、編集、強化、音源分離に使える15億パラメータのオープンソース基盤モデルです。自然言語による指示で動作し、高品質なベースモデルと高速な4ステップ蒸留版「Flash」を提供。CLI、Gradio UI、Python API、ファインチューニングスクリプト、ComfyUI統合も備えています。
- プロジェクト
Spielewoy/autoprompt-skillAutoprompt-Skillは、複数のLLMコーディングエージェント(Claude、Codex、OpenCodeなど)をラップし、「記述・テスト・レビュー」のループを自動化するNodeベースのCLIです。npmでインストールし、プロバイダーを選択して `autoprompt activate PROVIDER -- "<goal>"` を実行します(`path=`や並列処理フラグも使用可能)。Terminal-Bench 2.1でのベンチマークでは、実行時間とトークン消費量は増加するものの、失敗率が45%低下(60/89から73/89へ改善)したことが示されています。