nii-yamagishilab/project-NN-Pytorch-scripts
see README
何を解決するか
このリポジトリは、音声処理のためのツールとスクリプトのコレクションを提供しており、特にニューラル波形モデル(ボコーダー)と音声スプーフィング対策(アンチスプーフィング)を焦点としています。合成音声や改ざんされた音声を検出するためのものです。
仕組み
このプロジェクトは、PyTorchベースの実装のライブラリとして構成されています。トレーニングとデータ入出力のためのコアスクリプト、完成したPyTorchモジュール、および特定のプロジェクトディレクトリが含まれています。各プロジェクトには通常、実行用の main.py、アーキテクチャ用の model.py、データセット設定用の config.py が含まれます。
対象ユーザー
音声合成、音声フォレンジック、音声セキュリティに取り組む研究者や開発者、およびニューラルボコーダーやアンチスプーフィングシステムの実装方法を学びたい人向けに設計されています。
特徴
- 音声スプーフィング対策: 信頼度推定、自己教師学習(SSL)特徴抽出器、アクティブラーニングフレームワークに焦点を当てた複数の実装。
- ニューラルボコーダー: WaveNet、WaveGlow、iLPCNet、ニューラルソースフィルタ(NSF)モデルなど、さまざまな波形モデルの実装。
- 教育リソース: ニューラルボコーダー、アンチスプーフィング、ボイスプライバシーの課題に関するチュートリアルを含む。
- 研究に基づく: ICASSPおよびSLTの複数の論文に関連するコードとリソースを含む。
関連
- プロジェクト
kaanozhan/FrameFrameは、AIコーディングエージェントに永続的でgitアンカーされたコンテキストを提供するElectronベースのIDEです。ルール、モジュールマップ、ノート、タスク、マークダウンベースの仕様(spec/plan/tasks/outcome)を含む標準的な`.frame/`フォルダを作成します。エージェントは各セッションをこのコンテキストから開始し、組み込みのconductorは隔離されたgit worktree内で複数の仕様を並列実行し、重複しないフットプリントを強制し、マージ前に人間の承認を要求します。機能には、マルチターミナルグリッド、タスク/仕様パネル、GitHub統合、高速インテントインデックス検索、Claude Code、Codex CLI、Gemini CLIのサポートが含まれます。インストールは`npm install`またはプレビルドバイナリを通じて行われ、プロジェクトはApache-2.0ライセンスです。
- プロジェクト
ntd4996/agentpetAgentPetは、AIコーディングエージェントのリアルタイム状態を監視し、トークン使用量や完了セッションに応じてレベルアップするタマゴッチ風ペットで体験をゲーム化するクロスプラットフォームデスクトップアプリです。オフライン動作をサポートし、多数のエージェントに対応、プロジェクトごとのダッシュボードを提供し、オプションのWeb同期とリーダーボードも利用可能です。
- プロジェクト
AThevon/genjutsugenjutsu は、Claude‑AIプラグインで、LLMに動きの多いUI要素の追加または再設計を依頼できるようにします。主な2つのスキル – `/genjutsu:cast`(小規模でターゲットされたアニメーション)と `/genjutsu:paint`(大規模な再設計) – は、スタック(React/Vue/Svelte、Compose、SwiftUI)を自動検出し、インタラクション理論を提案、コード(GSAP、Framer Motion、Compose、SwiftUIなど)を生成し、アクセシビリティとパフォーマンスの迅速な審査を実施。1つのZIPバンドルまたは個別のスキルZIPでClaude AI、Claude Code、Coworkにインストール可能。
- プロジェクト
kigner/audio.cpp-webuiggmlに基づいた高性能なC++オーディオ推論フレームワーク。TTS、ASR、ボイスクローニングモデルの高速かつポータブルなローカル実行を、複数のハードウェアバックエンドで実現します。