Zyphra/ZONOS2
ZONOS2は、Mixture-of-Expertsバックボーンを用いた高精細で多言語対応の音声合成モデルであり、自然なボイスクラウンティングと表現力豊かな感情制御を実現します。
understandable-machine-intelligence-lab/Quantus
Quantusは、PyTorch/TensorFlow対応のオープンソースPythonライブラリで、忠実性、ロバスト性、局在化、複雑さ、ランダム化、公理的の6つのカテゴリに分類された35以上の定量的指標を提供します。画像、時系列、表形式データ向けの再現可能でバッチ効率の高いXAI技術評価を可能にし、チュートリアル、ドキュメント、コミュニティサポートを備えています。
ScottZt/jin-ce-zhi-suan
Pythonベースの定量取引プラットフォームで、「三省六部」モデル(唐代官僚制度にインスパイア)を採用。バックテスト、マルチ戦略管理、リスク最優先実行、AI駆動の自然言語株式スクリーニング機能を提供。FastAPI + HTMLダッシュボードで動作し、複数のデータソースに対応。個人・学術利用は無料(商業利用にはライセンスが必要)。
yaojingang/yao-open-skills
Yao Open Skills は、意思決定分析、セキュリティ監査、チュートリアル作成、読書レポート可視化などのタスクに向けた再利用可能なAI「スキル」(構造化されたプロンプト+コードワークフロー)のオープンソースカタログです。各スキルは独自のフォルダにあり、スクリプト、ドキュメント、マルチフォーマットエクスポート(Markdown、HTML、PDFなど)を備えています。リポジトリはレジストリ、公開ルール、ヘルパー スクリプトを提供し、コレクションをクリーンでバージョン管理され、公開検索可能な状態に保ちます。
AddictedCS/soundfingerprinting
音声および動画の指紋認識を可能にするC#フレームワークで、音響的および動画的ハッシュを通じてメディアコンテンツの高速識別を実現します。
OlympiaAI/raix
Raix は、任意の Ruby クラスに LLM チャット、ツール(関数)ディスパッチ、プロンプトチェーン機能を追加する Ruby ライブラリです。RubyLLM/OpenRouter を介して複数のプロバイダーをラップし、トランスクリプトを管理、グローバル/クラス/インスタンスレベルのフックを提供、JSON モード、キャッシュ、プロンプトキャッシュをサポートし、関数とマルチステッププロンプトの宣言用 DSL を提供します。
flyteorg/flytekit
Flytekit Python は、`@task` および `@workflow` デコレータを使用して、純粋な Python で AI/ML ワークフローを記述・テスト・デプロイできる、Flyte の公式 SDK です。`pip install flytekit` でインストールし、クイックスタートガイドに従い、プラグインによる拡張またはドキュメントに従った貢献が可能です。
amsehili/auditok
エネルギー閾値または WebRTC VAD を使用して、音声ストリームをイベントに分割する軽量な Python ライブラリ。
vb000/LookOnceToHear
騒音環境において、数秒間その人物を見つめることで、特定の話者の音声を分離して聞けるインテリジェントなヘアブルシステム。
composio-community/open-chatgpt-atlas
Open ChatGPT Atlas は、Gemini 2.5 Computer‑Use を使ってブラウザを制御し、Composio を通じて 500 を超えるサードパーティサービスを呼び出せる、オープンソースの Chrome/Edge 拡張機能(およびオプションの Electron アプリ)です。Node を使って `dist` フォルダをビルドし、Google とオプションの Composio API キーを追加した後、サイドバーのチャットを使って『このボタンをクリック』や『GitHub にイシューを作成』といった自然言語コマンドを発行できます。視覚フィードバック、セキュリティ確認が可能で、すべてクライアントサイドで実行されます。
InternLM/InternBootcamp
InternAgentHarness(InternBootcamp)は、複数ラウンド・ツール拡張型LLMエージェントの作成、実行、評価に向けたオープンソースフレームワークです。研究者が合成タスクを定義し、検証済みの外部ツールを公開し、複数ラウンドの対話を管理し、報酬を計算し、完全な対話トレースをログに記録することで、データ生成やRLトレーニングが可能になります。
pmarreck/yt-transcriber
Whisperを使用してYouTube動画やローカルメディアファイルを音声認識するCLIツール。AIによる要約と翻訳機能もオプションで利用可能。
audeering/opensmile-python
機械学習研究における標準化された音声特徴の抽出を可能にする、openSMILE 用の Python インターフェース。
runesleo/claude-code-workflow
QuietHarness は、AIコーディングエージェント(Claude Code、Codex、Cursor)用の小さなオープンソースの安全レイヤーです。共有設定テンプレート、ドライランインストールスクリプト、自動バックアップ、リスクゲート操作により、エージェントがファイルを上書きしたり、テストをスキップしたり、元に戻せない操作を実行する前に確認を得られるようにします。プロジェクト単位またはグローバルにインストール可能で、完全にオフラインで動作し、MITライセンスで提供されています。
CaptainYifei/fake-news-detector
Streamlitベースのウェブアプリで、LLM(例:Qwen2.5)とBGE‑M3埋め込みを活用し、ニュース記事から主張を抽出、DuckDuckGo/SearXNG経由でWeb証拠を取得、3ノードパイプラインで検証。中国語、英語、日本語、韓国語に対応、複数のモデルプロバイダー、ユーザー認証、履歴、PDFレポートをサポート。
Jittor/jittor
Jittor は、計算グラフ全体を JIT コンパイルし、メタ演算子を使って特定のモデルに最適化された CUDA/C++ カーネルを生成する高性能ディープラーニングフレームワークです。PyTorch に似た Python API を提供し、CPU および GPU バックエンド(CUDA、ROCm、Hygon)をサポートしており、ビジョン、レンダリング、幾何学的学習、強化学習向けのモデルズーも備えています。
yxlllc/DDSP-SVC
従来のSVCモデルと比べて、はるかに低いハードウェア要件と高速な学習時間を実現する、高品質なAIボイスチェンジを可能にする効率的な歌唱音声変換プロジェクト。
strob/gentle
Kaldiをベースに構築された、音声オーディオとテキストトランスクリプトを同期させ、正確な単語レベルのタイミングを提供する堅牢な強制アライナー。
appleboy/CodeGPT
CodeGPT は Go で作られた CLI で、LLM API(OpenAI、Azure、Gemini、Anthropic、Ollama、Groq、OpenRouter)を使用して、Conventional-Commit メッセージと簡潔なコードレビュー要約を自動生成します。Git `prepare-commit-msg` フックのインストール、カスタムプロンプト、言語翻訳、ストリーミング出力、柔軟な設定(APIキー、プロバイダー、プロキシ、差分コンテキストなど)をサポート。Homebrew、Chocolatey、スクリプト、バイナリ、または `go install` でインストール可能。
VOICEVOX/voicevox_core
VOICEVOXのコア音声合成エンジンを、さまざまなアプリケーションに簡単に統合できるCおよびPythonライブラリとして提供。
DataBassGit/AgentForge
AgentForgeは、AI駆動の自律エージェントの構築、テスト、反復開発に向けた低コードPythonフレームワークです。Cogs(宣言的YAMLファイル)を使用してエージェントを構成し、オプションのメモリを接続し、マルチエージェントワークフローをオーケストレーションできます。OpenAI、Gemini、Claude、およびOllama/LMStudio経由のローカルモデルをサポートしています。
fishaudio/fish-diffusion
マルチスピーカー学習と効率的なハードウェア利用をサポートする、Text-to-Speech、Singing Voice Synthesis、Singing Voice Conversion向けのDiffusionベースのトレーニングフレームワーク。
wavlab-speech/versa
音声とオーディオの品質、了解度、技術的特性を評価するための90以上のメトリクスへの統一インターフェースを提供する包括的なツールキット。
BakeLens/crust
Crustは、AIコーディングアシスタントとLLMプロバイダーの間に配置されるオープンソースでローカル実行型のプロキシです。すべてのツール呼び出し(ファイル読み取り、シェルコマンド、ネットワークリクエストなど)を監視し、シークレットの漏洩やホストへの損害を引き起こす可能性のあるアクションをブロックします。ゲートウェイはHTTPプロキシ、MCP/ACP stdioラッパー、またはDockerコンテナとして動作し、42の組み込みセキュリティルール、51のDLPパターン、カスタムポリシー用のプラグインシステムを備えています。ユーザーのマシン上で完全に実行され、ログはOSキーリングで暗号化して保存され、Swiftパッケージを通じてiOS統合も可能です。
Stability-AI/stable-codec
テキストから音声への変換(TTS)などの下流タスクに最適化された、高品質で低ビットレートの音声符号化方式。音声を離散トークンに圧縮する。
Deep-unlearning/smol-audio
Hugging Faceエコシステムを活用した、ASRおよび音声キャプションを含む音声AIモデルのファインチューニングと最適化に役立つ実用的なノートブックのコレクション。
Kocoro-lab/Kocoro
Kocoroは、macOS向けのオープンソースAIエージェントデーモン(`shan`)で、言語モデルエージェントがファイルの読み書き、アプリの制御、シェルコマンドの実行、ブラウザの自動化、Slack/Telegramとの連携を可能にします。CLI/TUI、HTTP API、MCPストリーミング、リアルタイム音声フロントブレインを提供。npm、スクリプト、またはGoビルドでインストール可能。LLMの補完にはShannon Cloudまたは自己ホストゲートウェイを設定。デーモンは権限管理、エージェントごとのメモリ、スケジューリング、拡張可能なツールを処理。別途の閉鎖型GUI(Kocoro Desktop)が洗練されたインターフェースを提供。MITライセンス。
milady-ai/milady
Miladyは、ローカル(またはセルフホスト/クラウドバックエンド経由)で実行されるプライバシー最優先の個人用AIアシスタントです。3Dアバターを備えたデスクトップアプリ、マルチプラットフォームチャット接続、プログレッシブなアクションストリーミング、および組み込みのBNBスマートチェーン取引機能を提供します。macOS/Windows/Linux用の署名済みインストーラーでインストール可能、またはCLI(`milody setup`)を使用。システムはエネルギー意識型で、プラグイン拡張可能であり、APIトークンで安全にリモートバックエンドとして公開可能です。
absadiki/pywhispercpp
複数のハードウェアアクセラレーションバックエンドをサポートする、高パフォーマンスな音声認識を実現する Python バインディング。
microsoft/cognitive-services-speech-sdk-js
Microsoft Cognitive Services の音声機能を利用するために、ブラウザや Node.js で音声文字起こしや音声合成を実現する JavaScript SDK です。
ASLP-lab/MeanVC
MeanVCは、mean flowsとdiffusion transformerを使用して、リアルタイムかつ単一ステップでの音色転送を可能にする、軽量なゼロショット音声変換システムです。
Prorise-cool/Claude-Code-Multi-Agent
Claude Code Multi‑Agent は、Anthropic の Claude Code プロジェクトに認識能力とエキスパートエージェント機能を追加するオープンソースフレームワークです。Python Hook システムとローカル実行の Ollama モデルを使用して、コードベースの種類を自動検出、ユーザーの意図を分析、300以上ものドメイン固有の「スキル」(バックエンド、フロントエンド、テスト、セキュリティなど)をロードし、自動ドキュメント(DEVELOPMENT.md、KNOWLEDGE.md、CHANGELOG.md)を強制します。リポジトリをクローンし、Ollama、モデル、uv をインストールした後、プロジェクトをリポジトリに配置するだけで、Claude Code は即座にコンテキストを把握し、適切なツールを提案し、`/backend‑specialist` や `/kiro/spec` のようなスラッシュコマンドで操作できます。 主な特徴: - ゼロ構成スタート;すべての設定は `.claude/settings.json` と `prompts.json` に保存。 - セッション開始、ユーザーのプロンプト、ツール使用などに応じて実行される Hooks で、プロジェクト検出、意図分析、ドキュメント更新を処理。 - Skills は `SKILL.md` ファイルで定義され、自動検出される。 - 外部 API を一切使わず、完全にローカルで動作。Git と統合可能。MIT ライセンス。 個人開発者や小さなチームが再現可能でオンプレミスの AI コーディングアシスタントを必要とする場合に最適です。
vercel/next-evals-oss
Next.js Evals は、実世界の Next.js タスク上で AI コードエージェントを自動的にテストする Vercel 維持のフレームワークです。`vercel/next.js` リポジトリから評価用のフィクスチャを同期し、Vercel サンドボックス内でエージェントを実行し、隠しアサーションを確認し、成功/失敗、トークン使用量、コストを記録し、JSON リーダーボードをエクスポートして、公開された Next.js 評価サイトを駆動します。
PierrunoYT/Kokoro-TTS-Local
54の多言語ボイスと完全なオフライン対応を備えた、Kokoro-82Mテキストto音声モデルのローカル実装。Webインターフェースも搭載。
MisoLabsAI/MisoTTS
会話形式の英語音声生成およびボイスクローニングのための、高品質なテキスト対話型RVQ Transformerモデル。
OpenBMB/UltraEval-Audio
音声理解と生成の両方を34のベンチマークでサポートする、大規模音声基盤モデルの評価に向けた統一されたオープンソースフレームワーク。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammarは、Kaldi音声認識エンジンのPythonラッパーで、多数の小さな文法をコンパイルし、発話ごとに必要なものだけを有効化できる。主要OS向けのバイナリwheelを同梱、事前学習済み英語モデルを提供、DragonflyおよびCaster音声制御フレームワークのバックエンドを備える。pipでインストール、モデルをダウンロード、ルールを定義し、文脈に応じたコマンド制御を動的に有効化できる。
filippogiruzzi/voice_activity_detection
1D-ResNetとMFCC特徴量を使用して、音声信号を音声またはノイズとして分類する、ディープラーニングベースの音声活動検出(VAD)システム。
dictation-toolbox/dragonfly
Python 用の音声認識フレームワークで、ユーザーがカスタム音声コマンドを作成し、コンピュータ操作の自動化や音声によるプログラミングを実現できます。
algolia/voice-overlay-ios
Apple のネイティブ `SFSpeechRecognizer` を使用して、権限管理と音声認識を行う、洗練された音声文字起こしオーバーレイ UI を提供する iOS ライブラリです。
sveinbjornt/hear
macOS用のコマンドラインインターフェースで、システム内蔵の音声認識機能を使用してライブマイク入力とオーディオファイルの音声認識を可能にします。
Picovoice/rhino
Rhinoは、Picovoiceが提供するデバイス上での音声から意図を抽出するエンジンです。話されたコマンドをリアルタイムで構造化された意図(intent)とスロット(slot)に変換します。マイクロコントローラからスマートフォン、ブラウザ、デスクトップまで、あらゆるデバイス上でローカルに動作し、多言語をサポートし、Python, .NET, Java, Flutter, React Native, Android, iOS, Web, Node.js, CのSDKsを提供しています。
openspeech-team/openspeech
エンドツーエンド自動音声認識(ASR)システムを構築するためのフレームワークで、20以上のASRモデルの参照実装と複数言語用のレシピを提供しています。
yeyupiaoling/MASR
複数のモデルアーキテクチャと言語に対応するストリーミングおよび非ストリーミング推論をサポートする、PyTorchベースの自動音声認識フレームワークです。
mybigday/whisper.rn
デバイス内Whisper(およびNVIDIA Parakeet)音声認識のReact Nativeバインディング。GPU/Core ML加速、音声活動検出(VAD)、リアルタイムストリーミングをサポート。
TheStageAI/TheWhisper
NVIDIA GPUおよびApple Silicon上で、低レイテンシのストリーミングとデバイス内推論に最適化された、ファインチューニングされたWhisperモデルに基づく高パフォーマンスな音声認識ソリューション。
TensorSpeech/TensorFlowASR
ext{TensorFlow ベースの自動音声認識 (ASR) フレームワーク。様々な ASR アーキテクチャを実装し、効率的なデプロイのために TFLite 変換をサポートしています。}
sooftware/conformer
CNNとTransformerを組み合わせ、局所的および大域的な音声依存関係を捉えることで音声認識を向上させるConformerアーキテクチャのPyTorch実装。