finnvoor/yap

AppleのSpeech.frameworkを使用して、macOS上でファイル、リアルタイムのシステム音声、マイク入力をデバイス上で音声認識するCLIツール。

karanb192/itr-wala

itr‑walaは、インドの個人所得税申告書をローカルで準備するオープンソースのCLIです。 LLMはPDFの読み取りにのみ使用され、すべての法定計算は徹底的にテストされたPythonエンジンが行います。 このツールは入力を検証し、旧制度と新制度を比較し、入力準備が整った申告パックを出力します。 最終的な提出と支払いは、政府ポータルで手動で行う必要があります。

mrthinger/wow-voiceover

ElevenLabs TTSを使用して、World of WarcraftのNPC対話のAI音声を生成・再生するCLIとゲーム内アドオンからなるツールセット。

NSHipster/sosumi.ai

sosumi.ai は Node ベースのサービスで、Apple Developer ドキュメント(Swift ドキュメント、HIG、WWDC トランスクリプトなど)をクリーンな Markdown に変換し、AI モデルや自動化ツールが簡単に扱えるようにします。URL リライト、HTTP/MCP API、CLI、Chrome 拡張機能、Cloudflare Workers または Hono 対応ランタイムでのセルフホスティングが可能です。

McCloudS/subgen

Bazarr、Plex、Jellyfin、Emby と連携する自己ホスト型AI字幕生成ツール。個人用メディアライブラリの音声をトランスクリプトし、字幕を生成します。

nethical6/conversation-steganography

Conversation Stenographyは、AES-SIVで秘密メッセージを暗号化し、ローカルで実行されるLLM(例:Llama 3.2またはGPT-2)のトークン選択に暗号文をエンコードして、自然な見た目のカバー文を出力するオープンソースGo CLIです。ユーザーはそのテキストを任意のチャットアプリにコピーし、受信者は同じツールを実行して隠されたメッセージを復号します。システムは完全にオフラインで動作し、共有シークレットフレーズ(PBKDF2由来の鍵)を使用し、メッセージをチェーンで整合性を保ちます。セットアップウィザード、シミュレーションモード、複数のCLIコマンドを備えていますが、これは概念実証であり、既存のステガノグラフィー検出手法に対して脆弱です。

mikeoliphant/neural-amp-modeler-lv2

NeuralAudioエンジンを使用して、ニューラルネットワーク機械学習アンプモデルを再生するためのLV2プラグイン。

kadirnar/whisper-plus

OpenAIのWhisperを拡張し、トランスクリプト作成、話者ダイアライゼーション、要約、RAGベースの動画会話に対応する包括的な音声・動画処理ツールキット。

vercel-labs/coding-agent-template

認証済みユーザーがAI駆動のコーディングタスク(Claude、Codex、Copilot、Cursor、Gemini、opencode)を作成できるVercelホスティングテンプレート。Vercel Sandboxを起動し、選択されたエージェントを実行、AI生成ブランチに変更をコミット、リアルタイムログを表示。Next.js 15、Tailwind、Neon Postgres、Vercel AI Gatewayで構築。マルチユーザーOAuth、ユーザー別APIキー、イテレーティブ作業向けのオプションサンドボックスKeep-Aliveをサポート。

yym68686/uni-api

uni‑apiは、OpenAI互換APIを1つ提供する設定のみのサーバーであり、OpenAI、Anthropic、Gemini、Vertex、Azure、AWSなど、多数のLLMプロバイダーにリクエストをルーティングします。重み付きおよびラウンドロビンのロードバランシング、自動リトライ、モデルごとのタイムアウト、レート制限、ツールコールの透過、コンテンツモデレーション、細かいリクエストオーバーライドなどを`api.yaml`ファイルまたは`CONFIG_URL`で定義可能。Dockerコンテナとしてデプロイ可能(Fugueのワンクリックボタンを提供)

stenolabs/stenoai

データが施設から決して離れないことを保証するために、機密性の高い会議をデバイス上でローカルに録音、文字起こし、要約する、プライバシー第一のAIメモ帳。

braindecode/braindecode

Braindecode は、生の脳信号データ(EEG/ECoG/MEG)に深層学習モデルを適用するための Python ツールボックスです。データセットローダー、前処理、いくつかの既製ニューラルネットワークアーキテクチャ、および可視化ユーティリティを提供し、これらはすべて PyTorch と MNE-Python の上に構築されています。`pip install braindecode` でインストール可能で、神経生理学的データを扱う神経科学者や機械学習の研究者を対象としています。

SciML/NeuralPDE.jl

NeuralPDE.jl は、物理情報付きニューラルネットワークでODE、SDE、RODE、PDEを解くためのJuliaライブラリです。記号的方程式から自動的に損失関数を生成し、Flux/LuxでGPUトレーニングが可能で、NeuralOperatorsと統合して高度なニューラルオペレータモデルを構築できます。

dimastatz/whisper-flow

OpenAI Whisper を使用したリアルタイム音声認識サービスで、バッチ処理ではなくストリーミングによる低遅延の音声認識を実現します。

BUTSpeechFIT/DiariZen

自己教師あり学習と構造的枝刈りを用いて、音声録音内の「誰がいつ話したか」を正確に特定する話者ダイアリゼーション・ツールキット。

bigsk1/voice-chat-ai

多様なLLMおよびTTSプロバイダーを活用し、リアルタイム会話とローカル音声クローンをサポートする音声駆動型AIインターフェース。

LambdaTest/agent-skills

AIコーディングアシスタント(Claude Code、Copilotなど)向けにプラグイン「スキル」を提供するNode.jsライブラリで、Selenium、Playwright、Cypressなどのテスト自動化コードを生成し、TestMu AIクラウドプラットフォーム上で実行できます。

Quantatirsk/qwen3-asr

Qwen3‑ASR は、Qwen3‑ASR モデル(0.6 B および 1.7 B)をラップした自己ホスト型音声認識サーバーです。GPU‑vLLMバックエンドまたはCPU‑Rustバックエンドを自動選択し、OpenAIおよびAlibaba互換のHTTP/WebSocket APIを提供。話者ダイアライゼーション、VADベースのセグメンテーション、バッチ推論をサポート。Docker、カスタムGPUイメージ、オフラインtarボールでデプロイ可能。MITライセンス。

IBM/LNN

LNN は、論理式を重み付きニューラルネットワークとして表現する Python ライブラリであり、矛盾や不完全な知識があっても、解釈可能で微分可能な推論と学習を可能にします。

huisezhiyin/sdd-riper

SDD‑RIPER Light は、LLMベースのコーディングエージェントにコントロールプレーンを提供する軽量でリポジトリネイティブなフレームワーク。明確なループ(目標の再提示、最小仕様の作成、人間の承認待機、実行、証拠による検証、結果の同期)により、コードの安全な変更、監査可能、回復可能な運用を実現。4つのモジュールスキル(light、strict、codemap、new‑chat‑ready)で日常業務、高リスク作業、不慣れなコードベース、移管に対応。

leiting-eric/DailyBrief

DailyBriefは、26の無料ニュースフィード、21銘柄の市場データ、AI生成要約を統合した自己ホスト型Node/TypeScriptアプリで、バイリンガル(中国語/英語)の単一ページHTMLレポートを生成します。6つの交換可能なLLMバックエンドをサポートし、GitHub Actions + Pages、ローカルワンクリックインストール、AIエージェントインストールの3つのデプロイオプションを提供。コストはLLM APIコールのみ(DeepSeek使用時、月額約1ドル)。

timoncool/ACE-Step-Studio

ACE-Step 1.5 XLモデルを使用して、ボーカル、歌詞、音楽ビデオを含む完全な楽曲をローカルで生成するAI音楽制作スタジオ。

huanchong-99/SoloDawn

SoloDawnは、フルスタックのソフトウェア開発を自動化するオープンソースのWebアプリです。主要なLLM駆動型エージェントが、必要に応じて子エージェントを生成することで、複数のAIコマンドラインツール(Claude Code, Codexなど)をオーケストレーションします。タスクは並列のGitブランチで実行され、それぞれが3層の品質チェックを通過します。生成されたコードが90点のルーブリックを満たしたとき、自動マージされ、簡単な自然言語による説明からプロダクションレベルの製品が提供されます。

strands-labs/ai-functions

Strands AI Functions は、普通の見た目を持つ関数をLLMバックエンドのエージェントに変換するPythonライブラリです。`@ai_function`デコレータを使用すると、ドキュメント文字列でタスクを記述した通常の関数を書くことができます。ライブラリはプロンプトを構築し、モデル(Bedrock、OpenAI、Claudeなど)を呼び出し、型付き結果を解析し、ユーザー定義のポストコンディションが満たされるまで自動的に再プロンプトします。関数は実際のPythonオブジェクト(例:pandas DataFrames)を返すことができ、非同期で実行可能で、*AIスレッド*で状態を保持でき、ローカルまたはWebSocket経由でコアレーターによってチームとしてオーガナイズ可能です。特徴には自己修正ループ、経済的意識のあるモデル選択、メモリバックエンド最適化、および分散エージェントを管理するCLI/TUIがあります。`pip install strands-ai-functions`でインストール可能(Claude、Kiro、Codex用のオプションエクストラあり)

FrigadeHQ/yap

macOS用の軽量でデバイス内音声入力ツール。Appleのネイティブ音声APIを使用して、プライバシーを守りながら、任意のアクティブなアプリケーションに転写されたテキストを貼り付けます。

fluxions-ai/vui

Vui は、音声文字起こし、ローカル LLM、およびストリーミング TTS モデル(Vui Nano, 300M パラメータ)を組み合わせた、オープンソースのリアルタイム音声アシスタント・スタックです。WebRTC/WebSocket パイプライン、ターン・テイキング、割り込み(barge-in)、OpenAI Realtime-API 互換性、ワンショット音声メモ HTTP エンドポイント、プラグイン可能な ASR (faster-whisper または Moonshine) と LLM バックエンド (Ollama, vLLM, OpenAI 互換)、ツール・ルーティング、ボイスクローン、およびオプションの Claude スタイルのタスク委任を提供します。ワンライナー・スクリプトまたは Docker-compose でインストール可能。Linux + NVIDIA GPU、macOS + MLX、および Cloudflare Tunnel や Tailscale 経由のモバイルアクセスをサポートします。

MoonInTheRiver/DiffSinger

歌詞、MIDI、および音高データから高品質な歌声合成およびテキスト読み上げ生成を行うための、拡散モデルベースのフレームワーク。

GetBindu/Bindu

Binduは、任意のLLMベースのエージェントを、セキュアでID検証済み、決済対応のインターネットサービスに変換するオープンソースフレームワークです。組み込みのmTLS、DID署名、Hydra経由のOAuth2、USDC(x402)決済強制、スキル広告、プッシュ通知、ポリグロットSDK(Python、TypeScript、Kotlin)を提供します。`bindufy()` 1回の呼び出しでJSON-RPCエンドポイント、オプションのパブリックトンネル、デプロイヘルパーが得られ、スウォーム、有料API、規制対応B2Bエージェント統合を簡単に構築できます。

watzon/pindrop

デバイス内音声認識エンジンを使用して、プライバシー保護されたオフライン音声からテキストへの変換を実現する Mac ネイティブ AI 音声入力アプリです。

sp-uhh/sgmse

PyTorch 実装の拡散ベース生成モデルによる音声強調とデリバーブ除去。オーディオ信号からノイズと残響を除去します。

prophesier/diff-svc

拡散モデルを使用して、入力された歌声をターゲットの音色に変換し、基本的なピッチ補正をサポートする歌声変換ツールです。

VRCWizard/TTS-Voice-Wizard

VRChatやその他の環境向けのアクセシビリティツールで、音声からテキスト、テキストから音声への変換を行い、リアルタイム翻訳とアバター統合を提供します。

aa0101181514/tw-legal-rag

tw-legal-rag は、2200万件以上の台湾判例、法令、行政処分を含むホストされた意味的検索サービスに接続するオープンソースPython CLIです。自然言語による検索、正確な事件番号の取得、結果(要約、判例履歴、引用許可リストを含む)をJSONファイルにバンドル化、LLM生成回答に対する決定論的な引用検証が可能。ツール自体はLLMを呼び出さず、APIキーも不要で、法律AIアプリケーション向けの検索拡張生成(RAG)フロントエンドとして機能します。

tgies/klattsch

ブラウザ、Node.js、CLIで動作する原始的な並列フォルマント音声合成器。1970年代と80年代のコンピュータ音声のレトロなサウンドを再現します。

MaKTaiL/gemini-srt-translator

Gemini SRT Translatorは、GoogleのGeminiモデルを使用して字幕ファイル(.srt/.ass)を翻訳または音声認識するPythonパッケージです。コマンドラインツール(gst)またはPython APIを通じて動作し、FFmpegで動画から字幕や音声を抽出でき、再開可能なバッチ処理、モデルのチューニング、エンタープライズ向けVertex AI認証に対応しており、AIコーディングエージェント用のスキルとしてインストール可能です。

Stability-AI/stable-audio-metrics

長時間ステレオ音声向けの音楽および音声生成モデルの評価指標のコレクション。フリューゲン距離、KLダイバージェンス、CLAPスコアを計算するためのツールを提供。

HexmosTech/git-lrc

git-lrcは、Goベースのツールで、グローバルGitフックをインストールし、コミットごとにAI駆動のコードレビューを実行します。差分を設定可能なLLM(デフォルトはGemini)に送信し、インラインコメント、リスクスコア、スライド形式の要約を返し、レビュー状況をコミットメッセージに記録します。月間30k LOCまで無料。有料プランは100k LOCあたり32ドルから。

ankur-anand/unisondb

UnisonDBはエッジAI向けに設計されたオープンソースでログネイティブなリアルタイムデータベースです。データはB+ツリー(BoltDBまたはLMDB)に格納されつつ、書き込み先行ログ(WAL)を介してgRPCまたはオブジェクトストア(S3/MinIO)で即座にレプリケーションされます。Raftベースの高可用性書き込み、ミリ秒未満の変更通知、マルチモデル対応(KV、ワイドカラム、大容量オブジェクト)を提供し、数千のエッジノードが別途のストリーミングインフラなしに同期を維持できます。

ratwithacompiler/OBS-captions-plugin

Google Cloud Speech Recognition API を使用して、Twitchのライブ配信およびVODにリアルタイム字幕を提供するOBSプラグインです。

AaronZ345/GTSinger

プロの録音と現実的な楽譜を備えた大規模で多言語の歌唱コーパス。AI歌唱音声合成と技術制御の向上を目的としています。

decocms/studio

deco Studioは、組織がプライベートなAIエージェントを実行できるようにする、オープンソースのTypeScriptファーストなプラットフォームです。モデル呼び出しのルーティング、内部ツールへの安全な接続管理、SSO/RBAC、監査ログ、コスト配分を行うための単一のModel Context Protocol (MCP) コントロールプレーンを提供します。エージェントはコンテキスト、ツール、ポリシーをパッケージ化し、接続はGitHub、Slack、データベースなどのサービス用の暗号化された資格情報を保存し、モデルレイヤーは交換可能です(OpenRouter, Anthropic, OpenAIなど)。システムはローカル、Docker、またはKubernetes上のHelm経由で実行でき、OpenTelemetryによる完全なオブザーバビリティを備えています。

statewright/statewright

Statewrightは、LLMエージェントを決定論的なステートマシンでラップするオープンソースのRustベースフレームワークです。各ステートでのツールポリシー、モデルルーティング、承認ゲートを強制することで、コード生成エージェントの信頼性を高めます。CLI/TUI、ホストプラグイン(Claude Code、Codex、Cursorなど)、自己ホスティング可能なDockerスタックを提供します。

johnmarktaylor91/torchlens

TorchLens は、任意の PyTorch モデル(プレビューでは他のフレームワークも対応)の完全な計算グラフをキャプチャ、可視化、介入するための Python ライブラリです。すべての活性化と勾配を記録し、演算ごとの豊富なメタデータ(形状、dtypes、FLOPs、実行時間、パラメータ数など)を提供。テンソルの照会やフィルタリング、PDF グラフの描画、受容/射影フィールドの計算、前方パス中のリアルタイム介入、再実行による「もしも」実験が可能。11,600 以上のアーキテクチャで検証済みで、約 89% がアルゴリズム的に正確性が保証されています。

JeffreyCA/spleeter-web

Spleeter や Demucs などの AI モデルを使用して、楽曲からボーカル、ベース、ドラムを分離または削除するウェブアプリケーション。

plmbr/notebook-intelligence

Notebook Intelligence (NBI) は、AI チャット、インラインコード生成、オートコンプリート、自律的なノートブック編集エージェントを追加するオープンソースの JupyterLab 拡張機能です。Copilot、OpenAI 互換 API、ローカル Ollama モデル、または Anthropic Claude(Claude Code 経由)と連携します。機能には、Claude 専用ツール、MCP ベースのツール呼び出し、マルチ言語対応、AI 編集ファイルのライブリロードが含まれます。

dectalk/dectalk

クラシックな DECtalk 音声合成エンジンのオリジナルソースコードを、現代のプラットフォーム向けに保存・コンパイルするテキスト読み上げシステム。

Aivis-Project/AivisSpeech

AivisSpeech Engine と ONNX ベースのモデルを使用して、感情豊かな合成音声を生成する日本語テキスト読み上げソフトウェア。

sandrohanea/whisper.net

whisper.cpp を介した OpenAI Whisper 用の Dotnet バインディングで、.NET アプリケーションにおける高パフォーマンスな音声認識と翻訳を実現します。