ogulcancelik/pi-extensions

PiというターミナルベースのコーディングアシスタントをUIフッター、セッション検索、自動権限、サブエージェント、ワークツリー処理、その他のユーティリティで拡張するnpmベースのプラグイン群です。

asklokesh/loki-mode

Loki Mode は、製品仕様を完全に構築・テスト・検証されたコードベースに変換するオープンソースの CLI/SDK です。自律的な LLM ベースのワークフロー(Reason-Act-Reflect-Verify)を実行し、8つの品質ゲートチェックを実施。誰でも再検証可能な暗号的に結合された「証拠レシート」を発行します。bun/npm/Homebrew/Docker でインストール可能。新規アプリは `loki quickstart`、既存リポジトリの改善は `loki modernize heal` を使用。Anthropic API キー(または互換モデル)が必要で、監査可能でプロダクション品質のコード生成に特化しています。

kaixxx/noScribe

データプライバシーを確保するために研究者やジャーナリスト向けに設計された、ローカル音声文字起こしと話者識別を行うための無料のオープンソースアプリケーション。

knowsuchagency/mcp2cli

mcp2cli は、MCP サーバー、OpenAPI 仕様、または GraphQL エンドポイントを即座に使用可能なコマンドラインツールに変換する実行時 CLI 生成器です。OAuth、secret-safe フラグ、baked configurations、usage-aware ranking、および machine-readable JSON 出力に対応しており、LLM エージェントと開発者が最小限のトークンオーバーヘッドで API を呼び出せるようにします。

ken107/read-aloud

ChromeおよびFirefox用のブラウザ拡張機能で、テキスト読み上げ技術を使用してウェブページのテキストを音声に変換し、アクセシビリティの向上とマルチタスクを支援します。

plasma-umass/scalene

Scaleneは、CPU、GPU (NVIDIA)、メモリの使用量を測定する高速な行レベルのPythonプロファイラです。Pythonとネイティブコードを分離し、統合されたスタックを可視化し、UIから直接LLM(OpenAI、Azure、Bedrock、Ollamaなど)に最適化の提案を求めることができます。

ZaxbyHub/opencode-swarm

OpenCode Swarm は、1つのAIコーディングプロンプトを、レビュー、テスト、セキュリティスキャン、ドキュメント化を強制するゲート付きプロダクション準備完了ワークフローに変換する OpenCode プラグインです。13言語をサポートし、再開可能なセッション、PRモニタリング、複数の安全/速度モードを提供します。`bunx opencode‑swarm install`でインストール;`~/.config/opencode/opencode‑swarm.json`で設定;`/swarm agents`、`/swarm status`、`/swarm auto‑proceed`などのスラッシュコマンドでプロセスを制御します。

librosa/librosa

音楽情報検索システムを構築するための基礎的なツールを提供する、オーディオおよび音楽信号処理用のPythonライブラリ。

SamadhiFire/xinqingnian-maoxuan-skill

Claude/Codex用のスキルで、行き詰ったプロジェクト、チームの対立、人生の意思決定に対して4段階の「毛スタイル」分析を実行し、簡潔なテキスト要約とオプションの単一ファイルHTMLレポートを出力します。

TaoLiveAIGC/TaoMate

TaoMate は研究用のリアルタイム音声・映像デジタル人間生成システムです。リポジトリには推論コード、マルチGPU起動スクリプト、4GPU対応のインタラクティブブラウザーデモが含まれます。22BのLTX-2.3トランスフォーマー、Gemma-3テキストエンコーダ、およびオプションのGemma-4会話モデルを統合しており、高メモリのNVIDIA GPUとHugging Faceからの別途のモデルチェックポイントが必要です。

diodiogod/TTS-Audio-Suite

TTS Audio Suite は、19のテキストから音声、ボイス変換、オーディオ編集エンジン(例:F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)を統合する ComfyUI 拡張です。字幕対応生成、セグメントごとのタグ、波形の可視化、サイレントスピーチのタイミング解析、組み込みのRVCモデル学習機能を備え、各エンジンの依存関係をランタイム分離で管理します。

pytorch/audio

PyTorchベースの音声ライブラリで、機械学習向けの音声データ処理ツールを提供し、GPU加速と専門的な音声変換を備えています。

estebanstifli/LocalText2Voice

ローカルまたはクラウドのAIテキスト読み上げエンジンを使用して、長尺のオーディオブックやポッドキャストを作成するためのデスクトップアプリ。組み込みの品質検証と音声ミキシング機能を備えています。

sdatkinson/NeuralAmpModelerPlugin

Neural Amp ModelerエンジンをDAWに統合するVST3/AudioUnitプラグインで、AI駆動のギターアンプモデル化を実現します。

genomoncology/biomcp

BioMCPは、ユーザーやAIエージェントが約30の生物医学データベース(PubMed、ClinVar、ClinicalTrials.gov、OncoKBなど)をシンプルなコマンド文法でクエリし、エンティティ間のピボット、ローカル研究分析、遺伝子セット濃縮解析を実行できる統合CLI/MCPサーバーです。スクリプト、uv/pip、Homebrew、Docker、またはソースからインストール可能で、信頼性の高いJSONやターミナル出力を提供し、Claude Code、Codex、Claude Desktopと直接統合できます。

vllm-project/vime

Vimeは、大規模言語モデル(LLM)向けのオープンソースのRLポストトレーニングフレームワークです。slime/Megatron 分布式トレーニングスタックとvLLM推論(vllm-router経由)を組み合わせ、高スループットなロールアウトと柔軟なデータ生成パイプラインを提供します。サポートされるモデルには、Qwen、DeepSeek V3、LLaMA 3が含まれます。ユーザーはMegatron、vLLM、およびrouterの引数を設定することで、agentic RL、coding-agent RL、またはカスタムRLアルゴリズムを実行できます。リポジトリには、クイックスタートドキュメント、いくつかの準備された例、および開発者のための明確なコードリーディングパスが用意されています。

tile-ai/tilelang-ascend

TileLang‑Ascend は、Huawei Ascend NPU 向けに高性能 AI カーネルを記述するための、TVM 上に構築された Python スタイルの DSL です。Ascend 固有のコードを出力するコンパイラを提供し、自動ベクトル化、メモリ計画、同期をサポートし、pip でインストール可能な wheel として提供され、多くの既製サンプル(GEMM、Flash‑Attention など)が同梱されています。

matrixorigin/memoria

Memoriaは、MatrixOneデータベース上で構築されたAIエージェント記憶のGitスタイルのバージョン管理レイヤー。すべての記憶変更に対してスナップショット、ブランチ、マージ、ロールバックを提供し、ハイブリッドベクトル/フルテキスト検索、自動矛盾検出、プライバシー最優先のデプロイモデル(クラウドまたはセルフホスト)を備える。エージェントはMCPコマンドまたはREST APIで対話し、記憶を安全に変更可能で、監査可能かつセッション間で再利用可能になる。

SUC-DriverOld/MSST-WebUI

さまざまなAIモデルを使用して、音楽トラックからボーカルや楽器を分離できる、Music-Source-Separation-Training用のウェブベースのインターフェース。

bolna-ai/bolna

Bol na は、音声認識、LLM、音声合成サービスをオーケストレーションして、電話通話の発信・受信が可能な音声優先アシスタントを構築できるオープンソースフレームワークです。コアサーバー、通話Webhook(Twilio/Plivo)、Redis、ngrok用のDocker Composeコンテナを提供し、ストリーミングパイプラインを構築するためのPython SDK(`Assistant`)を備えています。プロバイダー非依存(Deepgram、Azure、OpenAI、ElevenLabs、AWS Pollyなどに対応)で、新しい通話や音声サービスへの拡張も可能です。

royshil/obs-localvocal

OpenAIのWhisperを使用して、プライバシーを確保しクラウドコストを発生させずに、リアルタイムかつローカルで音声からテキストへの書き起こしと翻訳を行うOBSプラグイン。

DeadWaveWave/opencove

OpenCoveは、AIコーディングエージェント(Claude Code、Codexなど)を実行するターミナル、メモ、タスク、画像を配置できる無限の2Dキャンバスを提供するクロスプラットフォームのElectronアプリです。レイアウト、ターミナルの出力、エージェントの状態は再起動後も保持され、キャンバスのスナップショットを保存して後で再利用することも可能です。タブや長いチャットログの中に隠れるのではなく、AIアシスタントのワークフローを空間的に可視化することを目的としています。

elevenlabs/elevenlabs-python

ElevenLabs の公式 Python SDK で、リアルな AI テキスト音声変換、音声クローン、リアルタイム会話型 AI エージェントをアプリケーションに統合できます。

prathoshap/vagdhenu

平坦な読み上げではなく、伝統的な旋律による詠唱を生成する、プロダクショングレードのサンスクリット語詠唱テキスト読み上げシステム。

spotify/pedalboard

スタジオ品質のオーディオエフェクトとサードパーティの VST3/Audio Unit プラグインを、オーディオファイルおよびライブストリームに読み込み、書き込み、適用するための高パフォーマンスな Python ライブラリ。

LearnPrompt/humanize-ppt

Humanize PPT は、マークダウンをオーディエンス状態転送(AST)スライドプランに変換し、スライドごとのメディアを決定し、下流のHTMLまたはPPTXレンダラーにレンダリングを委ね、自動プレゼンチェックで「見栄えは良いが話せない」スライドを検出し、軽量なプレゼンター・シェルを生成するオープンソースのPythonオーケストレーションツールです。AIエージェント(Claude‑Code、Codex、Hermes)との統合が可能で、`guizang-ppt-skill`、`frontend-slides`、`ppt‑master`、`baoyu-image-gen`、Remotion などの下流レンダラーと連携します。MITライセンス。

flybirdxx/ComfyUI-Qwen-TTS

Qwen3-TTSモデルに基づく、高品質な音声合成、ゼロショット音声クローン、および自然言語による音声設計を実現するComfyUIカスタムノード。

mbailey/voicemode

クラウドまたはローカルの音声サービスを使用して、自然で手を離した会話が可能な Claude Code および他の MCP 対応エージェント向けの音声インターフェースです。

Dicklesworthstone/coding_agent_session_search

数十のAIコーディングアシスタントの会話ログを収集・正規化・インデックス化し、ローカルなSQLiteアーカイブに保存するRustベースのターミナルUIおよびCLIツール。60ミリ秒未満の語彙検索を実現し、オプションでデバイス内にMiniLMによるセマンティック検索を実行可能。自動化および診断用に安定したJSONロボットモードAPIを提供。

KoljaB/RealtimeSTT

音声活動検知(VAD)とウェイクワードのサポートを統合した、高速でリアルタイムな文字起こしを提供するPython音声文字起こしライブラリ。

di-sukharev/opencommit

OpenCommit は、ステージングされた変更から LLM(OpenAI、Anthropic、Ollama など)を使用して、従来のスタイルで絵文字を含む Git コミットメッセージを自動生成する Node.js CLI ツールです。グローバルおよびリポジトリごとの設定、複数のプロバイダー、ローカルモデルサーバー、Git フック、GitHub Action をサポートしており、コミットメッセージの自動改善が可能です。

richardr1126/openreader

EPUB、PDF、TXT、MD、DOCX ファイルに対応するオープンソースで自己ホスト可能なテキスト読み上げリーダー。単語単位の同期ハイライト付きの読み上げ再生を提供します。

OpenMOSS/MOSS-Audio

MOSS-Audioは、音声、環境音、音楽の分析を統合し、強力な時間的認識と推論能力を持つオープンソース音声理解モデルです。

kigner/audio.cpp-webui

ggmlに基づいた高性能なC++オーディオ推論フレームワーク。TTS、ASR、ボイスクローニングモデルの高速かつポータブルなローカル実行を、複数のハードウェアバックエンドで実現します。

riba2534/happyclaw

HappyClaw は、Anthropic の Claude Code エージェントを長期間稼働するマルチユーザーのサービスとして自己ホスト可能なプラットフォームです。Claude Agent SDK(TypeScript)と Claude Code CLI をラップし、Web UI と 8 種類のインスタントメッセージングチャネルインターフェースを提供。隔離されたワークスペース(ホストまたは Docker)、Claude Code のすべての機能(ファイルアクセス、シェル、ブラウザ、プラグイン)、スケジューリング、使用量追跡、企業向けの RBAC とバックアップを備えています。

hkjarral/AVA-AI-Voice-Agent-for-Asterisk

Asterisk および FreePBX 用のオープンソース AI 音声エージェントで、STT、LLM、TTS プロバイダーのモジュール式パイプラインを提供し、本番環境対応の音声ボットの構築を可能にします。

magenta/magenta-realtime

Apple Silicon上でのストリーミングオーディオに最適化された、リアルタイム音楽生成のためのオープンウェイトモデルおよび推論エンジン。

Eddycrack864/UVR5-UI

AIモデルを用いて音声ファイルや動画ファイルからボーカルと楽器を分離できる、`python-audio-separator`(UVR5のPython版)向けの使いやすいグラフィカルインターフェースです。

f-is-h/Usage4Claude

Usage4Claudeは、Anthropic Claude(およびオプションでOpenAI Codex)のサブスクリプションの使用量をリアルタイムで監視するネイティブなmacOSメニューバーアプリです。すべてのClaude製品、複数のアカウント、適応型リフレッシュ、色分けされた使用量リング、通知をサポートし、認証情報をmacOSのキーチェーンに安全に保存します。ビルド済みのDMGからインストールするか、Swift/SwiftUIを使用してソースからビルドできます。

andimarafioti/faster-qwen3-tts

CUDAグラフキャプチャを使用して、リアルタイムで低遅延なボイスクラウンニングと音声生成を実現する、Qwen3-TTS向けの高性能推論エンジン。

FireRedTeam/FireRedASR2S

音声認識、音声活動検出、言語識別、および句読点予測を組み合わせ、中国語方言に特化したサポートを提供する、産業グレードのオールインワンASRシステム。

JordyZomer/lemmalog

Lemmalogは、LLMから抽出された三項式を、検証可能で段階的更新可能なメモリストアに変換するRustベースのDatalogエンジンです。信頼度付き事実、時間的有効性、エンティティ標準化、証明木生成、ハイブリッドBM25+エンティティ検索レイヤーをサポートします。CLI、REPL、またはJSON-RPC MCPサーバー経由で統合され、Claude Code/Kimiエージェントを駆動し、MemEvalスタイルのベンチマークで競争力あるスコアを達成しながら、フルコンテキストベースラインよりもはるかに少ないトークンを使用します。

sdatkinson/NeuralAmpModelerCore

オーディオプラグインでニューラルアンプモデルを実行するために必要なニューラルネットワークロジックを提供するコアC++ DSPライブラリ。

langchain-ai/social-media-agent

URLをスクレイピングしてTwitter/LinkedInの投稿案を作成し、人間による確認を経てArcadeまたはネイティブOAuth経由で公開するLLM駆動型エージェント。LangGraphをベースに構築され、Slack、Supabase、GitHub、YouTubeとの連携オプションを備え、プロンプトファイルで設定可能です。

speechbrain/speechbrain

音声認識や音声合成を含む、音声およびテキスト処理のためのレシピとツールを提供する、対話型AI向けのオープンソースPyTorchツールキット。

Kieirra/murmure

Murmure は、NVIDIA の Parakeet TDT 0.6B v3 モデルを使用したオフライン、プライバシー最優先の音声認識デスクトップアプリです。Windows、macOS、Linux でローカル実行可能で、25 のヨーロッパ言語をサポート。テレメトリなしのシンプルなプッシュツータルク UI を提供します。

stemrollerapp/stemroller

StemRoller は、統合された YouTube 検索で見つけた曲から、Demucs アルゴリズムを使用してボーカルとインストゥルメンタルのステムを分離する無料アプリです。

azuwis/pianotrans

ByteDanceのピアノ音符推定システムのGUIおよびパッケージングツール。ピアノの音声・動画録音をペダル情報を含むMIDIファイルに変換します。