TorchDSP/torchsig

PyTorchに基づくオープンソースの信号処理機械学習ツールキット。機械学習研究におけるRF信号の作成、拡張、変換を簡素化します。

ludo-technologies/pyscn

pyscnは、Goベースの高速なPython静的解析ツールです。コードの健全性をスコアリングし、デッドコードや重複コードの検出、複雑度の測定、アーキテクチャのチェックを行います。インストール可能なSkillsやオプションのMCPサーバーを通じてAIコーディングエージェントと統合でき、IDEやチャットから直接品質チェックやリファクタリングの提案をAIに行わせることができます。

OpenClaudia/openclaudia-skills

OpenClaudiaは、MITライセンスの無料の77のマークダウンベースの「スキル」コレクションで、AIコーディングエージェント(Claude Code、Codexなど)が、SEO監査、ブログ作成、広告コピー、メールシーケンス、ソーシャルメディア投稿、アナリティクスなどのエンドツーエンドのマーケティングタスクを、簡単なスラッシュコマンドで実行できるようにします。`npx openclaudia install --all`でインストールし、必要なAPIキーを設定すれば、エージェントはマーケティング資産をローカルで生成、公開、送信でき、有料のAIマーケティングSaaSに代わる完全にカスタマイズ可能な代替手段を提供します。

taracodlabs/aiden

Aidenはオープンソースの自律型AIエンジン(Node/TypeScript)で、自然言語による目標を、ファイル、ターミナル、ブラウザ、API、Git across で検証可能なマルチステップのワークフローに変換します。SQLiteにすべてのアクションを記録し、リスク階層付き承認をサポートし、OpenAI、Anthropic、Gemini、Ollamaなど複数のLLMプロバイダに対応し、CLI、Webワークベンチ、バックグラウンドデーモンとして実行可能です。`npm i -g aiden-runtime` でインストールし、`aiden` で起動します。

Sylinko/Everywhere

Everywhereは、.NET 10とAvaloniaを用いて構築されたクロスプラットフォームのデスクトップAIアシスタント(Windows/macOS)。アクセシビリティAPIを活用して画面内のコンテキストを取得し、グローバルホットキーでLLM(OpenAI、Anthropic、Geminiなど)に問い合わせ、マークダウンを含む豊富な回答を返します。ブラウザ/ファイル/ターミナルエージェント、豊かなUI、多言語UI、ローカルOllamaモデルのサポートを備えています。オープンソースで、LICENSEに従い、インストーラ、ポータブルzip、完全なビルド手順を提供しています。

zhimaAi/chatwiki

ChatWikiは、Dockerベースのオープンソースプラットフォームで、WeChat公式アカウントをAIアシスタントに変換します。視覚的なワークフロー編集、自動返信(テキスト、音声、画像、ミニプログラムカード)、スクレイピングまたはアップロードされたドキュメントからの知識ベース作成、ハイブリッドベクトル・グラフ検索、人間への引き継ぎを提供します。バックエンドはGoとPython、フロントエンドはVue.js、PostgreSQL 16とpgvectorで埋め込みを実装。20以上のLLMプロバイダー(例:OpenAI、Claude、DeepSeek)に対応し、Webアプリ、デスクトップクライアント、または他のサービスに埋め込む形でデプロイ可能。個人利用は無料。商用利用には有料ライセンスが必要です。

RHVoice/RHVoice

RHVoiceは、統計的パラメトリック合成を使用して、複数の言語とプラットフォームにわたって軽量で分かりやすいテキスト読み上げを提供するオープンソースの音声合成エンジンです。

any4ai/AnyCrawl

AnyCrawlは、高速でスケーラブルなWebおよびSERPクローリングを実現するオープンソースのNode.js/TypeScriptツールキットです。マルチプロセスワーカー、3つのスクレイピングエンジン(cheerio、Playwright、Puppeteer)、バッチジョブ、Redisバックエンドキュー、キャッシュ、プロキシサポート、およびオプションのLLM駆動JSON抽出を備えています。Dockerによるセルフホスティングまたは公開APIの利用が可能で、APIキーの生成と、単一ページスクレイピング、サイト全体クロール、SERP検索、バッチスクレイピングのエンドポイント呼び出しが可能です。AIエージェント、データ収集パイプライン、SEO自動化に最適です。MITライセンス。

Rvosy/Sakura

Sakura Desktop Petは、画面を監視し、やり取りを記憶し、自発的に会話を開始できるオープンソースのAI駆動デスクトップコンパニオンです。ユーザーはキャラクターパック(ポートレート、ロールカード、オプションの音声)をロードし、LLM APIを設定します。その後、エージェントはスクリーンショット、ツール呼び出し(Web検索、リマインダー、メモ)および長期記憶を使って、能動的なバーチャルペットのように振る舞います。

espnet/espnet

PyTorchベースのエンドツーエンド音声処理ツールキット。ASR、TTS、音声翻訳、音声強調のための統一的で再現可能なレシピを提供します。

MahmoudAshraf97/whisper-diarization

OpenAI Whisperによる音声認識とNVIDIA NeMoによる発話者識別を組み合わせた、音声ファイル内の誰がどの単語を話したかを特定する発話者分類パイプラインです。

jasoncheng7115/jt-live-whisper

jt‑live‑whisperは、システム音声をキャプチャし、Whisperベースの音声認識、ローカル翻訳、話者分離、LLMによる会議要約をすべてユーザーのPC上で実行するクロスプラットフォームのデスクトップツールです。macOS、Windows、Linuxに対応し、リアルタイム字幕(英中・日中双方向対応)、音声ファイルのバッチ処理、フローティング字幕、キーワードアラート、チャットアプリへの字幕転送をサポートしています。インストールはワンクリックスクリプトでPython、必要なライブラリ、AIモデルをセットアップでき、対話型メニュー、軽量Web UI、またはCLIフラグから起動可能です。

ahmetoner/whisper-asr-webservice

WhisperモデルをREST APIとしてラップし、容易なデプロイと統合を可能にする汎用音声認識ツールキット。

k2-fsa/sherpa

PyTorch を使用したオープンソースの音声認識推論フレームワークで、事前学習済みの transducer および CTC ベースのモデルをデプロイできます。

SchroederNathan/clarity

iOSおよびAndroid向けのスピーチ練習アプリで、発音、ペース、流暢さを向上させるためのライブフィードバックとAIコーチングを提供します。

getsentry/warden

Warden は、再利用可能な「スキル」を使用して AI ベースのコードレビューを実行するオープンソースの Sentry プロジェクトです。ローカル CLI から呼び出すか、GitHub Action で各 PR に対して自動的に実行でき、発見内容をインラインコメントと Checks として投稿します。OpenAI および Anthropic モデルをサポートし、簡単な修正を自動的に適用できます。

beehive-lab/TornadoVM

TornadoVMはオープンソースのJavaランタイムであり、JavaバイトコードをGPUカーネル(CUDA、OpenCL、Metal)にJITコンパイルし、NVIDIAライブラリ(cuBLAS、cuFFT、cuDNN)とTensor-Coreインプリントを統合する。純Javaでカーネルを記述し、タスクグラフを構築して、NVIDIA、AMD、Intel、Apple-Silicon GPU、またはCPU上で実行可能。LLM推論(GPULlama3.java)、レイトレーシング、科学的パイプラインに使用され、SDKMAN! でインストール可能で、Maven CentralにApache 2.0(API)およびGPLv2 + Classpath Exception(ランタイム)で公開されている。

woheller69/whisperIME

Whisper エンジンに基づいた Android 用のオフライン音声認識入力メソッド。プライバシーを重視した音声からテキストへの変換および翻訳機能を提供します。

rapidaai/voice-ai

代理店および企業向けに、ベンダー依存を避けながらスケーラブルでリアルタイムな音声エージェントを構築・デプロイできるオープンソースの音声AIオーケストレーションプラットフォームです。

jonwiggins/optio

Optioは、Kubernetesやローカルマシン上でAIエージェント(Claude Code、OpenAI Codex、Geminiなど)を永続的なセッションとしてオーケストレーションするオープンソースのセルフホスト型プラットフォームです。単一のフォームで「いつ、どこで、誰が、何を、その後どうするか」をキャプチャし、PR自動化パイプライン、スケジュールされたジョブ、インタラクティブなターミナル、または長期間稼働するエージェントスウォームを作成します。統一されたUI/フィード、Kubernetesスタイルの調整機能、マルチベンダーモデルのサポート、きめ細かな接続(Slack、Notion、GitHubなど)、コスト追跡、エンタープライズグレードのセキュリティを提供し、すべて独自のインフラストラクチャ内で実行されます。

GoPlusSecurity/agentguard

AgentGuardは、Claude Code、OpenClaw、HermesなどAIコードエージェント向けのnpm配布型セキュリティレイヤーです。一度インストールし、エージェントランタイムにフックすることで、破壊的コマンドをブロックし、シークレットファイルを保護し、各アクションをトリガーしたスキルをログに記録します。また、新スキルの静的解析スキャン、毎日の「パトロール」健全性チェック(8つの組み込みチェック)、およびオプションのクラウド接続型脅威インテリジェンスも提供します。インストールは `npm i -g @goplus/agentguard && agentguard init`;使用方法には `agentguard scan`、`agentguard protect`、`agentguard patrol`、`agentguard checkup` があります。

madderscientist/noteDigger

noteDiggerは、音声からMIDIへの変換を実行する純JavaScriptのウェブアプリです。ユーザーは音声/動画をアップロードし、スペクトログラム(STFT/CQT、GPUアクセラレート)を可視化し、ブラウザ上でニューラルネットモデルによるピッチ・楽器分離変換を実行し、キーボードショートカットを活用した豊富な手動編集ツールを提供。定量化されたMIDIファイルをエクスポートしたり、後で再開可能なプロジェクトを保存したりできます。外部ライブラリやサーバーサイド処理を一切必要としません。

ntd4996/agentpet

AgentPetは、AIコーディングエージェントのリアルタイム状態を監視し、トークン使用量や完了セッションに応じてレベルアップするタマゴッチ風ペットで体験をゲーム化するクロスプラットフォームデスクトップアプリです。オフライン動作をサポートし、多数のエージェントに対応、プロジェクトごとのダッシュボードを提供し、オプションのWeb同期とリーダーボードも利用可能です。

vndee/llm-sandbox

LLM Sandboxは、大規模言語モデルが生成したコードを、隔離されたコンテナ(Docker、Kubernetes、またはPodman)内で実行するPythonパッケージです。複数言語をサポートし、セキュリティポリシーを適用可能、出力のプロットをキャプチャ、インタラクティブなノートブックスタイルのセッションを提供し、高速かつ並列実行を可能にするコンテナプールシステムを備えています。

moss-site/moss-trade-bot-skills

Mossは、平易な言語による暗号資産取引アイデアを、バックテスト可能で自己進化する定量的エージェントに変換するオープンソースのPythonフレームワークです。自然言語の記述を解析し、テクニカルインジケータを組み立て、ローカルでHyperliquidの過去データでバックテストを実行し、毎週パラメータを自動的に最適化しながら安全ガードレールを維持します。オプションの統合により、結果をMossプラットフォームにアップロードし、Hyperliquidでライブボットを稼働させることも可能です。プロジェクトはMIT‑0ライセンスで、研究・教育用途を目的としています。

SonyResearch/Woosh

ソニーAIが提供する生成モデルのコレクションで、テキストから音声およびビデオから音声生成により高品質なサウンドエフェクトを作成できます。

fossasia/voxbento

ライブイベント向けのリアルタイム通訳プラットフォーム。通訳者がブラウザベースの低レイテンシ・ストリームを通じて、参加者へ翻訳されたオーディオを配信できます。

xiaods/k8e

K8Eは、任意のLinuxホスト上で信頼できないコードを安全に実行できるオープンソースの単一バイナリサンドボックスプラットフォームです。gVisor、Kata、Firecrackerによる隔離をサポートし、セッションごとのeBPFネットワークポリシー、500ms未満の起動時間のウォームプールポッド、`k8e-sandbox-cli`ツール経由でアクセス可能なE2B互換APIを提供します。

Saganaki22/ComfyUI-OmniVoice-TTS

OmniVoice用のComfyUIノード。600以上の言語に対応し、ボイスクローニング、ボイスデザイン、マルチスピーカー対話機能を備えたゼロショット多言語テキスト読み上げ(TTS)を提供します。

tornikegomareli/Talkify

macOS 向けのプライベートなオンデバイス音声ディクテーションおよび文字起こしツール。ローカルの Apple フレームワークと LLM を使用して、音声からテキストへの変換、翻訳、テキストの整形を提供します。

toby-bridges/api-relay-audit

APIリレー監査は、ゼロ依存のPythonスクリプトで、任意のサードパーティAI-APIリレーまたはLLMプロキシの隠れたプロンプトインジェクション、コンテキストの切り捨て、モデル置換、ツールコールの書き換え、Web3ウォレットの安全性をローカルでテストできます。14ステップの監査を実行し、LOW/MEDIUM/HIGHリスク評価を含むMarkdownレポートを出力。スタンドアロンスクリプトまたはDeepSeek Harnessプラグインとして使用可能。

EXXETA/exxperts

exxpertsは、オプトインで監査可能な記憶を持つクロスプラットフォームデスクトップ/CLIアプリです。ルームは永続的なワークスペースとして機能し、会話終了後にエージェントが記憶すべき事実を提案し、承認が必要です。すべてのデータはあなたのマシン上に保持され、OpenAI互換モデルに対応し、組み込みのDuckDuckGo検索を備え、Apache 2.0ライセンスで公開されています。

nWave-ai/nWave

nWaveは、7段階の「ウェーブ」ワークフロー(discover → deliver)を通じてAIエージェントを調整するClaude Codeプラグインセットです。各ウェーブはレビュー済みのアーティファクトを生成し、DESレイヤーがTDD、ペアレビュー、カスタム厳格性プロファイルを強制します。Python 3.10+、uvまたはpipxで1行スクリプトでインストール可能。`/nw‑design`や`/nw‑buddy`などのスラッシュコマンドでプロセスを制御。開発者とチームがAI支援コーディングを実現しつつ、各段階で人間の監視を維持できるように設計されています。

microsoft/muzic

Microsoft Research Asia による研究プロジェクトで、音楽の理解、生成、および AI 駆動の音楽処理のためのディープラーニングモデルのスイートを提供します。

KoljaB/RealtimeTTS

文字列、ジェネレータ、LLMトークンストリームから低遅延音声生成を実現するPython用音声合成ライブラリ。多数のローカルおよびクラウドTTSエンジンをサポート。

Picovoice/porcupine

IoT、モバイル、Webプラットフォーム全体で、常に待機可能な音声対応アプリケーションを構築するための、軽量で高精度なウェイクワードエンジン。

sayksii/Aria

さまざまな音声認識エンジンとローカルのオフラインモデルを使用して、システム音声をライブ字幕と翻訳に変換するWindowsデスクトップアプリです。

Stability-AI/stable-audio-tools

拡散モデルやオートエンコーダーを含む、さまざまなモデルタイプをサポートする、音声生成モデルのトレーニングと推論のためのツールキットです。

es617/claude-replay

claude‑replay は、Claude Code、Cursor、Codex CLI、Gemini CLI、OpenCode、Kimi Code、Hermes Agent からのトランスクリプトログを1つの自己完結型HTMLリプレイに変換するゼロ依存ツールです。このリプレイはインタラクティブ(再生/一時停止、速度制御、推論/ツールブロックのトグル)、テーマ設定可能で、内蔵のウェブエディタで編集可能です。ライブ監視モード、シークレットの非表示処理、簡単な埋め込みをサポートしており、ブログ、ドキュメント、デモ、バグレポート、教育用にAIコーディングセッションを共有できます。

Alex2Yang97/yahoo-finance-mcp

Python で作られた MCP サーバーで、Yahoo Finance のデータ(株価、財務諸表、オプション、ニュース、株主情報、アナリスト評価)を型指定されたツールとして公開し、Claude などの LLM が AI 駆動の株式・市場リサーチを可能にします。

HangYu8123/HarnessFlow

HarnessFlowは、Claude Code、Codex CLI、またはGitHub Copilotを、複数ステップで自己レビュー可能なコーディングアシスタントに変える、ポータブルなMarkdown指示ファイルのセットです。リクエストテンプレート、並列分析エージェント、悪魔の弁護士による挑戦、QA検証、永続的なリポジトリメモリを提供します。リポジトリの `.github/HarnessFlow/` にパックをコピーし、提供された `setup.sh` または `cli_setup.sh` を実行することでインストールできます。リクエストテンプレート(コード、リファクタリング、デバッグなど)を選択して記入し、アシスタントに貼り付けます。このパックは `general`、`fast`、`skill` の3つのワークフロー モードをサポートしており、ベンチマークでは生成コード行数が最大76%削減されながらも100%の正しさを維持しています。

Vasco0x4/AIDA

AIDAは、任意のLLM(Claude、Gemini、OpenAIなど)をDockerベースのセキュリティテスト環境を制御するオープンソースの自律的ペネトレーションテストプラットフォームです。エージェントはリコンナイサンス、スキャン、カスタムPythonエクスプロイト、生HTTP操作を実行し、すべてのコマンドと出力を永続的なノートブックに記録します。発見はCVSS 4.0で自動スコア付けされ、PDFレポートとしてエクスポート可能です。プロジェクトにはWebダッシュボード、JWT認証、通知フックが含まれており、組み込みの`aida-pentest`コンテナをより大きなExegolイメージに交換することも可能です。AIDAが発見した実際のCVEがリストアップされており、実用的な影響を示しています。AGPL-v3ライセンスで提供されています。

volcengine/mcp-server

100以上のModel Context Protocol (MCP) サーバーを収容するモノレポ。クラウドサービス、データベース、開発ツールなどを自然言語駆動型APIとして公開し、LLMが利用可能に。コンピューティング、ストレージ、セキュリティ、検索など、即時利用可能なサーバーを備え、ローカル/リモートデプロイ、Python/TS SDK、MITライセンスをサポート。

pretyflaco/millet

Millet は、任意の会議アプリから双方向音声を記録し、WhisperX(または MLX Whisper)で音声認識、pyannote‑audio で話者分離、AI要約とプロフェッショナルな PDF を生成するオフライン優先の Python ツールです。3つの要約プリセット(高品質(クラウド)、機密(TEE保護 GLM‑5.3)、代替(Kimi))を提供し、多言語トランスクリプト、音声特徴認識、構造化された Markdown/YAML フロントマター、およびオプションの Git 同期をサポートします。音声キャプチャには Linux が必要;macOS は録音後処理のみ実行可能。

microsoft/generative-ai-with-javascript

Microsoftがメンテナンスしている、MITライセンスのチュートリアルシリーズ。JavaScript開発者向けに、生成AIアプリの構築方法を学べます。LLMの基礎、プロンプトエンジニアリング、構造化出力、RAG、ツール呼び出し、Model Context Protocol(MCP)をカバー。コードサンプル、クイズ、動画、コンパニオンチャットアプリ付き。GitHub Codespaceで即座に開始可能、またはローカルで実行も可。

meta-pytorch/attention-gym

Attention Gym は、PyTorch ベースのライブラリであり、FlexAttention API 用に再利用可能なマスク/スコア修正関数、スパースアテンション・パターン、および線形アテンション・カーネルを提供します。また、カスタムアテンション・メカニズムの構築とベンチマークのための例示的なスクリプトとユーティリティを提供します。

misyaguziya/VRCT

VRCTは、リアルタイムの音声からテキストへの変換とチャット統合により、VRChatユーザーが異なる言語間でコミュニケーションをとることを支援する翻訳・文字起こしツールです。

theJayTea/WritingTools

Writing Tools は、Windows、Linux、macOS用の無料でオープンソースのデスクトップアプリです。ホットキーでコンピュータ上のどこからでもLLMを呼び出せます。校正、再執筆、トーン変更、翻訳、WebページやYouTubeの字幕の要約、モデルとのチャットが可能です。Gemini、OpenAI、AnthropicなどのクラウドAPI、またはOllama、llama.cpp、Apple-silicon MLXを介してローカルモデルを実行できます。プライバシー重視(テレメトリなし、APIキーはローカル保存)で、GPL-v3ライセンスのもとで提供されています。