altic-dev/FluidVoice

macOS 向けのオープンソース音声入力アプリで、ローカルAIによる音声認識とシステム制御を実現。

index-tts/index-tts

単一のオーディオクリップから音声を複製し、5言語にわたって感情、速度、発音を細かく制御できるゼロショットテキスト読み上げシステム。

fastapi/fastapi

FastAPIは、高パフォーマンスで型ヒント駆動のPythonウェブフレームワークで、APIの構築に適しています。自動検証、直列化、インタラクティブなOpenAPIドキュメントを提供し、開発が早く、本番環境対応です。

bethington/ghidra-mcp

Ghidra MCP Serverは、Ghidraの完全なリバースエンジニアリングエンジン(デコンパイル、P-codeエミュレーション、ライブデバッグ、構造体作成など)をModel Context Protocol経由で公開する、本番環境対応のブリッジです。253個の読み書きツール、バッチ最適化操作、AI向けドキュメントワークフローを提供し、stdio、HTTP、またはSSEトランスポートを使用したヘッドレス、Docker、またはGUIデプロイをサポートします。

OpenByteInc/QuantDinger

QuantDingerは、オープンソースで自己ホスト可能なAI強化取引オペレーティングシステムです。Python戦略の記述、バックテスト、紙取引シミュレーション、および暗号資産取引所や伝統的ブローカーでのリアル注文実行が可能です。複数のLLMプロバイダーによる市場調査統合、Flask-Gunicorn API、Docker-composeデプロイ、オプションのPrometheus/Grafana監視、AI駆動自動化のためのセキュアなトークンベースエージェントゲートウェイを備えています。

Significant-Gravitas/AutoGPT

AutoGPTは、自律型AIエージェントを構築、デプロイ、管理するためのオープンソースプラットフォームです。ユーザーは平易な英語で目標を記述するか、視覚的にワークフローを組み立てることができます。システムはLLM駆動のエージェントを作成し、45以上の統合サービス(Gmail、Slack、GitHubなど)と連携して、レポートの作成、インシデントのトリアージ、マーケティングコピーの生成などのタスクを完了します。このプロジェクトは、有料のホスト型サービスと無料のセルフホスト可能なDockerアプライアンスを提供しており、コアプラットフォームはPolyform Shieldライセンス、クラシックエージェントコードはMITライセンスの下で提供されています。

stemdeckapp/stemdeck

Demucsを使用して、ボーカルやドラムなどの個別のトラックに音楽を分割する、無料でローカルなオーディオスタム分離ツール。DAW風のミキサーを備え、ローカル再生とエクスポートが可能。

QwenAudio/qwen-audio-agent

AIエージェントが複雑なバックグラウンドタスクを同時に実行しながら、ユーザーとの継続的な会話を維持できるリアルタイム音声ランタイム。

Gentleman-Programming/gentle-shell

gentle-shell™ は npm で配布されるターミナルUIであり、Pi開発環境内にLLMバックエンドのコーディングエージェントを実行します。タスク、変更、エージェント階層を統合したワークスペースを提供し、軽量な有機的駆動開発(ODD)をサポートしつつ、オプションで形式的な仕様駆動開発(SDD)も可能。変更が適用される前に具体的な差分をネイティブにレビューできます。オプションのコンパニオンパッケージで拡張可能で、`pi install npm:gentle-pi@2.6.0` でインストールされ、`pi` で起動します。

risa-labs-inc/BossConsole

BossConsole (BOSS) は、AIエージェント向けのオープンソースかつクロスプラットフォームなデスクトップハーネスです。Kotlin MultiplatformとJVMで構築されており、ネイティブエディタ、埋め込み型Fluckブラウザ、共有可能なターミナル、Git/Docker/K8sツール、およびプラグイン「Toolbox」を提供します。すべての機能はMCPツール (`mcp__boss__*`) として公開され、あらゆるモデル(Claude Code、Codex、Gemini、OpenCodeなど)から呼び出し可能です。きめ細かなRBAC、ツールごとのキルスイッチ、署名付きプラグイン機能を備えています。ホットリロードにより、エージェントは実行時に新しいツールを進化させることができます。Homebrew、スクリプト、またはOSパッケージ経由でインストール可能で、Apache-2.0ライセンスです。

MengTo/Skills

AIコーディングエージェント(Codex、Claude、Cursorなど)向けの、ステップバイステップでバージョン管理されたプロンプト/ワークフローレシピである123個の「スキル」を収録したMarkdownベースのライブラリです。各スキルは `agent-skills/<category>/<skill>/SKILL.md` に格納されており、デモ、アセット、参照リンクが含まれる場合があります。このリポジトリにより、開発者はプロンプトを再利用可能なコード資産として扱い、UIデザイン、Web-GL、Three.jsゲーム、メディア生成ワークフローを再現可能にします。MITライセンスで提供され、LLM駆動の開発ツールでコンテキストとして読み込み可能です。

kirodotdev/KiroCrew

Kiro Crew は、エージェントの状態(メモリ、学習、スキル)を再起動後も保持するオープンソース・オンプレミスAIエージェントプラットフォームです。長時間実行またはスケジュールされたタスクを人間の関与なしに実行でき、デスクトップアプリ、Webダッシュボード、CLI、チャット統合(Slack、Discordなど)からアクセス可能です。1行スクリプト、Docker、またはネイティブデスクトップパッケージでインストール。Gatewayプロセスはすべてのデータをローカルに保存し、サンドボックス化と承認ポリシーを強制します。

modelscope/FunASR

オフライン、ストリーミング、エッジデバイス向けの産業用音声認識ツールキット。ASR、VAD、句読点復元、話者ダイアライゼーションの統一パイプラインを提供。

zubair-trabzada/geo-seo-claude

Claude Codeのスキルで、AI検索(GEO)可視性を監査し、引用可能性、ブランド信号、コンテンツ品質、技術SEO、スキーマを評価。その後、クライアント向けのMarkdownまたはPDFレポートを生成します。

thewh1teagle/vibe

WhisperなどのAIモデルを使用して、デバイス上で音声をテキストに変換する、プライベートでオフラインの音声・動画変換ツール。

Gentleman-Programming/engram

Engramは、AIコーディングエージェントに永続的で検索可能なメモリストア(SQLite + FTS5)を提供する単一バイナリのGoプログラムです。Claude Code、Gemini CLI、VS Code Copilot、Cursorなど、MCP互換エージェントとCLI、HTTP API、MCP、ターミナルUI経由で連携可能です。ゼロ依存で、ローカル優先のストレージをサポートし、クラウドレプリケーションもオプション。`mem_save`、`mem_search`、`mem_context`、`mem_session_summary`など、エージェントが意思決定、バグ修正、設計根拠をセッションやチーム間で記憶できる豊富なメモリコマンドを提供します。

modelbus/one-api-pro

OneAPI Proは、GoベースのオープンソースAI APIゲートウェイで、Vue 3管理UIを備えています。多くのLLMプロバイダーへのアクセスを統合し、トークン/ロール管理、サブスクリプション課金、使用状況ダッシュボードを追加し、分散型マルチノードクラスタリングをサポートします。静的バイナリまたはDockerイメージとしてデプロイ可能です。

ggml-org/whisper.cpp

whisper.cppは、OpenAIのWhisper音声認識モデルを純粋なC/C++で実装したものです。CPUや幅広いアクセラレータ(Apple Silicon、NVIDIA CUDA、AMD ROCm、Intel OpenVINOなど)上でオフライン動作し、混合精度や量子化モデルをサポートしています。また、シンプルなC-APIと言語バインディングを提供しており、デスクトップ、モバイル、組み込み、Webプラットフォームへの統合が容易です。

echo-loop/Echo-Loop

集中聴解、シャドーイング、再述のサイクルを間隔反復と組み合わせた、AI駆動の英語聴解・発話学習アプリ。

ace-step/ACE-Step-1.5

ACE‑Step 1.5 は、言語モデルによる計画とDiffusion‑Transformer音声デコーダーを組み合わせたオープンソース音楽生成ファウンデーションモデルです。RTX 3090で10秒未満でフルソング(10秒〜10分)を生成でき、ベースモデルでは4GB未満のVRAMで動作し、数曲からのLoRA微調整が可能。リポジトリにはGradioとRESTインターフェース、主要OS用の起動スクリプト、複数のモデルサイズ(4 B XLバージョン含む)、歌詞・スタイル・テンポ・楽器構成の高度な制御が提供されています。

michael-denyer/pstack-claude

pstack‑claude は MIT ライセンスのプラグインで、Claude Code 用の 54 個の再利用可能な「Agent Skills」(例:TDD、CI 修正、PR 要約)を同梱し、共有スキルディレクトリを介して Codex、Prime Agent、opencode、Gemini‑CLI でも利用できます。Claude セッションに poteto‑mode の指示を自動注入し、Codex 用の生成済みスラッシュコマンドスタブを提供し、スキルセットを上流の Cursor バージョンと同期させる CI を含みます。

lightpanda-io/browser

Lightpanda Browserは、AIエージェントと大規模Web自動化のために構築された、Zigで書かれた軽量ヘッドレスブラウザです。完全なV8 JavaScriptエンジンを搭載し、CDPとWebDriver BiDiインターフェースを提供し、LLMがプレーンな英語のタスクを通じてブラウザを操作し、決定論的なJavaScriptスクリプトを記録する「エージェント」モードを含みます。ベンチマークでは、ヘッドレスChromeと比較してメモリが約16分の1、ページロードが約9倍速いと主張されています。Homebrew、AUR、直接バイナリ、またはDocker経由でインストール可能で、Linux/macOS(WindowsはWSL2)をサポートし、主要なLLMプロバイダーと統合します。このプロジェクトはMITライセンスで、積極的にテスト(ユニット、エンドツーエンド、Web Platform Tests)が行われており、コミュニティDiscordによってサポートされています。

m-bain/whisperX

OpenAIのWhisperにバッチ推論、単語レベルのタイムスタンプ、話者分離機能を追加し、強化した高速自動音声認識システム。

rafal-qa/slopo

Slopoは、コード埋め込みモデル(Jina AI, Voyage AI, またはローカルのOllama)を使用して、リポジトリ内の意味的に類似したコード断片を検出するPythonベースのCLIツールです。ソースファイルをインデックス化し、ベクトル埋め込みを計算し、類似スニペットをクラスター化し、人間による確認やAIコーディングエージェント向けにMarkdownまたはコンパクトなレポートを出力します。インストールは `uv tool install slopo` で、設定は `slopo init` で行います。このツールは、隠れた非正確なコードの重複を検わり出し、リファクタリングを補助し、AIトークン使用量を削減します。

NVIDIA/skills

NVIDIA Agent Skillsは、cuDF、cuOpt、DeepStream、Jetson、NeMo、DOCAなど、NVIDIAソフトウェアをインストール、設定、使用する方法を教える、ポータブルなインストラクションセット(スキル)のカタログです。スキルはオープンソースの `skills` CLI(`npx skills add nvidia/skills …`)でインストールでき、特定のエージェントにターゲットできます。リポジトリは製品リポジトリからのスキル定義をミラーしており、自動同期パイプラインで常に最新に保たれています。

OpenMinis/OpenMinis

OpenMinis は、あらゆる LLM (Claude, GPT, Gemini など) をデバイス上で直接実行できるオープンソースのモバイル AI エージェント (iOS + Android) です。サンドボックス化された Alpine Linux シェル (iOS では iSH, Android では PRoot) を搭載しており、エージェントントがパッケージをインストールしたり、スクリプトを実行したり、ファイルを操作したりできる一方で、ネイティブのデバイスサービス (Health, Calendar, HomeKit, Bluetooth, クリップボード, メディアなど) をもツールとして公開します。ユーザーは再利用可能な「スキル」 ( `SKILL.md` を含むフォルダとオプションのスクリプト) を作成し、ワークスペースによって作業をプロジェクトごとに整理できます。主なユースケースには、栄養管理、モーニング・ブリーフィング、チャットからのタスク抽出、Obsidian との同期、および共有シートからのイベント作成自動化が含まれます。iOS 用は Swift/SwiftUI、Android 用は Kotlin/Compose で構築されており、GPL‑v3 ライセンスで提供されています。

Gnosil/semantix

Semantixは、LLMコーディングエージェントにセッション間メモリを追加するGoベースのCLIツールです。完了したセッションから再利用可能な「スライス」を抽出し、ローカルに保存します。その後、類似のタスク開始時に一致するスライスをバイト安定なプレフィックスとして注入することで、プロバイダー側のプロンプトキャッシュヒット率を向上させ、推論コストを削減します。フルエージェント(`semantix-agent`)として実行することも、ツール登録、ミドルウェア、またはゲートウェイを介して既存のエージェントにカーネルとして組み込むことも可能です。デモでは最大99.8%のキャッシュヒット率と約80%のコスト削減を達成しており、Claude Code、LangChain、およびOpenAI互換クライアントと統合可能です。

MaxHu-xuan/chat-archive-guard

ChatArchiveGuardは、チャットエクスポートファイル(テキスト、JSON/JSONL、SQLite)をローカルでスキャンして、シークレット/PIIパターン、フォーマットエラー、SQLiteの整合性を検出し、データを変更またはアップロードせずに集計数とカバレッジフラグを報告するPythonのみのCLIです。

trailofbits/skills

Trail of Bits Skills は、数十のセキュリティ指向の「スキル」(例:静的解析、スマートコントラクト監査、YARAルール作成、ミューテーションテスト)を追加する Claude Code/Codex プラグインマーケットプレイスです。単一の `/plugin marketplace add trailofbits/skills` コマンドでインストールし、LLMから個々のプラグインを呼び出して具体的な分析を実行し、構造化された結果を得られます。

cubeplexai/cubeplex

CubePlexは、隔離され、永続的なワークスペース内でマネージドAIエージェントを実行できるオープンソースでクラウドネイティブなプラットフォームです。マルチモデルチャット、再利用可能なスキル、スコープ付きメモリ、ツールコネクタ、IM統合、および組み込みガバナンスを提供し、Docker ComposeまたはHelm/Kubernetesでデプロイ可能です。

coldteadotai/pr-lens

PR Lens はGitHub統合ツールで、プルリクエストのdiffをアニメーション付きのアーキテクチャ図およびデータフロー図に変換します。GitHub App、CI Action、ローカルCLI、またはコーディングエージェントのスキルとして利用でき、`.github/pr‑lens.yml` ファイルで設定可能です。視覚的な出力により、レビュアーはコードを読む前に変更の範囲と影響を理解できます。

k2-fsa/sherpa-onnx

さまざまなハードウェアおよびオペレーティングシステム上で、音声認識、音声合成、その他のオーディオAI機能をローカルで実行できるポータブルなフレームワーク。

vshulcz/deja-vu

deja‑vu は、コード生成エージェント(Claude Code、Codex、Cursor、Copilot など)専用のローカルオンリー記憶層です。これらのエージェントが既に書き出すトランザクションファイルをインデックス化し、高速な検索可能なインデックスを作成し、任意のエージェントセッションに関連する過去の決定を自動的に挿入します。主な機能には、後から自然言語検索、エージェント間リコール、コンパクション耐性、状態追跡、古さ警告、マシン間同期/ハンドオフ、シークレットの自動マスキングがあります。1行スクリプト、Homebrew、Scoop、Go、NPM でインストール可能;`deja install --auto` で検出されたエージェントに小さなMCPサーバーを接続します。`deja "jwt refresh token"`、`deja wip`、`deja blame <file>`、`deja sync ssh <host>` などのコマンドを使い、ローカルLLMによるセマンティック埋め込みもオプションで利用可能。すべての処理はマシン内に留まり、組み込みのプライバシー保護機能があります。

Javis603/token-monitor

Token Monitorは、35以上のAIコーディングアシスタントのローカルログとAPIキー残高を読み取り、リアルタイムのトークン使用量、コスト、クォータ制限を表示するクロスプラットフォームデスクトップウィジェットです。セルフホストまたはCloudflareハブを介して複数マシン間で要約を同期可能。セッションごとの分解、歴史的ヒートマップ、CSV/JSONエクスポート、高度にカスタマイズ可能なUIを備えつつ、プロンプトの生データはすべてプライベートに保たれます。

chidiwilliams/buzz

Buzz は、OpenAI の Whisper を使用してオフラインで音声・動画(または YouTube リンク)の字幕化・翻訳を行うデスクトップアプリです。ライブマイク字幕表示、発話者識別、音声分離、複数のハードウェアアクセラレーションバックエンド(CUDA、Apple-silicon、Vulkan)、サブタイトル形式へのエクスポート、検索可能なビューア、フォルダ監視自動化、CLI、プラグインシステムをサポートします。DMG(macOS)、インストーラー(Windows)、Flatpak/Snap/AppImage(Linux)、または pip(Python)でインストール可能。MIT ライセンス。

Arize-ai/phoenix

Arize Phoenix は、トレース、評価、実験、デバッグが可能なオープンソースで自己ホスティング可能なAIオブザーバビリティプラットフォームです。LangChain、OpenAI Agents、Claudeなど多くのフレームワークや、OpenAI、Anthropic、Bedrock、Google GenAIなど多数のプロバイダーに対応しており、OpenTelemetry/OpenInferenceインストルメンテーションを介して動作します。

HAKORADev/VODER

VODER は、Whisper、Qwen3-TTS、Seed-VC など、オープンソースモデルを活用して、8つのモード(音声認識、音声合成、ボイスコンバージョン、音楽生成、音声強化、サウンドエフェクト、ボーカル分離、話者ダイアライゼーション)を統合した、ローカルでオフラインで動作するプロフェッショナルクラスの音声処理ツールキットです。さらに、Project Eva DLC で画像・動画・3D生成、および非制限チャットを拡張。すべての処理は自宅のマシン上で完結し、GPUの有無に関わらず動作可能。

resemble-ai/chatterbox

GPUおよびCPUデプロイ向けに、さまざまなモデルサイズで低遅延ボイスクラウンニングと多言語音声生成を提供するオープンソースのテキスト音声モデルのファミリー。

XiaoMaColtAI/math-modeling-skill

オープンソースのAIエージェントスキルで、数学モデリングコンテストの作業を3段階(分析、コーディング、論文)に構造化。Python/MATLAB対応、出版レベルの図を生成、再現性を保証し、Word/LaTeX論文を出力。品質チェック用サブエージェントを内蔵。DeepSeek Harnessプラグインと完全なテストスイートを含む。

huggingface/speech-to-speech

低遅延でモジュール式の音声エージェントパイプライン。VAD、STT、LLM、TTS コンポーネントを調整し、リアルタイム音声会話を可能にします。

makecindy/cindy

Cindyは、オープンソースでクロスプラットフォームのAIエージェントクライアント(Electronデスクトップ+React-Nativeモバイル)であり、複数のLLMハーネス(Claude Code、Codexなど)をローカルファイルアクセス、ブラウザ/OS制御、永続的メモリ、拡張可能な「スキル」に統合しています。リポジトリにはクライアントコード、共有TypeScriptパッケージ、アプリのビルド/実行用ツールが含まれます。バックエンドサービスは別途存在します。クラウドバックの利用(Cindyアカウント経由)と完全にローカルのエージェント(サインインをスキップ)の両方をサポート。Apache-2.0ライセンス。

QwenAudio/CosyVoice

CosyVoiceは、高品質なゼロショット多言語音声合成およびボイスクローニングを実現するために設計された、高度なLLMベースのテキスト読み上げシステムです。

yuanbw2025/storyforge

StoryForge はオープンソースでブラウザベースの AI サポート物語創作ツールキットです。長編・短編小説の執筆、脚本や漫画への変換、世界観を遊べる体験(ランテーブル、チャット、テキストアドベンチャーなど)に変換できます。すべてのデータはローカル(IndexedDB)に保存され、ユーザー自身が LLM API キーを提供します。プラットフォームにはバージョン対応の「Harness」レイヤーがあり、すべての AI 呼び出しを記録し、メモリの取得を管理、著者確認による採用を強制することで、章間および派生製品間の長期的な一貫性を確保します。

visualbruno/3DGenStudio

3D Gen Studio は、エンドツーエンドで 3D アセットを構築できる、AI 駆動のオープンソース、デスクトップ/ウェブアプリです。Kanban board または node-graph UI と ComfyUI ワークフローと外部 3D 生成 API を組み合わせ、画像からメッシュへのパイプライン、自動 UV/リトポロジー、AI オートリグ (SkinTokens + オプションの Kimodo モーション)、LOD/最適化、およびゲーム対応チェック機能を提供し、すべてをディスク上でローカルカルに保存します。

breezeblue-ai/breeze-tts

Breeze TTS 2は、リアルタイムインタラクション用に設計されたオープンウェイトのバイリンガルテキスト読み上げモデルで、自然言語による音声デザインと超低遅延ストリーミングを特徴としています。

leo-lilinxiao/codex-autoresearch

Codex‑autoresearch は Git ベースの Codex スキルで、自律的なループを実行します:単一のコード変更を提案し、コミットし、数値メトリクス(例:テスト失敗数)を測定。メトリクスが改善し、オプションのガードを通過すれば変更を保持、それ以外はロールバック。ユーザーが指定した目標に到達するまで繰り返し、不変のイベントログと HTML レポートを保存。フォアグラウンドまたはバックグラウンドで実行可能。あらゆる測定可能な結果に対応し、厳格な安全性(すべての試行は実コミット、失敗時は明確なエラーで中止)を確保。

liliu-z/stashbase

StashBaseは、ローカルファーストのデスクトップアプリで、個人のファイル(PDF、ドキュメント、画像、録音など)から検索可能でリンクされたMarkdownウィキを構築し、AIエージェントがそのコンテキストとして利用できるようにします。セマンティック検索、OCR/音声認識、OpenQuill、Claude Code、Codex、または任意のMCP互換クライアントとの統合を提供しながら、すべてのオリジナルファイルをあなたのマシン上に保持します。

OpenMOSS/MOSS-Transcribe-Diarize

1回の処理で長時間のマルチスプーカー音声の音声認識とスプーカー・ダイアライゼーションを同時に行うエンドツーエンド音声理解モデル。