Migushthe2nd/MsEdgeTTS
Microsoft Edgeの読み上げAPIを使用して、サーバーサイドのランタイム向けにテキスト読み上げ合成を提供するシンプルなAzure Speech Serviceモジュール。
PowerBeef/Vocello
MLXとSwiftを使用して高品質な音声を生成する、macOSおよびiOS向けのローカルファーストなボイススタジオ。クラウドへの依存なしに、ボイスクローニングやカスタムボイスデザイン機能を備えています。
nateshmbhat/pyttsx3
インターネット接続なしで音声を生成するためのPythonライブラリ。ネイティブなシステムエンジンを使用して、オフラインで音声出力を実現します。
readbeyond/aeneas
音声ナレーションと対応するテキスト断片を自動的に同期するための、Python/Cライブラリおよびツールセット。
ashbuilds/payload-ai
コンテンツフィールドにAI駆動のテキスト、画像、音声生成を追加するPayload CMSプラグイン。複数のモデルプロバイダーをサポートし、細かい設定とアクセス制御を提供します。
SponsioLabs/Sponsio
Sponsioは、LLMベースのエージェントに決定論的でマイクロ秒単位のガードレールを追加するオープンソースライブラリです。形式手法に基づいたコントラクト(YAMLルールブック)を作成し、ツール呼び出しのたびに強制適用することで、モデルを呼び出すことなくアクションをブロック、警告、または許可できます。このライブラリは、PythonまたはTypeScriptのLangChain、Claude、OpenAI、CrewAIなどのエージェントフレームワークと統合されており、22個の既製コントラクトバンドルが付属し、監査とレビューのためのホスト型コンソールも提供します。ベンチマークでは、誤った動作が95%以上削減され、呼び出しあたりのレイテンシは0.2ms未満であり、本番環境のAIエージェントにとって高速で信頼性の高い安全層となります。
av/harbor
HarborはCLI駆動のDocker-Composeオーケストレーターであり、Ollama、llama.cpp、vLLM、MLXなど、モデルバックエンド(Ollama、llama.cpp、vLLM、MLX、など)、チャットフロントエンド(Open WebUI、LibreChat、AnythingLLM、…)、ウェブ検索、音声、画像生成、Boostベースのエージェントワークフローを含む完全なローカルLLMスタックを、単一の `harbor up` コマンドで起動できます。
marcusquinn/aidevops
aidevops は MIT ライセンスの AI-DevOps フレームワークで、コード、インフラ、プロダクト、マーケティングなど across で AI エージェントをオーケストレーションする CLI と OpenCode プラグインを提供します。作業を 14 の主要エージェントと数千のサブエージェントに分割し、パルス監督者がタスクをルーティングし、トークン予算を管理し、シークレットを安全に保ち、Gitの整備を維持します。npm または Homebrew でインストール後、`aidevops init`、`aidevops pulse`、またはドメイン固有のスラッシュコマンドを実行して、ビルド、デプロイ、レポート、ビジネスプロセスを自動化しながら監査可能に保つことができます。
norse/norse
Norse は PyTorch ベースのライブラリで、スパイキングニューラルネットワークのプリミティブ(LIF、LSNN など)を追加し、イベント駆動モデルの構築・学習・評価を可能にします。pip/conda/Docker でインストールでき、MNIST、CIFAR‑10、cart‑pole といったサンプルタスクが用意されており、PyTorch‑Lightning と統合してスケーラブルな学習が行えます。
MigoXLab/dingo
Dingoは、AIデータ、モデル出力、RAGシステムの評価に向けたオープンソースのPythonライブラリ(およびSaaS製品)です。ルールベース、LLMベース、エージェント駆動のチェックをサポートし、ファイル、データベース、S3、Hugging Faceからデータをストリーミングで読み込み、JSONレポートとオプションのビジュアルダッシュボードを提供します。`pip install dingo-python`(オプションの拡張機能付き)でインストールし、CLI(`dingo eval …`)またはPython SDKで実行可能。カスタムルール、LLMプロンプト、エージェントで拡張できます。
nikdanilov/whisper-obsidian-plugin
Whisper を使用して音声録音やアップロードされたファイルをテキストに文字起こしする Obsidian プラグインです。オプションで LLM による文法やフォーマットの事後処理が可能です。
iver56/audiomentations
オーディオディープラーニングモデルを実用環境でより堅牢にするための、多様な変換機能を提供するオーディオデータ拡張用 Python ライブラリです。
datachain-ai/datachain
DataChainは、S3/GCS/Azure(またはローカル)上のファイルを、軽量なSQLiteデータベースに保存されたバージョン管理された型付きデータセットに変換するPythonライブラリです。生のファイルを移動することなく、数百万件のレコードに対して高速なサブ秒単位のフィルタリング、結合、集計、ベクトル類似性検索を提供します。パイプラインは通常のPython関数として記述され、エンジンが並列実行、チェックポイント、増量更新を処理します。オプション機能として、人間やLLM向けの自動生成Markdownナレッジベースや、Claude、Cursor、Codex、Copilot、Piなどのツールからデータ層を認識可能にするスキルがあります。ホスト型の「Studio」サービスでは、共有データセットレジストリ、分散コンピューティング、大規模メディア用UIが追加されます。`pip install datachain`でインストールし、必要に応じて`datachain skill install --target claude`を実行してください。
AgentEra/Agently
Agentlyは、信頼性の高いAIサービスを構築するためのPythonフレームワークです。構造化されたリクエスト/レスポンス契約、部分的な結果の即時ストリーミング、観測可能なアクション(ツール呼び出し)、バージョン管理されたスキル、および信号駆動型のワークフローエンジン(TriggerFlow)を提供します。このライブラリはモデルプロバイダーを抽象化し、モデルプールをサポートし、Python、shell、Webブラウジング、SQLiteなどの組み込みアクションを含みます。デバッグ可能性、再起動に安全なワークフロー、厳格な出力検証を必要とする本番グレードのアシスタント、内部コパイロット、およびAIバックエンドAPI向けに設計されています。
tolimarchuk/goalbuddy
GoalBuddyはnpmベースのCLIで、リポジトリ内にファイルベースの「ボード」を作成し、CodexやClaude CodeなどのLLMエージェントを使って長期にわたるコーディングタスクをオーケストレーションします。目標を安全で検証可能なスライスに分割し、選択したハーネスにディスパッチし、YAML形式のレシートをキャプチャし、テストやデモなどのオラクルで作業を検証できます。ボードはツール間で永続化され、エージェント間のシームレスな引き継ぎ、監査ログ、並列サブゴールの実行が可能で、非常に小さな実行時フットプリントです。
psyray/oasis
OASIS は、Ollama または OpenAI互換サーバー(vLLM、LM Studio、LocalAI など)を介してローカルで実行される LLM を使用して、ソースコードのセキュリティ脆弱性をスキャンする Python CLI ツールです。高速スキャンモデルを実行した後、詳細分析モデルを実行し、検出結果を決定論的に検証し、キャッシュを活用して、標準 JSON および HTML/PDF/Markdown レポートを出力します。パスワード保護された Web ダッシュボードにより、ユーザーは検出結果を探索し、アシスタントに再調査を依頼できます。マルチモデル実行、抑制レジストリ、ベースラインとの差分比較、CI 終了コードのゲート制御をサポートしています。
skyzh/vector-db-from-scratch
Arrowテーブル、DataFusion統合、および複数のANNインデックス(IVFFlat、NSW、HNSW、IVF-PQ)をカバーする、Rustベースの段階的コース。SQLサポートとベンチマークツール付き。
gemelo-ai/vocos
スペクトル係数と逆フーリエ変換を使用して、音響特徴から高品質な音声波形を合成する高速なニューラルボコーダー。
linto-ai/whisper-timestamped
openai-whisperの拡張であり、多言語自動音声認識において正確な単語レベルのタイムスタンプと信頼度スコアを提供します。
paul-buerkner/brms
brms は、Stan を使用してベイズ一般化(非線形)階層モデルを適合するための高レベルな lme4 スタイルインターフェースを提供する R パッケージです。多くの応答分布、柔軟な事前分布、およびフィット後の診断・可視化ツールをサポートしており、Stan コードを直接書かずに高度なベイズ回帰を実行できます。
OpenVoiceOS/ovos-installer
Open Voice OS用の簡素化されたインストーラー。ユーザーがRaspberry Pi、Linux、またはMacハードウェア上でプライバシー重視のオープンソース音声アシスタントをデプロイできるようにします。
yibie/skills-manager
Skills Manager は、Claude Code、Cursor、Gemini CLI、OpenHands など、数十種類のLLMベースの開発者向けエージェント用のコードエージェント「スキル」(プロンプト拡張)の検索、インストール、テスト、整理を一元化するネイティブmacOSアプリ(および併用可能なターミナルUI)です。オリジナルのスキルパッケージはローカルのLibraryに保存され、再利用可能なCollectionsにグループ化され、エージェントにシンボリックリンクでマウントされます。コンフリクト検出、翻訳、オフライン優先の動作を提供します。
CUNY-CL/wikipron
Wiktionaryから多言語発音データを抽出し、グラフェム-フォンム(G2P)データセットを作成するためのコマンドラインツールおよびPython API。
uxlfoundation/oneDNN
oneDNN(oneAPI Deep Neural Network Library)は、ディープラーニング演算子向けに高度に最適化された CPU および GPU カーネルを提供するオープンソースでクロスプラットフォームのパフォーマンスライブラリです。oneAPI 指定を実装し、Intel、AMD、Arm、および実験的な Power/IBM z/RISC‑V ハードウェアをサポートしており、PyTorch、TensorFlow、ONNX Runtime、llama.cpp などの主要フレームワークで使用されています。
tensorflow/quantum
TensorFlow Quantum は、Cirq 量子回路を TensorFlow/Keras と統合する Python ライブラリであり、高性能なハイブリッド量子-古典機械学習モデル、自動微分、および qsim を用いたスケーラブルなシミュレーションを提供します。
lucasjinreal/Kokoros
CLI、Rustクレート、およびOpenAI互換APIサーバーを介して高速なテキスト読み上げ合成を提供する、Kokoro TTSモデルの高パフォーマンスなRust実装。
fishaudio/audio-preprocess
AI学習用データセットの準備に役立つ、ボーカル分離、音量一致、音声認識などの音声処理スクリプトのコレクションです。
Ammaar-Alam/minebench
MineBenchは、『中世の城』のようなプロンプトに対してボクセル座標を出力させる仕組みで、LLMの3次元空間推論能力を評価するウェブベースのベンチマークです。生成物を可視化し、人間による直接比較を可能にし、ブレイディ・テリー法でモデルをランク付けします。プラットフォームには、ペアワイズ投票用のArena、カスタム構築用のSandbox、コミュニティプロンプトのGallery、およびGLB、STL、.vox、.schem形式でのエクスポート機能を備えています。主要なLLMプロバイダーをサポートし、Node.js、pnpm、Dockerでローカル実行も可能です。
justrach/kuri
AIエージェント向けの軽量なブラウザ自動化ツール。単一のZigバイナリとして実装されており、Node.jsへの依存関係はありません。
0xranx/golembot
GolemBot は、既存のコーディングエージェント(Cursor, Claude Code, OpenCode, Codex)にチャットボットの「本体」を与える Node.js ランタイムです。単一の `golembot gateway` コマンドで、Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat、またはカスタム HTTP API 上でエージェントを公開し、小さな YAML 設定で LLM プロバイダー(OpenRouter、MiniMax、DeepSeek など)を切り替えることができます。ClawHub マーケットプレイス(13k+ のコミュニティスキル)と統合されているため、エージェントはすぐに新しい能力を獲得できます。機能には組み込みダッシュボード、cron スケジューラー、フリート管理、そして最小限の JavaScript SDK(`createAssistant`)が含まれます。`npm i -g golembot` でインストールし、`golembot onboard` で設定を行い、`golembot gateway` で起動します。MIT ライセンス。
Cranot/roam-code
roam‑code は、リモートAPI呼び出しを一切行わず、AIコードエージェントが定義、呼び出し元、テスト影響、リスク(爆発半径)を照会できるローカル静的解析CLI(およびオプションのMCPサーバー)です。プリフライトチェック、ヘルスサマリー、検証ゲート、Claude専用フックを提供し、すべてオープンソースでプライバシーを守ります。
mrpulor-gh/nuphus-mcp
このリポジトリは、AIデスクトップおよびブラウザ自動化に関する本格的なソフトウェアプロジェクトです。JSON-RPCを標準入出力経由で使用するRustベースのMCPサーバーを提供し、AIエージェントがローカルのコンピュータを制御可能にします。ローカルでのOCR処理と、オプションのビジョンモデル統合もサポートしています。
NaomiProject/Naomi
Naomiはオープンソースで常に音声入力を受けつける音声アシスタントプラットフォーム(Python、Linux/Raspberry Pi)であり、家庭用デバイスの制御、情報の照会、シンプルなPythonモジュールによるカスタム「スキル」の追加が可能です。
xianyu110/clawbot
Clawdbot は、Claude、GPT、Gemini などの LLM に構成可能な API プロキシエンドポイント経由で接続するオープンソースでローカル実行可能な AI アシスタントです。Web UI とターミナル UI、Telegram/Discord/WhatsApp ボットを提供し、すべてのデータをホストに保存します。README には、インストール手順(Node 22+、npm またはスクリプト)、モデルとチャネル設定用のオンボーディングウィザード、マルチモデルプロキシ用の詳細な JSON 設定、Node バージョン、環境変数の誤用、必須フィールドの欠落といった一般的な落とし穴、およびゲートウェイ、ログ、診断の管理に使用する CLI コマンドの完全なセットが記載されています。
Spr-Aachen/Easy-Voice-Toolkit
Easy Voice Toolkit は、オープンソースの音声モデル(Whisper、GPT-SoVITS)を GUI/Colab ワークフローに統合し、音声のクリーニング、文字起こし、音声変換データセットの構築、カスタム音声モデルのトレーニング、変換音声の生成を行います。すぐに実行できる Windows ポータブルパッケージと Colab ノートブックを提供し、開発者向けのインストールガイドも備えています。このプロジェクトは学術利用のみを目的としており、将来の LLM チャットボット統合と Linux サポートを計画しています。
google/jax-cfd
JAX‑CFDは、微分可能なCFDのためのJAXベースの研究用ライブラリです。有限体積法および擬似スペクトル法ソルバー、オプションのML拡張モデル、およびデータユーティリティを提供し、ML拡張流体シミュレーションの研究における勾配ベースの実験を可能にします。pipでインストール可能で、Colabデモが付属しており、現在は非推奨(メンテナンス終了)となり、新しい代替案が推奨されています。
Kabanosk/whisper-website
OpenAIのWhisperを使用して、ローカルでオーディオをテキストやさまざまな形式の字幕に変換する自己ホスト型Webアプリケーションです。
teticio/audio-diffusion
拡散モデルをメルスペクトログラムに適用することで、音楽とオーディオループを合成するためのフレームワークです。潜在拡散(latent diffusion)と条件付き生成をサポートしています。
Xueyang-Song/paper-pilot
Paper Pilot は、8つ以上の学術データベースをクロールし、PDFをダウンロード、SQLite + FTS5 + ベクトル検索でインデックス化し、ローカルまたはホストされたLLMに根拠に基づいた回答を要求できるデスクトップ(Electron + React)研究アシスタントです。すべてのデータはあなたのマシン上に留まります。アプリは監査可能な出典トレースと、文献レビューの再現可能なワークフローを提供します。
Deep-ai-inc/ch.at
ch.atは、HTTP、SSH、DNS、またはAPI経由でLLM(デフォルトはGPT-4o)とチャットできるシングルバイナリのGoサーバーです。JavaScriptやアカウントは不要で、すべての状態はRAM内に保持されます。プライバシー重視でセルフホストが容易であり、同じ軽量プロトコルを使用してメッセージを投稿するためのパブリック掲示板も含まれています。
EasyJailbreak/EasyJailbreak
EasyJailbreak は、LLM の jailbreak 攻撃をモジュール化したオープンソースの Python フレームワークです。ReNeLLM、GPTFuzz、AutoDAN など、事前に用意されたレシピを提供し、カスタムのセレクター、ミュータター、制約、評価者を組み込んで、ターゲット言語モデルに対する悪意あるプロンプトを生成・実行・スコアリングできます。`pip install easyjailbreak` またはソースからインストールし、`PAIR` レシピなどの高レベル API を使用するか、独自の攻撃パイプラインを構築できます。本プロジェクトにはドキュメント、論文、データセット、実験結果のダウンロードが含まれます。
ankane/torch.rb
Torch.rbは、PyTorchのC++ライブラリ(LibTorch)をラップするRuby gemであり、Ruby開発者にフル機能のディープラーニングAPIを提供します。テンソル、Autograd、ニューラルネットワーク・モジュール、オプティマイザ、およびGPU(CUDA/MPS)加速をサポートし、PyTorchのPython APIをRubyスタイルのメソッド名でミラーリングしています。インストールには適合するLibTorchビルドが必要ですが、その後はRubyで直接モデル(CNN、GANなど)を構築・実行できます。
FlashLabs-AI-Corp/FlashLabs-Chroma
リアルタイム音声対話用のエンドツーエンドマルチモーダルモデルで、直接音声理解とパーソナライズされた音声クローンをサポートします。
Firepal/stammer
別のオーディオまたはビデオソースから、スペクトルが最も類似したフレームを使用して、あるオーディオソースを再構築するPythonユーティリティ。
jacbz/Lofi
特徴ベクトルを用いて音楽トラックを表現・生成するVAEモデルを活用した、機械学習を支援するlo-fi音楽生成器。
jjazzboss/JJazzLab
JJazzLabは、コード記号と選択された音楽スタイルに基づいて、ドラム、ベース、ギター、ピアノを含む現実的で動的なバックトラックを生成するオープンソースアプリケーションです。
ronibandini/reggaetonBeGone
Raspberry Pi 3で動作するエッジAIガジェット。ローカルでEdge Impulse音声分類モデルを実行し、レガエトンを検出。信頼度が95%を超えると、設定済みのスピーカーをBluetoothで無効化するルーチンを起動。OLEDフィードバック、スタートボタン、ログ記録、ハードウェア・ソフトウェアの完全な手順を備える。
kristianvast/hermes-claude-auth
hermes‑claude‑auth は、Anthropicが2026‑04‑04にOAuth検証を導入した後、hermes‑agentがClaude Codeサブスクリプション(Max/Pro)を継続して使用できるようにするPythonランタイムパッチです。.pthシムをインストールし、リクエストビルダーをモニキーパッチ、必要な請求ヘッダーを追加、プロンプトレイアウトを修正、サブスクリプションウィンドウのレートリミットに対する自動待機を実装します。インストーラーはLinux/macOS、Windowsに対応し、アンインストールスクリプトを提供、gitフック + cron回復によりhermesの更新後も生存します。