TheStageAI/TheWhisper
NVIDIA GPUおよびApple Silicon上で、低レイテンシのストリーミングとデバイス内推論に最適化された、ファインチューニングされたWhisperモデルに基づく高パフォーマンスな音声認識ソリューション。
TensorSpeech/TensorFlowASR
ext{TensorFlow ベースの自動音声認識 (ASR) フレームワーク。様々な ASR アーキテクチャを実装し、効率的なデプロイのために TFLite 変換をサポートしています。}
sooftware/conformer
CNNとTransformerを組み合わせ、局所的および大域的な音声依存関係を捉えることで音声認識を向上させるConformerアーキテクチャのPyTorch実装。
modal-labs/quillman
Moshi 音声対音声モデルを活用し、低遅延かつ双方向のオーディオストリーミングを提供することで、人間のようなインタラクションを実現する音声チャットアプリケーションです。
flashlight/wav2letter
wav2letter++ は、最先端の音声からテキストへのアーキテクチャを実装するためのレシピと学習済みモデルを提供する、エンドツーエンドの自動音声認識フレームワークです。
Uberi/speech_recognition
OpenAI Whisper、Google Speech、Voskなどの複数のオンラインおよびオフラインエンジンをサポートする、音声認識のための統一インターフェースを提供するPythonライブラリ。
elevenlabs/elevenlabs-js
ElevenLabs の公式 Node.js SDK で、リアルな AI 音声合成、リアルタイム音声ストリーミング、音声駆動 AI エージェントをアプリケーションに統合できます。
wildminder/ComfyUI-VoxCPM
VoxCPM(トークナイザー不要のTTSシステム)のComfyUIカスタムノード統合。表現力豊かな音声生成、自然言語による音声設計、高度なボイスクローニングを可能にします。
codeforequity-at/botium-speech-processing
オープンソースおよびクラウドベースの音声文字起こし (STT) とテキスト読み上げ (TTS) サービスのための統合 API。チャットボットや音声アプリケーションのオーディオ処理を簡素化します。
hengruiyun/AI-Stock-Master
AI Stock Master は、Windows/macOS 向けのデスクトップアプリで、定量的株式分析アルゴリズム(RTSI、TMA、MSCI)とローカルで実行されるLLM(Mini Ollama)を組み合わせ、中国・香港・米国株式の自然言語市場レポートと取引シグナルを生成します。研究目的のツールであり、商業取引プラットフォームではありません。
24kchengYe/MemoMind
MemoMindは、AIコーディングエージェント向けのローカルホスト型、GPU加速メモリシステムです。チャット、ドキュメント、日々の出来事から抽出された事実をPostgreSQL + pgvectorに保存し、知識グラフを構築。高速な4方向ハイブリッド検索(意味的、BM25、グラフ、時系列)を提供。エージェントは新しい情報を保持し、関連する記憶を想起し、全記憶を横断的に反映できます。すべてのデータはユーザーのマシン上に留まり、任意のOpenAI互換LLMと連携可能。Webダッシュボードで記憶を閲覧・エクスポートできます。
adobe-research/dynasaur
DynaSaurは、タスクを解決するためにPythonコードをアクションとして記述・再利用し、定義済みのツールが不十分な場合に動的に適応するAIエージェントフレームワークです。
Paritok-official/paritok-4b-v1
Paritok は、コーディングエージェント(Claude Code、Cursor、Codex、OpenHands など)と LLM API の間に配置されるオープンソースのプロキシです。 (1) 関係のないツールスキーマをフィルタリングし、(2) 4B モデルでファイル読み取り/ツール出力/履歴を圧縮し、(3) 古いトーンを要約することで、入力トークンの使用量を削減します。ゲートウェイは Python パッケージ(`paritok[proxy]`)として、Ollama や vLLM を通じたローカル実行またはホストGPUサービスでの利用が可能です。報告された節約効果は、最初のターンで約25%、長時間のセッションでは60%以上であり、コスト削減が顕著です。プロジェクトは Apache-2.0 ライセンスで、ダッシュボードと VS Code 拡張も含まれています。
Picovoice/speech-to-text-benchmark
さまざまなデータセット上で音声認識エンジンをベンチマークし、精度、レイテンシ、計算効率を比較するためのミニマリストフレームワーク。
mrwadams/attackgen
AttackGenは、LiteLLMを介してLLMを使用し、MITRE ATT&CK、MITRE ATLAS、およびAI-insider-threatモデルを組み合わせて、完全なインシデント対応テーブルトップ演習シナリオ、検知・対応レポート、およびATT&CK Navigatorレイヤーを生成する、StreamlitベースのオープンソースWebアプリです。複数のLLMプロバイダーをサポートし、チャットアシスタントによる微調整が可能で、Dockerコンテナとして、またはローカルで、あるいはエージェント型統合のためのFastMCPサーバーを含んでいます。
nullpointexception-i/agent-sphere
AgentSphereは、LLM駆動のReActループを実行し、マルチエージェントサブラン、Chrome拡張機能によるリアルブラウザ自動化、モデルルーティング、永続的なマルチレベルメモリ、人間がループに参加する明確化、OIDC SSO、埋め込みチャットウィジェットをサポートするJava-Spring/Reactプラットフォームです。
csdcorp/speech_to_text
Android、iOS、および web で、短い音声コマンドやフレーズを使用するために、アプリがネイティブデバイスの音声認識機能にアクセスできるようにする Flutter プラグインです。
Picovoice/leopard
Leopard は、複数のプラットフォームにわたってプライバシーを保護し、正確で、計算効率の高い音声文字起こしを提供するデバイス内音声文字起こしエンジンです。
Picovoice/cheetah
デバイス上で動作するストリーミング音声認識エンジンで、プライバシーを保護しながら複数プラットフォームでリアルタイム音声文字起こしを提供します。
innovatorved/whisper.api
whisper.cpp をベースとした、Deepgram と互換性のある、自己ホスト型で高性能な音声文字起こし API です。簡単に統合できます。
deepgram/deepgram-python-sdk
自動音声認識、音声合成、言語理解APIを簡単に統合できるDeepgramの公式Python SDK。
CortexReach/memory-lancedb-pro
memory-lancedb-pro は、AIエージェントに永続的で検索可能な記憶を提供する生産環境対応のOpenClawプラグインです。自動で会話の断片をキャプチャし、LLMで分類してLanceDBのベクトル+BM25インデックスに保存し、最も関連性の高い記憶を自動的にプロンプトに挿入します。ハイブリッド検索、クロスエンコーダー再ランク付け、Weibullベースの忘却、エージェント/ユーザー/プロジェクトごとのスコープ、任意のOpenAI互換埋め込みプロバイダ対応を備えています。ワンクリックスクリプトまたはOpenClaw CLIでインストールでき、短いJSONブロックで設定し、組み込みCLIで管理可能です。
ankane/neighbor
Neighbor は ActiveRecord モデルにベクトルベースの最近傍検索を追加する Rails ギムです。PostgreSQL(pgvector または cube)、MariaDB、MySQL(HeatWave)、SQLite、Redis、S3 をサポートし、多数の距離メトリクス、複数のベクトルタイプ、正確および近似インデックスを提供します。Rails アプリ内に意味的検索、推薦、ハイブリッド取得を直接構築できます。
nii-yamagishilab/project-NN-Pytorch-scripts
ニューラルボコーダーと音声スプーフィング対策(偽音声検出)に焦点を当てた、PyTorchスクリプトとツールのコレクション。
elyra-ai/elyra
Elyraは、ビジュアルパイプラインエディタ、ノートブック/Python/Rスクリプトのバッチジョブ実行、再利用可能なコードスニペット、LLM駆動のコードアシスタント、Jupyter Enterprise Gatewayを介したハイブリッドランタイムサポート、Git統合などを備えたJupyterLab拡張のコレクションです。pipまたはconda(またはDocker経由)でインストール可能で、データサイエンスチームがノートブック環境から離れることなくAIパイプラインの構築、実行、バージョン管理が可能です。
QJHWC/PaperForge
PaperForge Research OS v3は、AI支援による論文執筆、実験オーケストレーション、成果物追跡、および検証可能な出版を統合するPythonベースのツールです。すべての主張と証拠のリンクをSQLite「Scientific Memory」に保存し、3つの実行プロファイル(writing-only、research、full)を強制し、ローカル、Docker、SSH、Slurm、Kubernetes、クラウドコンピューティングのバックエンドをサポートします。CLI (`paperforge …`) とローカルWeb UIを通じて、ユーザーはワークフローの実行、提案の承認、組み込みテンプレート(generic、CVPR、IEEE、Elsevier)を使用したLaTeXのコンパイル、およびシークレットスキャン後の決定論的なソースバンドルのリリースが可能です。再現性のある学術研究のために設計されており、非商用ライセンスの下でオープンソース化されています。
steipete/sag
ElevenLabsまたは60dbを使用して高品質なAI音声合成を実現する、macOSスタイルの「say」コマンドのようなCLI TTSツールです。
opendilab/LightRFT
LightRFTは、大規模言語モデル(LLM)およびマルチモーダル生成モデルのファインチューニングのための、オープンソースの分散型強化学習フレームワークです。DeepSpeedやFSDPといったトレーニング・バックエンドと、SGLangやvLLMといったロールアウト・エンジンを統合し、GRPO、REINFORCE++、DAPOなどの様々なRLアルゴリズムをサポートし、テキスト、画像、動画、音声の各モダリティに対応しています。ライブラリには、すぐに実行可能な例(例:Qwen2.5を使用したGSM8K)、詳細なドキュメント、Dockerイメージが用意されており、RLベースのアライメント・パイプラインを構築する研究者やエンジニアに適しています。
SaynaAI/sayna
複数のプロバイダーにまたがるリアルタイム音声認識(STT)および音声合成(TTS)サービスを統一APIで提供する、高性能なRustベースのサーバー。
optimatika/ojAlgo
ojAlgoは、高性能な線形代数、数値最適化(LP/QP/MIP)、および軽量なデータサイエンスツール(ニューラルネットワーク、クラスタリング)のための純Javaライブラリです。外部依存関係なし、MITライセンス、JavaベースのAI/MLワークロードに適しています。
kitlangton/Hex
Apple Silicon Mac向けのオンデバイス音声認識ユーティリティで、音声をリアルタイムにテキストに変換し、任意のアクティブなアプリケーションに貼り付けます。
bootphon/phonemizer
複数のバックエンドを使用して、複数の言語でテキストを音素表記に変換するためのPythonライブラリおよびコマンドラインツール。
nv-legate/cupynumeric
cuPyNumericは、Legateランタイム上でNumPy APIを実装するNVIDIAのライブラリであり、NumPyコードをGPUや分散クラスター上で実行可能にします。ドロップイン互換性を提供し、Linux Python 3.11-3.14をサポートしており、CondaまたはPyPI経由でインストール可能です。本プロジェクトは現在サポート終了(最終バージョン v26.06.01)となっていますが、Apache-2.0ライセンスの下で過去の利用のために引き続き利用可能です。
duckbugio/flock
FlockはDockerベースのサービスで、Telegram、VK、またはテキスト専用アダプタを通じてチャットで制御可能なClaude-Code搭載開発チームを提供します。1つのメッセージで計画、コード作成、テスト、レビュー、プルリクエストの開設を実行でき、自己検証、目標評価、スケジュールジョブ、CI監視のオプションループも利用可能。各チャットには独自の隔離されたワークスペースとブランチが割り当てられ、GitHub/GitLab/GiteaとPATで連携。`.env`ファイルを設定した後、`docker compose up -d` で1行でデプロイ可能。コアロジックは `core/agents/` にあり、アダプタは薄いラッパーです。
Gremble-io/Detto
Apple Silicon用のローカルファーストmacOSアプリで、会議、ボイスメモ、システムワイドな音声入力のためのプライベートでオンデバイスの音声認識を提供。構造化されたMarkdownファイルを出力。
allgpt-co/QuickVoice
QuickVoice は、マーケティングサイトから電話接続、RAG、課金まで、音声 AI スタックの全レイヤーを完全に制御できる、オープンソースのセルフホスト型音声エージェント構築プラットフォームです。
aws-samples/amazon-bedrock-client-for-mac
macOS用ネイティブSwiftアプリで、Amazon Bedrockに直接接続し、テキスト、画像、その他の基礎モデルとチャット可能。ファイル添付、ローカルツール/スキルの実行、自動プロンプトスケジューリングが可能。すべてのデータはMacのローカルに保存されます。
Palm1r/QodeAssist
QodeAssist は、C++/QML 用の AI 駆動型コード補完、チャット、およびインライン・リファクタリング機能を追加する GPL-v3 の Qt Creator プラグインです。Ollama、llama.cpp、LM Studio などのローカル LLM プロバイダーおよびクラウド LLM プロバイダー (Claude, OpenAI, Gemini, Mistral, Qwen, DeepSeek, etc.) と連携し、そのプロジェクト・コンテキストを認識するツールを Model Context Protocol (MCP) を介して他のエディタで利用可能にします。プロジェクトはアーカイブされており、現在はメンテナンスされていません。
jayminwest/mulch
MulchはCLI駆動型でGitバックアップされた知識ベースであり、AIエージェントがドメインごとのJSONLファイルに構造化された学び(慣習、失敗、意思決定など)を記録し、後でプロンプトインジェクション用に最適化された抜粋を取得できるようにします。カスタムレコードタイプ、根拠に基づくスコープ、ヘルスチェック、および削除機能をサポートし、チームがエージェントセッション間で専門知識を蓄積・共有できるようにします。
izwi-ai/izwi
クラウドAPIを必要とせず、音声認識、音声合成、チャットワークフローをローカルで実行できるローカル優先の音声AIプラットフォーム。デスクトップアプリ、CLI、サーバーを提供。
6drf21e/ChatTTS_colab
ChatTTS の簡素化されたデプロイメント・ラッパー、WebUI とワンクリックでの Colab セットアップを提供し、高度なテキスト・トゥ・スピーチ生成を実現します。
KlaatAI/klaatcode
Klaat Codeは、ホストされたKlaatu-o1ルーターと通信するターミナルベースのAIコーディングアシスタントです。ルーターはリクエストごとに最も安価なモデル層を自動的に選択し、必要な場合にのみエスカレーションを行うことで、コストを劇的に削減します。クライアントはプロジェクトをセマンティックなコールグラフにインデックス化し、ツール呼び出し(ファイル編集、シェルコマンド、Web検索)を無料で実行し、スマートな圧縮と検証によってコンテキストを管理します。機能には、リッチなUI、スラッシュコマンド、Git統合、サブエージェント委任、広範な安全/権限チェック、およびタスクあたり$0.027、中央値23秒という再現可能なベンチマーク結果が含まれます。
crabwise-ai/crabwalk
Crabwalk は、WhatsApp、Telegram、Discord、Slack 上での OpenClaw AI エージェントの活動を可視化するリアルタイム Web UI です。OpenClaw ゲートウェイから WebSocket でイベントをストリーミングし、ライブのセッションノードグラフを表示し、ツール呼び出しを検査でき、Docker、CLI、ソースインストールでのデプロイをサポートします。
shibing624/agentica
Agenticaは、オープンソースでApache-2.0ライセンスのもと提供されるフレームワークであり、複数のLLM駆動エージェントをローカルで実行できます。統一されたCLI、Web UI、デスクトップアプリを提供し、同じ履歴と設定を共有します。非同期優先のツール実行、マルチモデル・マルチモーダル対応、持続的メモリとコンテキスト圧縮、マーカドダウンベースの自己進化スキルシステム、セーフティガードレール、組み込みのコラボレーション(ピアメッセージ、タスク/サブエージェント、委任プロセス)を備えています。PythonおよびTypeScript SDKによりコード内にエージェントを埋め込み可能で、Docker/uv-toolインストーラーでセットアップも簡単です。
jitsi/jiwer
Word Error Rate (WER) や Character Error Rate (CER) などの指標を用いて、自動音声認識システムを評価するための高速な Python パッケージです。
shiwenwen/hope-agent
Hope Agent は、オープンソースの Rust ベースのデスクトップ AI アシスタントで、ネイティブアプリ、Web UI を備えたヘッドレスサーバー、または IDE 統合バックエンドとして実行できます。目標駆動のタスク自動化、永続メモリ、デザインスペース生成、および強力なセキュリティ(ローカルファーストデータ、ツール承認、Docker サンドボックス)を備えた完全なコンピュータ制御(ファイル、シェル、ブラウザ)を提供します。パッケージマネージャーまたは Docker を介して macOS、Windows、Linux にインストール可能で、数十の LLM プロバイダーテンプレート、マルチプラットフォーム IM 統合、プラグインスキルシステムを同梱しています。
resemble-ai/Perth
音声ファイルに知覚不可能なウォーターマークを埋め込むおよび検出するためのPythonライブラリ。ニューラルネットワークベースのアプローチを利用して、操作に対する堅牢性を確保します。
qqqqqf-q/Arkloop
ArkloopはオープンソースでローカルファーストのAIエージェントプラットフォームです。Goバックエンド、SQLiteストレージ、Electronベースのデスクトップアプリ(ReactウェブUI付き)をバンドルしており、マルチモデルルーティング、ツール呼び出し、永続的またはセマンティックメモリ、Telegram、Discord、QQ、Feishu、WeChatとの統合をサポートします。GitHubリリース、Homebrew、AURからインストール可能で、すべての処理はユーザーのマシン上で実行され、クラウドインフラストラクチャは一切不要です。