iot-salzburg/gpu-jupyter
GPU‑Jupyterは、Python、PyTorch、TensorFlow、Julia、Rが事前にインストールされたDockerベースのGPU対応JupyterLab環境です。バージョン管理されたイメージ、カスタマイズのしやすさ、Docker‑Compose対応を備え、NVIDIA GPUを搭載した任意のマシンで再現可能なディープラーニング実験を可能にします。
microsoft/TypeAgent
TypeAgentは、大規模言語モデル、構造化プロンプト、および独自の「構造化RAG」メモリシステムを活用して、単一のパーソナルAIアシスタントを構築するMicrosoftのオープンソースサンプルです。Electronベースのシェル、自然言語リクエストをタイプ化されたエージェントにルーティングするディスパッチャー、論理的エンティティとして会話の事実を保存するメモリ層、およびLLM呼び出しを削減するキャッシュを含んでいます。このリポジトリには、カレンダー、メール、ブラウザなど多くのサンプルエージェントと、カスタムエージェントを追加するためのSDKが含まれています。これは初期段階のサンプルコードであり、Azure OpenAIで英語でテスト済みで、さらなる検証なしにはプロダクション用途には向いていません。
erdogant/bnlearn
bnlearn は、ベイジアンネットワークの構造学習、パラメータ推定、クエリ処理を行うPythonライブラリです。構造発見(さまざまなスコアと探索手法)、CPT推定、因果推論(do-計算)、合成データ生成、可視化をサポートし、シンプルなAPIで統合されています。
bugbakery/transcribee
AIを使用して自動ドラフトを生成し、共同手動編集をサポートするオープンソースの音声・動画トランスクリプションツール。
joaopauloschuler/neural-api
CPU(AVX)またはOpenCL GPU上で、現代のLLM、音声生成、画像の超解像、および古典的なビジョンモデルを実行できるネイティブPascalのディープラーニングライブラリ。PythonやCUDAを必要とせず、1つのバイナリにコンパイルされる。
FonaTech/Clouds-Coder
Clouds Coderは、CLI実行とブラウザベースIDEを分離し、AIエージェントオーケストレーションを追加し、バージョン管理されたファイル、競合解決、管理者承認済みツールポリシーを備えたLAN限定のコラボレーティブワークスペースを提供するPythonランタイムです。
jim60105/docker-whisperX
WhisperX用の最適化されたDockerイメージのコレクション。単語レベルのタイムスタンプと話者分離を提供するASRモデルを事前にバンドルし、高速かつ効率的な音声認識(音声→テキスト変換)を実現します。
TalAter/annyang
音声認識を使用して、音声コマンドでウェブサイトを操作できるようにする軽量なJavaScriptライブラリ。
lenML/Speech-AI-Forge
ChatTTS、CosyVoice、Whisperを含む複数のTTSおよびASRモデルに対して、一元化されたインターフェースを提供する統合フレームワークおよびAPIサーバー。
open-mmlab/FoleyCrafter
FoleyCrafter は、無音ビデオの映像内容に基づいてリアルで同期した効果音を生成するビデオ‑ツー‑オーディオ フレームワークです。
brailcom/speechd
複数のテキスト読み上げエンジンにアクセスするための統一APIを提供する、音声合成のためのデバイス非依存インターフェース。
walkingddd/CPA-Helper
CPA‑Helper は、CLIProxyAPI/CPA アカウントを管理する自己ホスト型ウェブダッシュボード(Go バックエンド + Vue フロントエンド)です。複数ユーザーの分析、ユーザーごとの API キー管理、残高制限、モデル価格カタログ、Codex 認証ファイルの健全性チェックをすべてローカルの SQLite に保存して提供します。
CopilotC-Nvim/CopilotChat.nvim
GitHub Copilot Chat(および他の LLM)をエディタ内に直接埋め込む Neovim プラグインで、チャット、ツールコール、カスタムプロンプト、自動化用の Lua API を提供します。
nishuzumi/gemini-teacher
Google Geminiを基盤とするAI駆動の英語会話アシスタントで、リアルタイムの発音フィードバックと文法修正を提供します。
dseditor/QwenASRMiniTool
Qwen3-ASRとWhisperモデルを基にしたローカルオフライン音声認識字幕生成ツール。音声・動画・マイク録音をSRT字幕に変換可能。CPUまたはGPU加速に対応。複数の特化言語モデル、話者分離、カラオケ文字単位ハイライトを内蔵。コマンドラインインターフェースとOpenAI互換APIを提供。
chenpipi0807/ComfyUI-Index-TTS
高品質な音声クローンとテキスト to スピーチを実現するComfyUI拡張。多言語対応、感情制御、複数キャラクターの小説構文解析を備える。
dbccccccc/ttsfm
openai.fm バックエンドを使用してテキストを自然な音声に変換する、OpenAI 互換のテキスト読み上げ (TTS) API サービスおよび Python SDK。
hgneng/ekho
Ekhoは、書かれたテキストを音声に変換する中国語テキスト読み上げエンジンであり、ユーザーがカスタムボイスデータを統合できることをサポートしています。
bosun-ai/swiftide
Swiftide は、半自律型エージェント用のエージェント・ハーネス、ワークフロー・オーケストレーション用の型付きタスクグラフ、インデックス作成と検索用のストリーミング RAG パイプラインを備えた、LLM アプリケーション構築用の Rust フレームワークです。
facebookresearch/HolisticTraceAnalysis
Holistic Trace Analysis (HTA) は、分散学習ジョブから生成された PyTorch プロファイラ(Kineto)トレースを読み込み、GPU が計算、通信、メモリ、アイドルのどの部分に時間を費やしているかをデータフレームと可視化で示す Python ライブラリです。カーネルレベルの分解、アイドル時間の原因、通信-計算の重なり、頻出カーネルパターン、起動時間統計、拡張されたメモリ帯域幅/キュー長カウンター、トレース比較ツールを提供します。`pip install HolisticTraceAnalysis`(Linux/macOS、Python ≥ 3.10)でインストールでき、ノートブックで `TraceAnalysis` クラスを使用して各分析用の pandas DataFrames を取得できます。ドキュメント、例、および実験的な CUPTI カウンター API も提供されています。
tsurumeso/vocal-remover
音声をバックグラウンド音楽から分離することで、楽曲からインストゥルメンタルトラックを抽出するためのディープラーニングツール。
ML-KULeuven/deepproblog
DeepProbLogは、ProbLogの確率論理プログラミングと深層学習を統合したPythonライブラリで、確率がPyTorchモデルによって出力される事実であるニューラル述語を導入します。正確な推論とオプションの近似推論をサポートし、研究論文からの実験例が含まれており、`pip install deepproblog`でインストールできます。
rossoctl/rossoctl
Rossoctlは、オープンソースでKubernetesネイティブなプラットフォームであり、RossoCortexデータプレーンを通じてAIエージェントを中継し、アイデンティティ、承認、レジリエンス、監視を強制します。再利用可能なサービス(スキル、ツール、メモリ、知識ベース、サンドボックス)と管理ツールを提供し、フレームワークに依存せず信頼できるプロダクショングレードのエージェントデプロイを実現します。
nnstreamer/nnstreamer
NNStreamer は、開発者がニューラルネットワーク推論をメディアパイプラインに直接組み込めるようにする GStreamer プラグインを提供し、Linux、Android、Tizen、macOS にわたる多くの AI フレームワークとハードウェアアクセラレータをサポートしています。
halo-dev/upage
UPageは、大規模言語モデル(LLM)を活用して自然言語の記述から完全にレスポンシブなウェブページを生成するオープンソースでDockerベースのプラットフォームです。視覚エディタ、マルチページ生成、クリーンなHTML/CSS/JSのエクスポートを提供し、任意の互換性のあるLLM APIと連携可能です。
backmeupplz/voicy
ワーカー・キュー構造とGPUアクセラレートされたトランスクリプションを使用して、音声メッセージを自動的にテキストに変換するTelegramボット。
tequilahub/tequila
Tequilaは、変分量子アルゴリズムの構築と最適化に向けたPythonフレームワークです。回路、ハミルトニアン、期待値の抽象オブジェクト、自動微分、多数の量子シミュレータ(Qulacs、Qiskit、Cirqなど)および量子化学パッケージ(Psi4、PySCF、Madness)とのシームレスなサポートを提供します。ユーザーは高レベルなコードを記述し、`tq.minimize` を呼び出すだけで、シミュレータまたは実ハードウェア上で実行できます。
aliyun/alibabacloud-bailian-speech-demo
Alibaba Cloud Bailianの開発者向けサンプル集。Qwen-Audioや他のモデルを使用した音声認識、合成、リアルタイム音声対話を実装できます。
jcvasquezc/DisVoice
音声から音響的および言語的特徴を抽出し、発声障害や感情状態を検出するためのPythonフレームワーク。
wenet-e2e/wekws
低消費電力のIoTデバイス向けに設計された、小規模なウェイクワード検出用の本番環境対応エンドツーエンドツールキット。
Azure-Samples/cognitive-services-speech-sdk
Microsoft Cognitive Services Speech SDK を使用して音声認識、合成、翻訳を行うためのクロスプラットフォームコードサンプルのコレクションです。
BindsNET/bindsnet
BindsNET は、CPU または GPU 上でスパイキングニューラルネットワークを構築・シミュレーションするための PyTorch ベースのライブラリです。ニューロンモデル、生物学的に着想を得た学習則(例:STDP)、SNN を ML または RL エージェントに変換するツールを提供します。pip、Poetry、Docker でインストールでき、MNIST の教師なし学習から Atari ゲームプレイまでの例を実行できます。
lean-dojo/LeanCopilot
Lean Copilotは、大規模言語モデルを証明自動化戦略として統合するLean 4ライブラリです。`suggest_tactics`、`search_proof`、`select_premises`といったコマンドを提供し、事前ビルド済みのBYT5モデルを同梱。外部モデルはシンプルなHTTP API経由で接続可能。Lakeパッケージマネージャーでインストールでき、任意のLeanプロジェクトで即座に利用可能。
inworld-ai/tts
単一GPUまたはマルチGPUクラスタ上で事前学習、SFT、RLHFアライメントをサポートするSpeechLMベースのテキストから音声への変換システムのための学習およびモデリングフレームワーク。
openyak/openyak
OpenYakは、CodexやClaude Codeエージェントとチャットしながら、すべての会話履歴、ファイル、プロジェクトデータをローカル(Rust + SQLite)に保持できるオープンソースのデスクトップGUI(Electron + React)です。stdioを介して公式ランタイムを統合し、参照ファイル(Markdown、HTML、PDF、DOCX、コード)を表示します。また、Playwright駆動の共有ブラウザを提供し、ユーザーとエージェントの両方が同じページを制御できます。Node 26、Rust 1.90、および独自のCodex/Claude CLIバイナリを使用して実行してください。アプリはv2 alphaで、Apache-2.0ライセンスです。
machinewrapped/llm-subtrans
LLM‑Subtrans は、Pythonで作成されたデスクトップおよびCLIツールで、LLM API(Gemini、OpenAI、Anthropicなど)を使用して字幕ファイル(SRT/ASS/VTT)を翻訳します。プラグイン可能な字幕形式、オプションの音声認識、プロジェクトファイルの再開、多数の高度なCLIオプションをサポート。Windows/macOS用の事前ビルドパッケージまたは仮想環境インストーラーからソースからインストール可能。GUIまたはコマンドラインで実行でき、プロバイダーのAPIキーを入力するだけで利用可能。
neiltron/apple-health-mcp
AIアシスタントクライアント(MCP経由)が、インメモリのDuckDBデータベースを使用して、個人のApple Health CSVエクスポートファイルに対してSQLクエリを実行できるようにするローカルNode.jsサーバーです。スキーマの検出、アドホッククエリ、健康サマリーレポートを提供し、データはユーザーのPC内に保持されます。
ksenxx/kiss_ai
KISS Sorcar は、ローカル優先のオープンソースAIエージェントフレームワークで、デーモン(`kiss‑web`)を実行し、VS Code、Web/モバイル、Pythonインターフェースを通じて自然言語タスクを発行できます。OpenAI、Anthropic、Gemini、ローカルエンドポイントなど、任意のLLMを設定可能。1つのワークフロー内で複数モデルを組み合わせ、メッセージ、メール、スマートホーム、生産性サービス向けの43種類の組み込みサードパーティエージェントを提供。カスタムPython「拡張エージェント」により、タスクごとにプロンプト、ツール、予算、セーフティフックを定義可能。すべてのプロンプトはマシン上に留まる。git worktree分離、音声起動ワード、スケジュール自動化、ツール呼び出しをシステムが処理し、プライバシー重視かつ拡張可能な個人用AIアシスタントです。
linuxrebel/DocuBrowser
DocuBrowse はオフラインで動作するAI強化ドキュメント検索ツールです。幅広いファイル形式をインデックス化し、キーワード、意味、ハイブリッド検索(ローカルの Ollama 埋め込みを使用)を提供。ドキュメント内「Deep Links」を実装し、ローカルモデルでAI要約を生成可能。すべての処理はローカルで実行され、プライバシーを守り、Linux、Windows、macOS 用パッケージで提供されています。
kstonekuan/tambourine-voice
AIを活用して音声をクリーンなテキストに変換・整形し、任意のアクティブなアプリケーションに直接入力するオープンソースのユニバーサル音声認識インターフェース。
Lamatic/AgentKit
AgentKitは、70の完成済み「キット」(完全なアプリ、パイプライン、またはテンプレート)を提供するオープンソースSDKです。これらのキットはシンプルな設定ファイルで定義され、視覚的なフロースタジオで編集可能で、サーバーレスで動作するNext.jsアプリとして配布されます。サポートトリアージ、コードレビュー、RAGチャット、採用アシスタント、法務・医療ボットなど、多数のビジネス指向のエージェントをカバーしており、信頼性の高いエンタープライズグレードAIエージェントを即時構築できるプラットフォームです。
istupakov/onnx-asr
ONNXモデルを使用して自動音声認識を行うための軽量なPythonパッケージ。PyTorchやTransformersを必要とせず、エッジデバイスやサーバーハードウェアへの高速なデプロイが可能です。
cyberofficial/Synthalingua
ライブ配信、マイク音声、およびビデオファイルを、英語やその他の言語にリアルタイムで文字起こしおよび翻訳するためのセルフホスト型AIツール。
AudarAI/Audar-ASR-V1
アラビア語を第一に考える生成型音声認識モデルのファミリー。方言アラビア語およびコードスイッチド音声の最先端の変換を提供する。
janvarev/Irene-Voice-Assistant
デフォルトでオフライン動作し、拡張可能なプラグインとLLMによる自然言語コマンド処理をサポートするロシア語音声アシスタント。
cmusphinx/pocketsphinx
PocketSphinx は、低リソースデバイスで効率的に動作するオープンソースでオフラインの音声認識エンジン(CライブラリとPythonバインディング付き)です。音声の認識またはアライメントを実行し、結果をJSON形式で出力するコマンドラインツールとAPIを提供しています。
ManimCommunity/manim-voiceover
OpenAI Whisperを使用して単語ごとのアニメーション同期を可能にし、AI音声読み上げと録音ツールをPythonに直接統合するManimプラグイン。
Migushthe2nd/MsEdgeTTS
Microsoft Edgeの読み上げAPIを使用して、サーバーサイドのランタイム向けにテキスト読み上げ合成を提供するシンプルなAzure Speech Serviceモジュール。