shlokkhemani/rabbithole
ユーザーが既存のコンテンツ内の任意のポイントで質問することで、新しいドキュメントに分岐できる無限のキャンバスによる学習ツール。
jd-opensource/JoySafeter
脆弱性分析やペネトレーションテストなどの複雑なタスクを自動化するためのAIネイティブなプラットフォーム。
elder-plinius/GL4SS
2.52億年前から西暦3050年まで、地球上のあらゆる場所のあらゆる時点におけるAIビジュアルを生成する時空イメージ・ビデオエンジンです。
microsoft/Tutel
Tutel は、Microsoft が提供する大規模言語モデル用のオープンソース、高性能 MoE ライブラリです。ダイナミック・パラレルリズム、ダイナミック・インファレンス(NVFP4, MXFP4, FP8, BF16)、最大 1M トークンのコンテキスト、ビジョン拡張、NVIDIA と AMD GPU で DeepSeek-V3.2, Kimi-K3, GLM-5.x, Qwen-3, GPT-OSS などのモデルを動かす Docker イメージを提供します。pip で Git リポジトリからインストール、またはソースからビルド、その後、提供された Docker コンテナを利用するか、Python API を用いてカスタム MoE ルーティングを行います。
IDEA-CCNL/Fengshenbang-LM
中国語の事前学習済み基盤モデルのオープンソース・エコシステム、および自然言語理解、生成、マルチモーダル・タスクをサポートするフレームワーク。
Core-Mate/OpenGUI
実機上で動作するAndroid用モバイルGUIエージェントフレームワーク。AIエージェントがアプリインターフェースを認識・操作し、長時間にわたる自動化ワークフローを実現。
istupakov/onnx-asr
ONNXモデルを使用して自動音声認識を行うための軽量なPythonパッケージ。PyTorchやTransformersを必要とせず、エッジデバイスやサーバーハードウェアへの高速なデプロイが可能です。
cyberofficial/Synthalingua
ライブ配信、マイク音声、およびビデオファイルを、英語やその他の言語にリアルタイムで文字起こしおよび翻訳するためのセルフホスト型AIツール。
AudarAI/Audar-ASR-V1
アラビア語を第一に考える生成型音声認識モデルのファミリー。方言アラビア語およびコードスイッチド音声の最先端の変換を提供する。
janvarev/Irene-Voice-Assistant
デフォルトでオフライン動作し、拡張可能なプラグインとLLMによる自然言語コマンド処理をサポートするロシア語音声アシスタント。
cmusphinx/pocketsphinx
PocketSphinx は、低リソースデバイスで効率的に動作するオープンソースでオフラインの音声認識エンジン(CライブラリとPythonバインディング付き)です。音声の認識またはアライメントを実行し、結果をJSON形式で出力するコマンドラインツールとAPIを提供しています。
ManimCommunity/manim-voiceover
OpenAI Whisperを使用して単語ごとのアニメーション同期を可能にし、AI音声読み上げと録音ツールをPythonに直接統合するManimプラグイン。
Migushthe2nd/MsEdgeTTS
Microsoft Edgeの読み上げAPIを使用して、サーバーサイドのランタイム向けにテキスト読み上げ合成を提供するシンプルなAzure Speech Serviceモジュール。
PowerBeef/Vocello
MLXとSwiftを使用して高品質な音声を生成する、macOSおよびiOS向けのローカルファーストなボイススタジオ。クラウドへの依存なしに、ボイスクローニングやカスタムボイスデザイン機能を備えています。
cboard-org/cboard
発話障害を持つ人々が記号と音声合成を使ってコミュニケーションできる補助的・代替的コミュニケーション(AAC)Webアプリです。
nateshmbhat/pyttsx3
インターネット接続なしで音声を生成するためのPythonライブラリ。ネイティブなシステムエンジンを使用して、オフラインで音声出力を実現します。
readbeyond/aeneas
音声ナレーションと対応するテキスト断片を自動的に同期するための、Python/Cライブラリおよびツールセット。
showlab/Kiwi-Edit
Kiwi‑Editは、自然言語による指示(およびオプションの参照画像)を使用して、ビデオ全体を編集できるオープンソースのビデオ編集システムです。マルチモーダルLLMエンコーダとビデオ Diffusion Transformerを融合させ、スタイル転移、オブジェクトの追加/置換/削除、背景変更などの機能を提供します。本リポジトリは、完全なトレーニング・スクリプト(Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5Bを用いた三段階のカリキュラム学習)、学習済み Diffusers チェックポイント、および OpenVE‑Bench と RefVIE‑Bench での評価パイプラインを提供します。
ashbuilds/payload-ai
コンテンツフィールドにAI駆動のテキスト、画像、音声生成を追加するPayload CMSプラグイン。複数のモデルプロバイダーをサポートし、細かい設定とアクセス制御を提供します。
Chaoses-Ib/ComfyScript
ComfyUI用のPythonフロントエンドおよびライブラリ。ビジュアルノードグラフの代わりに、Pythonスクリプトとして画像生成ワークフローを定義・実行できます。
VibiumDev/vibium
CLI、MCP、またはクライアントライブラリ経由で、ウェブベースのタスクをブラウザ自動化して検証できるAIコーディングエージェント用の検証レイヤーです。
Mengqi-Lei/count-anything
Count Anything は、自然言語クエリに基づいて画像内のオブジェクトをカウントする研究用モデルである。スパース領域カウンターと密なピクセルカウンターを組み合わせ、パラメータフリーな統合ステップで結果を融合することで、6つのドメイン(シーン、衛星、医療など)で動作する。リポジトリには事前学習済みチェックポイント、トレーニング/評価スクリプト、および大規模な CLOC データセットの準備手順が含まれている。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafterは、エッジデバイス向けに最適化されたコンパクトなVision Transformer (ViT)を提供し、低遅延で高パフォーマンスなオブジェクト検出、インスタンスセグメンテーション、ポーズ推定を実現します。
microsoft/TimeCraft
TimeCraft は、Microsoft Research が開発した拡散モデルに基づく合成時系列データ生成フレームワークです。プロトタイプ辞書によるクロスドメイン少サンプル適応、自然言語制御、ターゲット意識型生成により、下流タスクに最適化された合成サンプルを生成します。拡張機能として因果制約、基礎モデル事前学習用オンライン拡張、不規則観測からの連続時間生成をサポートします。
open-ribbi/velocut
AI統合による自動シーン構成と編集を備えた、マルチトラックビデオ編集と3Dシーンディレクションを統合したブラウザベースのスタジオ。
yan5xu/codexloom
CodexLoomは、自己ホスト型プラットフォームであり、Codexチャットエージェントに耐久的なアイデンティティ、プロフィール、組織ツールを追加します。これにより、複数デバイスからアクセス可能で、バウンデッドメッセージで通信し、Feishu、Slack、Parallなどの外部チャットプラットフォームにインターフェースエージェントを通じて公開できる「ドメインエージェント」を実現します。高度な単独ユーザー向けに、UI、CLI、ガバナンス機能を提供し、Elastic License 2.0の下でリリースされています。
kris-hansen/comanda
リポジトリ内で耐久的で自己改善可能なエージェントワークフローを実行するターミナルネイティブなランタイム。品質ゲートとコードベースインデキシングを使用して、作業が実際に完了していることを保証します。
Cocolalilal/LastChat
Android用のプライバシー重視のAIアシスタントアプリで、RAGベースのメモリ、マルチモーダル入力、および組み込みのPythonとJavaScriptエンジンを備えています。
lhotse-speech/lhotse
機械学習トレーニング向けに、音声、音声、動画、画像データのロードと操作を最適化する柔軟なマルチモーダルデータ準備用Pythonライブラリです。
holoviz/lumen
データと対話するための、エージェントベースのオープンソースフレームワークおよびRAG。ユーザーが自然言語を介してデータパイプラインと可視化を生成することを可能にします。
SkyworkAI/Skywork-R1V
Skywork-R1Vは、強化学習と視覚的思考の連鎖(Visual Chain-of-Thought)を用いて、複雑な視覚的論理、数学、物理のタスクにおいて最先端の性能を実現するオープンソースのマルチモーダル推論モデルです。
do-md/domd
大規模ファイル、リアルタイムコラボレーション、AI出力のストリーミングに対応した高性能な WYSIWYG Markdown エディタとカーネル。
NVlabs/physical_ai_av
NVIDIA Physical AI Autonomous Vehicles Dataset にアクセスして、エンドツーエンドの走行システムを構築するための Python 開発者キット。
fajarhide/omni
ノイズの多いコマンド出力を精製し、繰り返しデータを再取得可能なハンドルに置き換えることで、AIエージェントのトークン使用量を削減するツール。
gobii-ai/gobii-platform
メールやSMSで連絡でき、プロダクション向けのブラウザ自動化を実行できる、耐久性があり常時稼働する自律エージェントを運用するためのAI従業員プラットフォームです。
AmberSahdev/Open-Interface
LLM を使用し、視覚フィードバックに基づいてキーボードとマウス入力をシミュレートし、PC を自律的に操作する AI 駆動のコンピュータ自動化ツールです。
SponsioLabs/Sponsio
Sponsioは、LLMベースのエージェントに決定論的でマイクロ秒単位のガードレールを追加するオープンソースライブラリです。形式手法に基づいたコントラクト(YAMLルールブック)を作成し、ツール呼び出しのたびに強制適用することで、モデルを呼び出すことなくアクションをブロック、警告、または許可できます。このライブラリは、PythonまたはTypeScriptのLangChain、Claude、OpenAI、CrewAIなどのエージェントフレームワークと統合されており、22個の既製コントラクトバンドルが付属し、監査とレビューのためのホスト型コンソールも提供します。ベンチマークでは、誤った動作が95%以上削減され、呼び出しあたりのレイテンシは0.2ms未満であり、本番環境のAIエージェントにとって高速で信頼性の高い安全層となります。
av/harbor
HarborはCLI駆動のDocker-Composeオーケストレーターであり、Ollama、llama.cpp、vLLM、MLXなど、モデルバックエンド(Ollama、llama.cpp、vLLM、MLX、など)、チャットフロントエンド(Open WebUI、LibreChat、AnythingLLM、…)、ウェブ検索、音声、画像生成、Boostベースのエージェントワークフローを含む完全なローカルLLMスタックを、単一の `harbor up` コマンドで起動できます。
artivis/manif
ロボティクスの状態推定向け Lie 理論ライブラリで、C++ と Python のツールを提供し、さまざまな Lie 群にわたる回転、平行移動、速度を扱います。
marcusquinn/aidevops
aidevops は MIT ライセンスの AI-DevOps フレームワークで、コード、インフラ、プロダクト、マーケティングなど across で AI エージェントをオーケストレーションする CLI と OpenCode プラグインを提供します。作業を 14 の主要エージェントと数千のサブエージェントに分割し、パルス監督者がタスクをルーティングし、トークン予算を管理し、シークレットを安全に保ち、Gitの整備を維持します。npm または Homebrew でインストール後、`aidevops init`、`aidevops pulse`、またはドメイン固有のスラッシュコマンドを実行して、ビルド、デプロイ、レポート、ビジネスプロセスを自動化しながら監査可能に保つことができます。
pinecone-io/python-sdk
AIアプリケーション向けにベクターインデックスの作成、管理、クエリを可能にするPythonクライアントです。
ZhixiangLuo/10xProductivity
ローカルファーストのスタックで、既存のユーザー権限とツールアクセスを活用し、コーディングエージェントを仕事用のパーソナル AI アシスタントに変換し、企業 IT の制約を回避します。
SonySemiconductorSolutions/mct-model-optimization
A model compression toolkit for PyTorch and Keras that optimizes AI models for edge deployment using quantization, pruning, and hardware-aware optimization.
ultralytics/xview-yolov3
リモートセンシング用途向けに、xView衛星画像データセット上でオブジェクト検出を訓練・実行するための専用実装されたYOLOv3。
study8677/repobrain
コードベース向けの根拠のあるQ&Aシステムを構築するマルチIDE対応のリポジトリ知識エンジンで、AIエージェントが正確なファイルパスと行番号を含む回答を提供できるようにします。
norse/norse
Norse は PyTorch ベースのライブラリで、スパイキングニューラルネットワークのプリミティブ(LIF、LSNN など)を追加し、イベント駆動モデルの構築・学習・評価を可能にします。pip/conda/Docker でインストールでき、MNIST、CIFAR‑10、cart‑pole といったサンプルタスクが用意されており、PyTorch‑Lightning と統合してスケーラブルな学習が行えます。
mlmed/torchxrayvision
胸部X線データセットとモデルのためのライブラリで、事前学習済みモデルと統一インターフェースを提供し、複数の公開胸部X線データセットでの作業を容易にします。
netket/netket
NetKet は、ニューラルネットワークと機械学習を使用して多体系量子系を研究するための、JAX ベースの Python ライブラリです。