RobotecAI/rai

具身AI (Embodied AI) 機能の開発とデプロイのための柔軟なAIエージェントフレームワーク。生成AIを活用して、ロボットが推論、マルチモーダルなインタラクション、および複雑なタスク実行を可能にします。

giselles-ai/giselle

ビジュアルビルダーと GitHub 統合による、エージェント型ワークフローの構築と実行のためのオープンソース AI agent studio。

alexiglad/EBT

テキスト、画像、動画の各モダリティでスケーラブルな推論と System 2 思考を可能にする、エネルギーベーストランスフォーマー(EBT)用フレームワークです。

NVIDIA/DALI

画像、動画、音声データのディープラーニング・パイプラインにおける CPU ボトルネックを解消するための、GPU 加速データロード・プリプロセッシング・ライブラリ。

memodb-io/Acontext

AI エージェントのスキル記憶層をオープンソースで提供し、エージェントの実行から学習内容を自動的に取得し、人間が読める Markdown ファイルとして保存します。

vakra-dev/reader

AI エージェントや LLM 向けに、クリーンな Markdown とアンチボット回避機能を提供する、プロダクションレベルのウェブスクレイピングエンジンです。

ra1nty/DXcam

Python向けの高性能Windowsスクリーンキャプチャライブラリで、AIエージェントやコンピュータビジョンのワークロード向けに低遅延・高FPSのフレームを提供します。

winfunc/opcode

Claude Code向けのGUIアプリケーションおよびツールキット。視覚的なセッション管理、カスタムエージェントの作成、使用状況の分析を提供します。

potamides/DeTikZify

DeTi*k*Zify は、スケッチやラスター科学図を編集可能な TikZ コードに変換するオープンソースのマルチモーダル LLM です。画像から TikZ への生成、Ti*k*Zero アダプタによるテキストから TikZ への生成、モンテカルロ木探索による反復的改善をサポートしています。pip でインストールでき、完全な TeX Live、Ghostscript、Poppler のインストールが必要で、GPU(8‑b モデル)または CPU(1‑b)で実行できます。リポジトリには、CLI/Web UI、Python API の例、Hugging Face 上のモデル重み、トレーニングデータセットを再作成するスクリプトが含まれています。

mrpulor-gh/nuphus-mcp

このリポジトリは、AIデスクトップおよびブラウザ自動化に関する本格的なソフトウェアプロジェクトです。JSON-RPCを標準入出力経由で使用するRustベースのMCPサーバーを提供し、AIエージェントがローカルのコンピュータを制御可能にします。ローカルでのOCR処理と、オプションのビジョンモデル統合もサポートしています。

NaomiProject/Naomi

Naomiはオープンソースで常に音声入力を受けつける音声アシスタントプラットフォーム(Python、Linux/Raspberry Pi)であり、家庭用デバイスの制御、情報の照会、シンプルなPythonモジュールによるカスタム「スキル」の追加が可能です。

xorbitsai/xagent

静的なワークフロービルダーを動的なランタイム計画に置き換え、個人、チーム、エンタープライズ向けの複雑で曖昧なナレッジワークを処理するエージェントプラットフォーム。

tidyverts/fable

ARIMAや指数平滑法を含む、tidyverse-consistentな時系列予測モデルのコレクションを提供提供するRパッケージ。

noCaptchaAi/NoCaptcha-Ai-Browser-Extension

APIキーを使用して、バックグラウンドでさまざまなタイプのCAPTCHAを自動検出・解決するブラウザ拡張機能。

polm/cutlet

複数のローマ字表記システムとURLスラッグ生成をサポートする日本語テキストからローマ字への変換ツール。

NeuralEnsemble/PyNN

修正なしで複数のシミュレータやニューロモルフィックハードウェア上で実行できるニューロンネットワークモデルを構築するための、シミュレータ非依存のPython言語。

apple-aiml-research/ml-hierarchical-confusion-matrix

Neo はオープンソースの JavaScript ライブラリ(npm パッケージ `@apple/hierarchical-confusion-matrix`)で、階層的およびマルチアウトプットのクラスラベルに対応するインタラクティブな混同行列可視化を提供します。npm でインストールし、仕様と `{actual, observed, count}` レコードの配列を渡すだけで、任意のウェブページにマトリクスを埋め込めます。平坦、階層的(`:`)、マルチアウトプット(`,`)、および組み合わせラベル構造をサポートし、ライブデモ、ユニットテスト、完全な TypeScript ソースツリーを備えています。

arrayfire/arrayfire

CPU、GPU、その他のハードウェアアクセラレータ across で並列計算を行うための高レベルな抽象化を提供する汎用テンソルライブラリ。

YeeZTech/YeeZ-Privacy-Computing

Fidelius は、Intel SGX に基づくプライバシー計算ミドルウェアであり、元のデータが計算可能でありながら関係者には見えないようにすることで、安全なデータコラボレーションを実現します。

xianyu110/clawbot

Clawdbot は、Claude、GPT、Gemini などの LLM に構成可能な API プロキシエンドポイント経由で接続するオープンソースでローカル実行可能な AI アシスタントです。Web UI とターミナル UI、Telegram/Discord/WhatsApp ボットを提供し、すべてのデータをホストに保存します。README には、インストール手順(Node 22+、npm またはスクリプト)、モデルとチャネル設定用のオンボーディングウィザード、マルチモデルプロキシ用の詳細な JSON 設定、Node バージョン、環境変数の誤用、必須フィールドの欠落といった一般的な落とし穴、およびゲートウェイ、ログ、診断の管理に使用する CLI コマンドの完全なセットが記載されています。

hildensia/bayesian_changepoint_detection

GPU加速を備えたPyTorchベースの時系列データにおけるベイズ変化点検出ライブラリ。オンラインおよびオフライン手法をサポート。

esrrhs/majiang_algorithm

事前計算されたルックアップテーブルを使用して、ミリ秒単位の和了判定と AI による打牌判断を行う、高性能な麻雀アルゴリズムライブラリです。

RobotWebTools/web_video_server

ROSイメージトピックを複数の形式でウェブブラウザにストリーミングするHTTPサーバーで、ロボットのカメラフィードの簡単なリモート監視を可能にします。

L-a-r-t/chatgpt-to-notion

ChatGPT、Claude、Mistralなどの複数のLLMからのプロンプトと応答を、Notionデータベースに直接保存できるブラウザ拡張機能です。

93won/lightweight_vio

リアルタイムの状態推定のための軽量なステレオ視覚慣性オドメトリシステム。

microsoft/Cognitive-Samples-VideoFrameAnalysis

Microsoft Cognitive Services Vision APIを使用して、ウェブカメラの動画フレームをほぼリアルタイムで解析するためのC#ライブラリとサンプルアプリケーション。

apache/singa

Apache SINGAは、複数のマシンにわたって大規模なニューラルネットワークのトレーニングを行える分散型ディープラーニングシステムです。

zhanghang1989/PyTorch-Encoding

画像分類とセマンティックセグメンテーションのための高度なエンコーディングモジュールとモデルズーを提供します。

CCNYRoboticsLab/imu_tools

角速度、加速度、および磁気読み取り値を融合して安定した姿勢推定を行う、ROSベースのIMUフィルタおよびビジュアライザのコレクションです。

ddemidov/vexcl

OpenCL および CUDA 用の C++ ベクトル式テンプレートライブラリで、GPGPU 開発のボイラープレートコードを削減します。

Farama-Foundation/SuperSuit

Gymnasium および PettingZoo 用の強化学習環境の前処理を容易にするマイクロラッパーのコレクションです。

ML-KULeuven/problog

確率的事実と論理プログラムを組み合わせることで、不確実性を扱い、複雑な推論タスクを実行する確率論的論理プログラミングのツールボックスです。

herin7/gitforme

AI ベースのコード探索プラットフォームで、インタラクティブダッシュボードとコードベースに特化した AI チャットアシスタントを通じて、GitHub リポジトリを理解するのを支援します。

joeylitalien/noise2noise-pytorch

Noise2Noise 論文の非公式な PyTorch 実装。ガウス、ポアソン、テキストオーバーレイ、またはモンテカルロレンダリングノイズを使用して、ノイズのみを含むデータで U‑Net ノイズ除去器を学習およびテストするためのスクリプトを提供します。

Datayoo/HuggingFists

広範なコーディングなしで、LLMとHugging Faceモデルを使用してワークフローを視覚的に構築およびスケジュールできるローコードのデータフローツール。

GaoQ1/rasa_nlu_gq

BERTベースの意図分類とBiLSTM+CRFエンティティ抽出を含む、高度な中国語NLP機能をRasa NLUに追加する拡張機能。

Jazee6/cloudflare-ai-web

Cloudflare Workers AIとAI Gatewayを活用して、マルチモデルチャットUIを迅速にデプロイできるWebベースのAIプラットフォームインターフェース。

SaiAkhil066/CORTEX-AI-SUPER-RAG

クラウド依存なしで高精度なドキュメントQ&Aを実現する、9層パイプラインを備えたローカルエージェント型RAGエンジン。GraphRAGとニューラル再ランクを活用。

apple-aiml-research/ml-aim

マルチモーダル理解および画像認識に高パフォーマンスを発揮する大規模自己回帰型ビジョンエンコーダーのファミリーです。

Spr-Aachen/Easy-Voice-Toolkit

Easy Voice Toolkit は、オープンソースの音声モデル(Whisper、GPT-SoVITS)を GUI/Colab ワークフローに統合し、音声のクリーニング、文字起こし、音声変換データセットの構築、カスタム音声モデルのトレーニング、変換音声の生成を行います。すぐに実行できる Windows ポータブルパッケージと Colab ノートブックを提供し、開発者向けのインストールガイドも備えています。このプロジェクトは学術利用のみを目的としており、将来の LLM チャットボット統合と Linux サポートを計画しています。

yzhao062/combo

combo は、機械学習モデルとスコアを統合するための Python ツールボックスです。スタッキング、動的分類器/アンサンブル選択、異常検出器の統合といったアンサンブル技術を統一された API でサポートし、scikit-learn、XGBoost、LightGBM、pyod からのモデルを用いた分類、クラスタリング、異常検出に対応しています。

djcopley/ShellOracle

自然言語の記述からシェルコマンドを生成し、さまざまなLLMプロバイダーを使用してプロンプトに直接挿入するターミナルユーティリティです。

apple-aiml-research/ml-gmpi

2D GANs を Multiplane Images に変換することで、3D 視点合成とメッシュ抽出を可能にする 3D 対応型生成モデル。

hzxie/GaussianCity

GaussianCityは、Gaussian Splattingを使用して無制限の大規模な都市環境を作成する生成型3D都市合成ツールです。

DaoyuanLi2816/mini-verl

モデルロールをフェーズごとにスケジュールすることで、単一の NVIDIA GPU 上で verl RLHF 実験(PPO や GRPO など)を実行できるツール。

daodao97/chatmcp

Model Context Protocol (MCP) と統合されたクロスプラットフォーム AI チャットクライアント。LLM を外部データソースやツールに接続可能。

JingyunLiang/VRT

VRTは、動画スーパーレゾリューション、デブラー、ノイズ除去、フレーム補間、空間時間SRを扱うTransformerベースのモデルであるVideo Restoration TransformerのPyTorch実装です。Temporal Mutual Self-Attentionと並列ワーピングを用いて長距離時間依存性を捉え、9つのベンチマークで最先端のPSNR向上を達成しています。リポジトリには事前学習済み重み、テストスクリプト、Colabデモ、標準動画データセットでの学習手順が含まれています。

lxtGH/OMG-Seg

画像、ビデオ、およびピクセルレベルのセグメンテーションを単一のモデルに統合し、専門家モデルの必要性を減らす、視覚的知覚と推論のための統合フレームワーク。