ARM-software/armnn

Arm Cortex-A CPU および Arm Mali GPU 上で TensorFlow Lite および ONNX モデルを高速化する高性能 ML 推論エンジンです。

stotko/stdgpu

GPU向けの軽量C++17ライブラリで、カスタムカーネルでの柔軟かつ信頼性の高いデータ管理を可能にする、STL風の汎用データ構造を提供します。

HarborYuan/ovsam

数千の物体クラスの同時インタラクティブセグメンテーションとオープンボリューム認識を可能にする、Segment Anything Model (SAM) のオープンボリューム拡張版。

google/jax-cfd

JAX‑CFDは、微分可能なCFDのためのJAXベースの研究用ライブラリです。有限体積法および擬似スペクトル法ソルバー、オプションのML拡張モデル、およびデータユーティリティを提供し、ML拡張流体シミュレーションの研究における勾配ベースの実験を可能にします。pipでインストール可能で、Colabデモが付属しており、現在は非推奨(メンテナンス終了)となり、新しい代替案が推奨されています。

hzxie/CityDreamer

CityDreamerは、レイアウト生成器、背景要素生成器、建物インスタンス生成器を組み合わせることで、無制限かつ写実的な3D都市景観を生成する研究用PyTorchフレームワークです。大規模なOSM/GoogleEarthデータセットでのトレーニングコード、事前学習済みチェックポイント、Webデモ、および動画レンダリング用CLIを含んでいます。

cvg/DeepLSD

DeepLSDは、深層学習と画像勾配を組み合わせて、現実世界の画像から線分を抽出・精緻化する高精度な線分検出器です。

mlwithme/BertWithPretrained

BERTのPyTorch実装で、ユーザーがモデルをスクラッチから構築し、分類、QA、NERなどのさまざまなNLPタスクに適用できるようにします。

VCIP-RGBD/DFormer

DFormerは、RGB‑Dセマンティックセグメンテーションの研究用コードベースで、DFormer、DFormerv2(ジオメトリーガイド付きアテンション)およびDFormer++(効率的で高精度なバリエーション)を実装しています。事前学習スクリプト、データセットヘルパー、学習/評価パイプライン、およびNYU‑Depth v2およびSUN‑RGBD用の事前学習済み重みを含みます。このリポジトリは本格的なAI/MLプロジェクトです。

baxtree/subaligner

Subaligner は、字幕と動画/音声を同期するオープンソースの Python/CLI ツールです。Whisper を用いた音声認識、HuggingFace モデルによる字幕翻訳、カスタム同期モデルの訓練も可能。多数の字幕およびメディアフォーマットをサポートし、高速なグローバルシフト(`single`)と高精度の二段階(`dual`)同期を提供。Docker、pip、およびLLMベースの機能用オプション拡張も利用可能。

ria-com/nomeroff-net

YOLOv8とRNNベースのOCRを使用して、複数国にわたるナンバープレートの検出と読み取りを行うオープンソースのPythonフレームワークです。

hplt-project/sacremoses

NLPデータセットのためのトークン化、デトークン化、正規化、およびtruecasingツールを提供するテキスト前処理ライブラリ。

NVIDIA/cuQuantum

NVIDIAが開発した高性能SDKで、状態ベクトルおよびテンソルネットワーク計算向けの専用ライブラリを提供し、量子科学のシミュレーションを加速します。

microsoft/TransformerCompression

直交変換を使用して重要度の低い重み行列のコンポーネントをスライスして取り除くことで、Transformerネットワークをより小さく、より高速にする学習後の圧縮ツール。

chi2liu/ABC-GRPO

4つの独立したクリッピング境界を用いる非対称的かつ適応的なGRPO強化学習アルゴリズムの改良版で、LLMの推論タスクにおけるエントロピーの崩壊を防ぎ、一般化性能を向上させます。

femto/minion-agent

複数のエージェントバックエンドでブラウザ自動化、コード実行、MCPツールサポートを統合する強力なエージェントフレームワーク。

Softlandia-Ltd/vision-is-all-you-need

VLMを用いてPDFページを画像として埋め込むことで、ドキュメント検索時のテキストチャンク化の必要性を排除するビジュアルRAG(V-RAG)デモ。

yzhao062/SUOD

異種モデルのアンサンブルに対する学習と予測を最適化する大規模な教師なし異常検出の加速フレームワークです。

NVIDIA/logits-processor-zoo

LLMの出力挙動を制御できるログティスプロセッサのコレクション。特定のフレーズの強制、応答長の管理、幻覚の軽減などに対応。

aniketkarne/ClaudeNightsWatch

Claude CLI向けの自律型タスク実行システムで、利用ウィンドウを監視し、Markdownファイルから定義済みタスクを自動的に実行します。

marciopuga/cog

AIエージェント間で文脈や永続的知識を共有するための中央集権的でプレーンテキストの記憶層。マークダウンファイルを使用して、さまざまなツールやプロジェクト間で知識を共有します。

Azure-Samples/ai-rag-chat-evaluator

GPTベースおよびコードベースの指標を使用して、生成された回答を正解データと比較することで、RAGチャットアプリケーションを評価するためのツールキット。

wangle201210/go-rag

ドキュメントやWebページからナレッジベースを作成できるGoベースのRAGシステムで、マルチパスリコールと管理用GUIを備えています。

Kabanosk/whisper-website

OpenAIのWhisperを使用して、ローカルでオーディオをテキストやさまざまな形式の字幕に変換する自己ホスト型Webアプリケーションです。

py-why/pywhyllm

因果分析プロセスに大規模言語モデル(LLM)を統合し、交絡因子、因果関係、および検証戦略を提案するライブラリ。

jdtoscano94/NABLA-SciML

複雑な物理システムの研究に PINNs、DeepONets、および KANs の実装を提供する、科学機械学習 (SciML) のための統一フレームワーク。

openaiotlab/CUHK-X

人間の行動認識と推論のための大規模マルチモーダルデータセットとベンチマーク。7つの同期されたセンサモダリティを統合し、複雑な行動理解を可能にする。

apple-aiml-research/ml-diffucoder

DiffuCoderは、コード生成用のマスク拡散モデルであり、Coupled-GRPOを導入してポストトレーニングの効率とすべてのトークンの学習信号を改善します。

apple-aiml-research/ml-mdm

マトリョーシカ拡散モデルのためのエンドツーエンドフレームワークで、最大1024x1024ピクセルの高解像度テキストから画像への合成モデルの効率的なトレーニングを可能にします。

BenyRonald77/uajy-academic-rag-chatbot

Google GeminiとFAISSを活用したRAGベースのチャットボット。公式のUAJY学術ハンドブックに基づき、学術的な質問に対して幻覚のない回答を提供する。

aws/sagemaker-training-toolkit

カスタム Docker コンテナを Amazon SageMaker と互換性を持たせるライブラリで、隔離された環境での機械学習モデルのトレーニングプロセスを簡素化します。

TheDesignFounder/DreamLayer-Eval

画像および動画拡散モデルのためのオープンソースのベンチマークプラットフォーム。プロンプトスイープ、メトリクス計算、再現可能な実行ログの自動化を実現。

jonathan-laurent/AlphaZero.jl

標準的なデスクトップハードウェアでの自己対戦を使用して組合せゲーム用のAIエージェントをトレーニングできる、AlphaZeroアルゴリズムの高速で汎用的なJulia実装。

cha0upup/LeoAI

LeoAIは、Webダッシュボード、リモートホスト制御のためのJava/PHP Puppetランタイム、およびLangChain4j駆動のLLMエージェントを組み合わせた、オープンソースのAI強化型レッドチームプラットフォームです。ポストエクスプロイト(攻撃後)タスクの自動化、レポート生成、およびチーム管理を、JARまたはDocker経由で展開可能です。

OpenBMB/DeepThinkVLA

DeepThinkVLAは、ロボットの行動を生成する前に明示的な連鎖的思考(CoT)の推論ステップを挿入する視覚言語行動モデルです。自己回帰的推論 → 並列行動生成というハイブリッドデコーダーを採用し、新たに作成されたエムベデッドCoTデータセットで訓練した後、成果志向の強化学習で最適化します。このモデルはLIBEROベンチマークで平均97 %の成功確率を達成し、純粋な自己回帰ベースラインの0.175×の遅延で動作し、新しいLIBERO Plusスイートへのゼロショット転移も可能になっています。

aidatatools/ollama-benchmark

Ollamaを介して実行されるローカルLLMのトークン/秒スループットを、ユーザーの利用可能なシステムRAMに基づいて測定するクロスプラットフォームCLIツール。

teticio/audio-diffusion

拡散モデルをメルスペクトログラムに適用することで、音楽とオーディオループを合成するためのフレームワークです。潜在拡散(latent diffusion)と条件付き生成をサポートしています。

guidone/node-red-contrib-chatbot

Node-REDライブラリであり、Telegram、Facebook Messenger、WhatsApp、Viber、Slack向けのチャットボットを、最小限のコーディングで視覚的に構築・デプロイできます。

ReinerBRO/grok-register

一時メールとブラウザパッチを使用してCloudflare Turnstileを回避する、Grok (x.ai) の自動アカウント登録ツール。

khaled-alshamaa/ar-php

プロフェッショナルなアラビア語処理のためのオープンソース PHP ライブラリ。感情分析、スペルチェック、ヒジャリ暦の管理を提供。

Xueyang-Song/paper-pilot

Paper Pilot は、8つ以上の学術データベースをクロールし、PDFをダウンロード、SQLite + FTS5 + ベクトル検索でインデックス化し、ローカルまたはホストされたLLMに根拠に基づいた回答を要求できるデスクトップ(Electron + React)研究アシスタントです。すべてのデータはあなたのマシン上に留まります。アプリは監査可能な出典トレースと、文献レビューの再現可能なワークフローを提供します。

melody0709/zencrop

任意のアプリケーションからインタラクティブなサブウィンドウを切り取り・ピン留めできる、スタンドアロンの Windows ユーティリティ。高度な OCR、翻訳、スクリーンショットツールを備えています。

honojs/cli

ドキュメント検索、サーバー管理、バンドル最適化を統合した、Hono開発者とAIエージェント向けのコマンドラインインターフェース。

fengbingchun/NN_Test

YOLO や Ollama などの現代的な AI フレームワークを含む、ディープラーニングの基礎、機械学習アルゴリズム、C++ および Python 実装の包括的なコレクション。

NVIDIA/nvtrust

NVIDIA Trusted Computingおよび機密コンピューティング環境における証明の実装および検証に使用するツールおよびSDKのコレクションです。

Deep-ai-inc/ch.at

ch.atは、HTTP、SSH、DNS、またはAPI経由でLLM(デフォルトはGPT-4o)とチャットできるシングルバイナリのGoサーバーです。JavaScriptやアカウントは不要で、すべての状態はRAM内に保持されます。プライバシー重視でセルフホストが容易であり、同じ軽量プロトコルを使用してメッセージを投稿するためのパブリック掲示板も含まれています。

breezewish/CodexPotter

指定された目標にコードベースを反復的に一致させるために、新規コンテキストとファイルシステムメモリを使用する、再整合ベースのコーディングエージェント。

realopslabs/kubeledger

CPU、メモリ、GPU リソースを追跡する Kubernetes 使用量会計ツールで、隠れたシステムオーバーヘッドを明らかにし、ネームスペース単位での正確なコスト配分を可能にする。

google-ar/arcore-unity-extensions

UnityのAR Foundationに対して、Google ARCoreの拡張現実(AR)機能へのネイティブAPIアクセスを提供する拡張機能セットです。