MITK/MITK

ITK と VTK を組み合わせることで、インタラクティブな医療画像処理ソフトウェアを開発するためのオープンソースC++ツールキット。

NeoGeographyToolkit/StereoPipeline

NASAが開発した、ステレオ画像を3D地形モデルおよび地図製図製品に変換するためのオープンソース自動化ジオデシィおよびステレオグラメトリツールのセット。

savvasdalkitsis/uhuruphotos-android

オープンソースの Android メディアギャラリーで、Google フォトの代替としてプライバシーに配慮した選択肢を提供。LibrePhotos サーバーとのオプション統合により、AI駆動の検索と顔認識を実現。

soruly/trace.moe

画像ベクトル検索を使用して、スクリーンショットの特定のアニメ、エピソード、タイムスタンプを識別するアニメシーン検索エンジン。

gowvp/owl

GB28181、ONVIF、RTSP ストリームを統合するオープンソースのネットワークビデオプラットフォーム。AIアラート機能付きのブラウザベースの管理システムを提供。

flatironinstitute/CaImAn

大規模なカルシウムおよび電位イメージングデータの解析に向けたスケーラブルな Python ツールボックス。モーション補正、ソース抽出、スパイクデコンボリューションのためのスケーラブルなアルゴリズムを提供。

ros-perception/image_pipeline

ロボティクスのビジョン処理の上位レベルで使用可能な形式にRawカメラ画像を処理するROS 2パッケージです。

nguyenq/tess4j

Tess4Jは、Tesseract OCR API用のJava JNAラッパーであり、さまざまな画像形式およびPDFドキュメントからテキストを抽出できるようにします。

aws-samples/amazon-textract-textractor

ドキュメントからテキスト、テーブル、フォーム、身分証明書データを抽出するためのAmazon Textractを簡素化するPythonパッケージ。

yo-WASSUP/Good-GYM

RTMPose を使用したリアルタイム姿勢検出と、ウェブカメラによる自動エクササイズ回数カウントを実現する AI フィットネスアシスタント。

TissueImageAnalytics/tiatoolbox

PyTorchに基づく計算病理学用ツールボックスで、データ読み込みから可視化までをエンドツーエンドAPIで提供する。

LSH9832/edgeyolo

EdgeYOLO はアンカーフリーのオブジェクト検出器で、Nvidia Jetson などの組み込みエッジデバイス向けにリアルタイム性能を最適化し、TensorRT や RKNN など複数のデプロイ形式をサポートします。

deltacv/VisionGraph

ライブパイプラインプレビュー付きのOpenCVアルゴリズムの作成とプロトタイピングに向けた視覚的ノードエディタ。

apple-aiml-research/ml-fastvit

構造的再パラメータ化を活用した高速ハイブリッドビジョントランスフォーマーで、モバイルデバイス上で低遅延の画像分類を実現します。

shaoshengsong/DeepSORT

YOLO と ONNX Runtime を使用して、ByteTrack、OC-SORT、Deep OC-SORT、DeepSORT を実装した C++ によるリアルタイム多対象追跡システム。

apple-aiml-research/ml-mobileone

MobileOne は、iPhone 12 Pro 上で 2 ms 未満の遅延で 71–79% の ImageNet Top-1 精度を達成する 5 種類の超高速 CNN バックボーン(S0–S4)の PyTorch 実装を提供します。リポジトリには、学習用および推論用のチェックポイント、デバイス内デプロイ用の CoreML モデル、および iOS ベンチマークアプリ(ModelBench)が含まれています。再パラメータ化により、学習時のブランチが推論時に1つの高速ネットワークに統合されます。

apple-aiml-research/ml-matrix3d

Matrix3Dは、単一または少数の未撮影画像から3D再構成を可能にする、ポーズ推定、深度予測、新視点合成を統合したポトグラメトリーモデルです。

cvignac/DiGress

Graph Transformerアーキテクチャを用いた離散ノイズ除去拡散モデルで、合成グラフおよび分子構造を生成する。

EasyLive2D/relive2d

Live2DネイティブSDK用のPythonラッパーで、Webエンジンを必要とせずにOpenGLを直接使用してLive2Dモデルを読み込み、レンダリング可能。

HZAI-ZJNU/Mamba-YOLO

Mamba YOLOは、従来のアーキテクチャの代わりに状態空間モデル(SSMs)を採用することで、リアルタイム検出に向けた効率的な代替手段を提供するオブジェクト検出のベースラインです。

fieldtrip/fieldtrip

MEG、EEG、iEEG データの高度な解析をサポートする MATLAB ツールボックス。複数のハードウェア形式とソース再構成を対応しています。

sgoldenlab/simba

SimBAは、プログラミングスキルが不要なGUIベースのツールキットで、姿勢推定動画データから動物の行動を自動検出・定量する教師あり機械学習分類器を研究者が訓練できるようにします。原始的な追跡データを検証済みの行動分類と豊富な後続分析に変換し、行動神経科学の研究を支援します。

ecmwf-lab/ai-models

AIベースの気象予測モデルを実行するためのコマンドラインツールで、データ取得とモデル実行のための統合インターフェースを提供します。

isl-org/Open3D-ML

Open3D の拡張であり、セマンティックセグメンテーションやオブジェクト検出などの 3D マシンラーニングタスクに向けたツール、事前学習済みモデル、パイプラインを提供します。

ANTsX/ANTs

高次元医療画像の登録とセグメンテーションに特化したC++ライブラリ。種や臓器系をまたいで脳の構造と機能を分析するのに使用される。

MiniAiLive/Android-FaceRecognition

セキュリティおよびフィンテックアプリケーションにおけるスプーフィング防止のための、顔認識および3Dパッシブ生体検証対応Android SDK。

supervisely/supervisely

Superviselyは、データラベリング、モデルトレーニング、推論、およびコラボレーションツールを組み合わせたウェブベースのコンピュータビジョンプラットフォームです。自動化のためのPython SDKとREST API、そして開発者がヘッドレススクリプト、インタラクティブなUIツール、またはラベリングツールの拡張機能を作成し、すべてをワンクリックでデプロイできるアプリエコシステムを提供します。

PozzettiAndrea/ComfyUI-DepthAnythingV3

Depth Anything V3 を統合したカスタム ComfyUI ノードで、高品質な深度推定、3D ポイントクラウド再構成、一貫した動画深度マッピングを実現します。

sh4den/Montscan

Ollama を介してローカル Vision AI を使用してスキャンした PDF を分析し、説明的なファイル名で自動的に名前を変更する自動化されたドキュメントプロセッサー。

cosanlab/py-feat

画像および動画から顔を検出し、感情表現、顔面筋の動き、ランドマークを抽出するためのPythonツールボックス。

Zyphra/zuna

ZUNA1.1 は、3D頭皮座標を用いてEEGのノイズ除去、欠落チャネルの再構成、および疎な電極配置のアップサンプリングを行うオープンソースの基盤モデルです。

Pixel-Talk/PEAR

PEARは、画像や動画から100 FPSで表現力豊かな3D人体メッシュのパラメータを予測できるリアルタイムフレームワークです。

scu-zjz/IMDLBenCo

画像改ざん検出および局所化のための包括的でモジュール化されたコードベースとベンチマークを提供し、標準化されたコンポーネントと最先端モデルの実装を備えています。

Mengqi-Lei/count-anything

Count Anything は、自然言語クエリに基づいて画像内のオブジェクトをカウントする研究用モデルである。スパース領域カウンターと密なピクセルカウンターを組み合わせ、パラメータフリーな統合ステップで結果を融合することで、6つのドメイン(シーン、衛星、医療など)で動作する。リポジトリには事前学習済みチェックポイント、トレーニング/評価スクリプト、および大規模な CLOC データセットの準備手順が含まれている。

Intellindust-AI-Lab/EdgeCrafter

EdgeCrafterは、エッジデバイス向けに最適化されたコンパクトなVision Transformer (ViT)を提供し、低遅延で高パフォーマンスなオブジェクト検出、インスタンスセグメンテーション、ポーズ推定を実現します。

ultralytics/xview-yolov3

リモートセンシング用途向けに、xView衛星画像データセット上でオブジェクト検出を訓練・実行するための専用実装されたYOLOv3。

mlmed/torchxrayvision

胸部X線データセットとモデルのためのライブラリで、事前学習済みモデルと統一インターフェースを提供し、複数の公開胸部X線データセットでの作業を容易にします。

tschnz/Live-Video-Magnification

Eulerian video magnification 技術を用いて、微細な動きや色の変化をリアルタイムで強調する動画拡大ツール。

lightly-ai/lightly-studio

エムベッディングを使用して、画像および動画データを効率的に管理・ラベル付けできるローカルファーストのデータキュレーションおよびラベル付けツール。

dog-qiuqiu/FastestDet

ARM CPU と組み込みデバイス向けに高速推論を最適化した、超軽量でアンカーフリーなリアルタイム物体検出アルゴリズム。

open-edge-platform/dlstreamer

Intel CPU、GPU、NPU上でハードウェアアクセラレーテッドな動画および音声インテリジェンスパイプラインを実現する、GStreamerとOpenVINOに基づくメディア分析フレームワークです。

xrdevrob/QuestCameraKit

Meta Quest 3/3S 向けの Unity サンプルのコレクションで、物体検出、QR コード追跡、マルチモーダル AI を用いた周囲環境の理解を可能にする混在現実体験を実現します。

torch-points3d/torch-points3d

3D分類、セグメンテーション、検出のための最先端モデルと高レベルAPIを提供する、点群分析向けの深層学習フレームワーク。

BGU-CS-VIL/WTConv

CUDA、Metal、Triton 用に最適化されたバックエンドを備えた、CNN に大きな受容 field を提供するウェーブレット畳み込みを実装するライブラリ。

reall3d-com/Reall3dViewer

Three.jsベースのWebレンダラーで、大規模な3Dガウシアンスプラッティングシーンを高パフォーマンスでストリーミング表示可能にし、適応的LODを実現します。

cre185/InstantSfM

2D画像から3D構造を再構成するプロセスを加速するGPUネイティブな構造から運動(SfM)パイプラインで、3Dガウススプラッティングの統合サポートも提供しています。

ilastik/ilastik

細胞やその他の実験画像データのセグメンテーション、分類、トラッキング、カウントを行うためのインタラクティブな機械学習ツールキット。

Ma-Zhuang/OmniNWM

OmniNWMは、自律走行シミュレーション用のパノラマ型マルチモーダルワールドモデルを構築する研究用コードベースです。車両の軌道からRGB、セマンティック、深度、3次元占有グリッドを一括生成し、正規化Plückerレイマップで正確な制御を実現。占有に基づく密な報酬によりクローズドループポリシー評価が可能。リポジトリには、transformersの手動パッチを含むインストール手順、nuScenes用データ準備手順、事前学習済みチェックポイントのダウンロードリンク、推論・分布外テスト・段階的学習用スクリプトが含まれます。