qubvel-org/segmentation_models.pytorch

12種類のアーキテクチャと800以上の事前学習済みエンコーダーを提供する、画像セマンティックセグメンテーションの高レベル API を提供する PyTorch ライブラリです。

10x-Engineers/Infinite-ISP

RAWセンサ画像をRGBに変換するための、Pythonベースのアルゴリズム設計からRTLおよびFPGA実装までをカバーするフルスタックISP開発プラットフォーム。

scier/MetalSplatter

iOS、macOS、visionOS でリアルタイムの 3D シーン可視化を可能にする、Swift/Metal ベースのライブラリ。

google-ar/arcore-android-sdk

ARCore SDK for Android は、モーショントラッキング、環境理解、および照明推定のためのAPIを提供し、拡張現実体験の構築を可能にします。

Smorodov/Multitarget-tracker

SOTAのディープラーニング検出器、マッチングアルゴリズム、およびKalman filtersを組み合わせ、ビデオ内の複数のオブジェクトを追跡する包括的なマルチターゲット・トラッキング・フレームワークです。

VisionDepth/VisionDepth3D

VisionDepth 3D は、AI 深度モデル、深度マップのブレンド、RIFE フレーム補間、AI 超解像度を使用して、2D 画像または動画を立体 3D に変換する Windows デスクトップアプリです。無料ティア(長さ制限あり、1080p、透かし入り)と、59.99ドルの買い切り Pro ティア(制限なし、4K+、バッチ処理、高度なコントロール)を提供しています。インストールは、CUDA (NVIDIA) または DirectML (AMD/Intel) ビルドを提供する Itch.io の「Setup Hub」を経由して行います。ソフトウェアはプロプライエタリですが、ダウンロードされる AI モデルはそれぞれのライセンスの下でオープンソースとして提供されています。

SimpleITK/SimpleITK

画像セグメンテーションおよびレジストレーションのための、インサイト・セグメンテーション・アンド・レジストレーション・ツールキット(ITK)への簡素化されたインターフェースを提供する画像解析ツールキット。

rdk/p2rank

タンパク質構造からリガンド結合部位を高速かつ正確に予測するための機械学習ベースのコマンドラインツール。

illuin-tech/colpali

ColPali は視覚ドキュメント検索用の研究用ライブラリです。PaliGemma、Qwen‑VL などのビジョン・ランゲージモデル(VLM)を用いてドキュメント画像をマルチベクトルエンベッディングに変換し、ColBERTスタイルのラテ・インタラクション法でクエリエンベッディングとスコアリングします。元の `colpali-engine` パッケージ(現在非推奨)は、モデルクラス、プロセッサ、オプションの融合カーネル、高速Plaidインデックス、トークンプール、解釈性ツールを提供していました。新しいプロジェクトは、Sentence‑Transformers v6 の `MultiVectorEncoder` を使用すべきです。

zju3dv/MatchAnything

MatchAnythingは、RGB、赤外線、スケッチなど、あらゆる視覚モダリティの画像間の対応関係を検出できる単一のニューラルネットワークを学習する研究プロジェクトです。事前学習済み重みはHugging Faceにホストされており、オンラインデモで即座にクロスモダリティマッチングを試すことができます。このアプローチにより、ロボット工学、リモートセンシング、医療画像、ARなどに役立つ、一つの汎用モデルで多くの専用マッチングパイプラインを置き換えることが可能になります。

weecology/DeepForest

ディープラーニングによるオブジェクト検出を用いて、空中RGB画像における木の冠や鳥などの生態的対象物の学習および予測を行うPythonパッケージ。

nianticlabs/map-free-reloc

A reference implementation for map-free visual relocalization that enables metric pose estimation relative to a single image, removing the need for large 3D maps.

alephpi/Texo

数学の数式画像をLaTeXコードに変換する、パラメータ数わずか20MのミニマリストなオープンソースLaTeX OCRモデル。

xg-chu/GAGAvatar

GAGAvatarは、3Dガウススプラッティングを用いて1枚の画像から3Dヘッドアバターを再構成し、リアルタイムで再現するためのフレームワークです。

mgonzs13/yolo_ros

ロボット向けに物体検出、追跡、インスタンスセグメンテーション、および3D物体位置推定を可能にする、Ultralytics YOLOモデル用のROS 2ラッパーです。

microsoft/farmvibes-ai

農業および持続可能性向けのマルチモーダル地理空間機械学習フレームワーク。衛星画像、気象データ、標高マップを統合して、堅牢な農業インサイトを生成します。

z1069614715/objectdetection_script

YOLOおよびRT-DETRアーキテクチャの改良、圧縮、およびマルチモーダル対応を特徴とする、物体検出モデルの改善と圧縮のための包括的なツールキット。

ucam-eo/geotessera

Tessera Earth基盤モデルからの地理空間埋め込みを読み取り、エクスポート、可視化するためのPythonライブラリで、クラウドネイティブなストリーミングとローカルタイルダウンロードの両方をサポートします。

opencap-org/opencap-core

複数のスマートフォン動画から3次元人体運動の運動学およびマーカー位置を推定するパイプラインで、出力はOpenSim形式です。

openmv/openmv

Python3で実装できるオープンソースの機械視覚プラットフォーム。マイコン上でAIと画像処理を初心者でも簡単に実現可能。

DanBloomberg/leptonica

Tesseract や OpenCV などのプロジェクトで使用されている、ドキュメントおよび自然画像の操作を処理する包括的な ANSI C 画像処理・分析ライブラリ。

nipreps/mriqc

構造的、機能的、拡散MRIデータから参照なし画像品質指標を抽出するオープンソースツールで、自動品質評価を実現します。

luxonis/oak-examples

Luxonis OAKデバイス向けのデモおよびチュートリアルのコレクション。DepthAIを使用してAIビジョン、深度測定、ニューラルネットワークの実装を紹介しています。

ANTsX/ANTsPy

ANTs C++フレームワーク用のPythonラッパーで、バイオメディカル画像の登録、セグメンテーション、処理に高パフォーマンスなツールを提供します。

sstary/SSRS

リモートセンシング画像のセマンティックセグメンテーション向けのPyTorchモデルコレクション。単一モーダル、マルチモーダル融合、教師なしドメイン適応技術を備えています。

jianboqi/CSF

空中点群における地面点と非地面点を分離するための、布のシミュレーションに基づくLiDARフィルタリング手法。

sentinel-hub/eo-learn

地球観測データと機械学習エコシステムを橋渡しするPythonライブラリ。時空間衛星画像から情報を抽出するプロセスを簡素化する。

zibo-chen/ocr-rs

PaddleOCRモデルとMNN推論ランタイムに基づく軽量なRust OCRライブラリ。50以上の言語でテキスト検出と認識を提供。

apple-aiml-research/ml-cvnets

分類、検出、セグメンテーションなどのタスクのために、標準的および新規のモバイルおよび非モバイルモデルを訓練・評価するためのコンピュータビジョンツールキット。

vietanhdev/samexporter

ONNX Runtime で SAM, SAM 2, SAM 3, MobileSAM, EfficientSAM モデルをエクスポートして実行し、ポータブルで効率的なデプロイメントを実現するツール。

NativeSensors/EyeGestures

高価な専用ハードウェアではなく、標準のWebカメラやスマートフォンカメラを使用して、眼制御インターフェースを実装できるオープンソースの眼追跡ライブラリ。

Jianghanxiao/PhysTwin

PhysTwin は、RGB-Dビデオから変形可能オブジェクトの物理情報に基づくデジタルツインを再構成、インタラクティブなシミュレーション、分析ツール、およびロボットのプランニングやバッチシミュレーションのためのサンプル・パイプラインを提供します。

facebookresearch/pytorch3d

3Dコンピュータビジョンの研究向けPyTorchベースのライブラリで、微分可能なレンダリングと3Dメッシュおよびポイントクラウドを操作するための効率的なツールを提供します。

Yuliang-Liu/MultimodalOCR

複数の言語と現実世界のシナリオにおいて、Large Multimodal ModelsのOCRおよびドキュメント解析能力を評価するためのベンチマーク(MDPBench、OCRBench v2、OCRBench)のコレクションです。

yehonathanlitman/Lift4D

Lift4D は、各フレームの3D推定を変形可能なモデルに統合することで、単一視点の「リアル世界」動画から時間的に一貫した4Dアセットを再構成します。

NVIDIA-RTX/RTXNS

機械学習をグラフィックスアプリケーションに統合するための開発者フレームワークで、ニューラルネットワークをシェーダーやテクスチャとして表現することを可能にします。

ultralytics/yolo-flutter-app

iOSおよびAndroidでリアルタイムのYOLOモデル推論(オブジェクト検出、セグメンテーション、ポーズ推定)を可能にする公式Ultralyticsプラグイン。

agentmorris/MegaDetector

カメラトラップ画像内の動物、人間、車両を識別するAIモデル。保護生物学者が空白画像を効率的に削除するのを支援する。

alexandremendoncaalvaro/CorridorKey-Runtime

DaVinci Resolve と Foundry Nuke 用のネイティブ AI キーイングランタイムと OFX プラグインで、ビデオエディター向けに自動化された機械学習加速の背景除去を提供します。

torchgeo/terratorch

PyTorch ベースのドメインライブラリで、画像セグメンテーションや分類などのタスク向けに、事前学習済みのジオスペーシャル基盤モデルを微調整・利用できます。

kornia/kornia-rs

Rust で記述された低レベルなコンピュータビジョンライブラリで、リアルタイム ML パイプライン向けに CPU と NVIDIA GPU 上で高速かつゼロコピーの画像処理を提供します。

raphaelvallat/yasa

Pythonベースの睡眠分析ツールボックスで、多導睡眠図およびEEGデータにおける自動睡眠ステージングとイベント検出を実現します。

MrGiovanni/UNetPlusPlus

ネットワークの深さを柔軟に調整できるように再設計されたスキップ接続を備えた、医療画像セグメンテーション向けのネストU-Netアーキテクチャ。

allenai/olmoearth_pretrain

地球観測用のマルチモーダル時空基盤モデルファミリー、衛星データを利用して惑星インテリジェンスのためのスケーラブルなフレームワークを提供します。

ultralytics/yolo-ios-app

Core MLとApple Neural Engineを使用して、iOSデバイス上でリアルタイム、オンデバイスのYOLO推論を可能にするネイティブiOSアプリとSwift SDK。オブジェクト検出、セグメンテーション、ポーズ推定を実現。

next-state/open-dreamer

Open Dreamer は JAX/Flax による Dreamer 4 世界モデルパイプラインの実装で、Minecraft プレイ動画データ上で動画トークナイザーとアクション条件付き潜在動力学モデルのトレーニングコードを提供し、ロールアウト生成と FVD 評価のツールも含む。ライブブラウザデモと、トレーニング済みチェックポイントを実行するための別途推論リポジトリも提供している。

noahcao/OC_SORT

純粋なモーションモデルベースのマルチオブジェクトトラッカーで、SORT アルゴリズムを再考することで、混雑したシーンや非線形運動におけるロバスト性を向上させます。

zju3dv/manhattan_sdf

Manhattan‑SDFは、CVPR‑2022の研究コードで、屋内3‑D再構成のためのニューラル符号付き距離関数(SDF)を学習し、幾何学的品質を向上させるためにマンハッタン・ワールド(軸に沿った)正則化を追加しています。condaベースのインストール、ScanNet(またはカスタムデータ)でのトレーニングスクリプト、メッシュ抽出、多数のベースラインとの評価を提供しています。