StanfordVL/taskonomy

コンピュータビジョンにおけるタスク転移学習の分離を可能にするフレームワークとデータセット。事前学習済みタスクバンクと、タスクの類似性を分析するためのツールを提供。

qaz812345/TrackNetV3

背景推定とインペイントベースの補正モジュールを用いて、オクルージョンに対処するバドミントン動画内のシャトルコック追跡を強化するコンピュータビジョンプロジェクト。

EthanH3514/AL_Yolo

ゲームシーンにおける低遅延スクリーンキャプチャとGPU推論に最適化された、YOLOv5を基盤とするリアルタイム視覚的ターゲット検出・追跡システム。

Breakthrough/DVR-Scan

動画ファイル内の動きイベントを自動検出し、各イベントを個別のクリップとして保存するコマンドラインおよびGUIアプリケーション。

soruly/trace.moe-telegram-bot

trace.moe サービスを使用して、スクリーンショットや動画からアニメタイトル、エピソード、タイムスタンプを識別するTelegramボット。

pupil-labs/pupil

眼動追跡データのキャプチャ、再生、分析のためのソフトウェアインフラを提供するオープンソース眼動追跡プラットフォーム。

ermig1979/Simd

x86、ARM、Hexagonアーキテクチャのすべてでアルゴリズムを高速化するため、SIMD CPU拡張機能を活用した高性能なC/C++画像処理および機械学習ライブラリです。

iago-suarez/ELSED

ELSEDは、ドローンやスマートフォンなどのリソース制限されたデバイス向けに設計された高速線分検出器です。

Faceplugin-ltd/FaceRecognition-Android

Android向けのオンデバイス顔認識およびライブネス検出SDKで、プライバシー保護されたオフラインバイオメトリクスID検証と属性分析を可能にします。

stereolabs/zed-unity

ZED カメラの深度センシング、空間マッピング、オブジェクト検出機能を Unity エンジンに統合し、AR/MR 開発を支援する Unity プラグインです。

deepfates/memery

OpenAIのCLIPを活用し、テキストまたは画像クエリを使用してローカルフォルダ内の特定の画像を検索できる自然言語画像検索ツール。

nachifur/MulimgViewer

大規模な画像データセットの効率的な比較、フィルタリング、結合のために設計されたマルチ画像ビューアで、並列ズームと自動図表生成機能を備えています。

VicenteVivan/geo-clip

GeoCLIPは、画像と地理的な位置を整合させることで、高精度な世界規模の画像ジオロケーションとGPSからベクトルへのembeddingsを実現する、CLIPに触発されたモデルです。

lartpang/PySODEvalToolkit

グレースケールおよびバイナリ画像セグメンテーションモデルを評価するためのPythonツールボックスで、包括的な指標と自動化された曲線プロットを提供します。

OSU-NLP-Group/UGround

UGroundは、テキスト記述に基づいてスクリーンショット内のUI要素を特定するオープンソースの視覚言語モデル(2 B / 7 B / 72 B)です。リポジトリには事前学習済み重み、100万枚以上のGUI接地データセット、4つのベンチマーク用評価スクリプト、Hugging Faceデモが含まれます。推論はvLLMで実行され、シンプルなプロンプトで(x, y)座標を返します。72 BモデルはScreenSpotベンチマークで最先端のスコアを達成し、ICLR 2025の口頭発表論文として採択されています。

juliansteenbakker/mobile_scanner

Android、iOS、macOS、ウェブをサポートする高速で軽量なFlutterプラグイン。デバイスのカメラを使ってリアルタイムでバーコードとQRコードをスキャンでき、カスタマイズ可能なカメラ動作を実現。

bopen/sarsen

Sentinel-1衛星データの幾何学的および放射能的地形補正を提供するクラウドネイティブなPythonライブラリ。

leomariga/pyRANSAC-3D

3D点群に基本的な幾何学的形状を当てはめるためのPython実装。3D再構成やSLAMに有用です。

ouster-lidar/ouster-sdk

Ouster Lidar センサーに接続し、設定し、データを可視化するためのクロスプラットフォーム C++/Python 開発ツールキット。

opencv/opencv_extra

OpenCV コンピュータビジョンライブラリのコア機能を補完するための追加データとリソースのレポジトリです。

Thinklab-SJTU/ThinkMatch

グラフ間のノード対ノード対応を求める深層グラフマッチングアルゴリズムの開発とベンチマークを支援する研究フレームワーク。

liuliu/ccv

顔、物体、テキスト検出のための最先端のアルゴリズムを提供する、ミニマリストでポータブルなCベースのコンピュータビジョンライブラリ。

PaddlePaddle/PaddleClas

高性能なビジョンアプリケーション向けに、超軽量モデルと産業グレードのバックボーンを提供する、包括的な画像認識・分類ツールキット。

SegmentationBLWX/sssegmentation

PyTorch を基盤とした監視付きセマンティックセグメンテーション用のツールボックスで、トレーニングおよびテスト用の統一されたフレームワークと、広範なモデルズーを提供します。

LAION-AI/CLIP_benchmark

ゼロショット分類、検索、キャプション生成、線形プロービングの各タスクにおいて、多様なデータセットでCLIP風モデルのパフォーマンスを測定するための標準化された評価フレームワーク。

facebookresearch/mvdust3r

スパースなRGBビューから、既知のカメラポーズを必要とせずに約2秒で3Dポイントクラウドとカメラポーズを生成する単一ステージの3Dシーン再構成ツール。

zsylvester/segmenteverygrain

地形学および堆積地質学の研究を目的として、ハイブリッドU-NetとSAM 2.1アプローチを用いた画像内の粒の検出とセグメンテーションを行うPythonパッケージ。

phamquiluan/ResidualMaskingNetwork

画像およびライブ動画からの人間の感情を検出するための、Residual Masking Networkを用いた顔認識システム。

NVlabs/nvdiffrecmc

モンテカルロレンダリングとノイズ除去を用いて、複数視点画像から3Dトポロジー、材質、照明を同時に再構築するPyTorch実装。

adalca/neurite

医療画像解析向けのニューラルネットワークツールボックス。空間データ用の専門的なテンソル操作、事前構築されたアーキテクチャ、プロットツールを提供。

scribeocr/scribe.js

画像や PDF から OCR およびテキスト抽出を行うための JavaScript ライブラリです。不可視テキストレイヤーを持つ検索可能な PDF を作成できます。

hysts/anime-face-detector

PyTorch ベースのツールで、事前学習済み Faster R-CNN、YOLOv3、HRNetV2 モデルを使用してアニメ顔を検出し、28 個の顔ランドマークポイントを推定します。

mkalten/reacTIVision

フィデリティマーカーとマルチタッチ指の追跡を可能にし、実体ユーザーインターフェースの作成を支援するクロスプラットフォームのコンピュータビジョンフレームワークです。

roboflow/roboflow-python

Roboflowの公式Pythonパッケージ。開発者がモデル、データセット、プロジェクトとプログラム的にやり取りし、コンピュータビジョンモデルを自動で構築・デプロイできるようにします。

lessthanoptimal/BoofCV

Javaで書かれたリアルタイムコンピュータビジョンライブラリで、低レベルの画像処理、カメラキャリブレーション、特徴追跡のツールを提供します。

githubharald/SimpleHTR

TensorFlow ベースの手書き文字認識システムで、CNN と LSTM レイヤーを使用して単語やテキスト行の画像をデジタルテキストに変換します。

scribeocr/scribeocr

画像からテキストを認識し、高精度な校正を行い、完全にデジタル化されたebookスタイルのドキュメントを作成するブラウザベースのウェブアプリケーション。

visionworkbench/visionworkbench

NASAが開発した、汎用的な画像処理・コンピュータビジョン用のC++ライブラリ。カメラモデル、地図投影、モザイク合成のためのツールを提供します。

openclimatefix/graph_weather

GenCastやAuroraなどのモデルを含む、気象予測とデータ同化のためのさまざまなグラフニューラルネットワークを実装するPyTorchライブラリ。

norlab-ulaval/libpointmatcher

ロボット工学およびコンピュータビジョンにおける3D点群の整列に使用する、Pythonバインディング付きのモジュール式C++ライブラリ。

owensgroup/RXMesh

GPU加速された三角メッシュ処理ライブラリで、幾何処理タスク用に統合された行列インフラストラクチャと自動微分を備えています。

PoseLib/PoseLib

カメラ姿勢推定のための最小ソルバーとロバスト推定器のコレクション。多様な対応関係とカメラモデルをサポートし、依存関係を最小限に抑えています。

PozzettiAndrea/ComfyUI-SAM3

MetaのSAM3用のComfyUI統合で、自然言語のテキストプロンプトを使用してオープンボキャブラリ画像および動画セグメンテーションを実現します。

UCSC-VLAA/OpenVision

マルチモーダル学習向けのオープンソースでコスト効率の良いビジョンエンコーダーのファミリー。理解と生成のタスクにおいて、トレーニング効率と性能を最適化しています。

Seeed-Studio/OSHW-reCamera-Series

エッジAI向けに統合NPUを備えたAI駆動ビジョンモジュール「reCameraシリーズ」のハードウェアドキュメントおよび設計リソースハブ。

CellProfiler/CellProfiler

CellProfilerは、プログラミングやコンピュータビジョンの専門知識がなくても、数千枚の画像から自動的かつ定量的に表現型を測定できるオープンソースのソフトウェアです。

TechyNilesh/DeepImageSearch

マルチモーダル埋め込みとベクトルインデックスを使用したテキスト、画像、ハイブリッド検索をサポートする、AI駆動の画像検索システムを構築するための Python ライブラリ。

MITK/MITK

ITK と VTK を組み合わせることで、インタラクティブな医療画像処理ソフトウェアを開発するためのオープンソースC++ツールキット。