yuanze-lin/Olympus

コンピュータビジョン向けのユニバーサルタスクルーターで、単一の自然言語指示を、画像、動画、3Dモデルの生成に必要な専門モデルの連続呼び出しに変換します。

Jumpat/SegAnyGAussians

SAGA は、3D ガウシアンスプラッティングシーンをセグメント化するフレームワークで、インタラクティブなポイントプロンプトまたはオープンボキャブラリーテキストクエリを使用して、3D オブジェクトを隔離することができます。

jasmcaus/caer

Caer は Python のみで構成された、GPU 加速のコンピュータビジョンライブラリで、画像/動画ユーティリティ(リサイズ、色空間変換、拡張など)を高速に提供し、クリーンで型チェックされた API を備えています。研究プロトタイプの OpenCV の代替として利用でき、`pip` でインストール可能、MIT ライセンスです。

Pbatch/ClashRoyaleBuildABot

Clash Royale 用の自動化ボットで、教育および研究目的のために高度な状態ジェネレータとオブジェクト検出を使用します。

adipandas/multi-object-tracker

Python ライブラリで、さまざまなマルチオブジェクトトラッキングアルゴリズムと OpenCV ベースのオブジェクト検出器を簡単に利用でき、動画解析に活用できます。

parkpow/deep-license-plate-recognition

Plate Recognizer のナンバープレート認識 API を画像や動画ストリームに統合するためのサンプルクライアントと運用ユーティリティのコレクション。

VisualComputingInstitute/diffusion-e2e-ft

画像条件付き拡散モデルを単一ステップの決定論的推定器にファインチューニングし、迅速かつ正確な深度と表面法線推定を実現するフレームワーク。

shoumikchow/bbox-visualizer

VOC、COCO、YOLO形式をサポートするPythonパッケージで、オブジェクト検出の可視化を簡素化するためのラベル付きバウンディングボックスの描画を可能にします。

hysts/pytorch_mpiigaze_demo

画像や動画内で人がどこを見ているかを追跡するために、学習済みモデルを使用する視線推定のデモプログラムです。

hysts/pytorch_mpiigaze

A PyTorch implementation of gaze estimation methods from the MPIIGaze and MPIIFaceGaze papers for training and evaluation of appearance-based gaze tracking.

luxonis/depthai-ros

Luxonis OAK カメラ用の ROS 統合により、ロボットシステムでハードウェアアクセラレートされた AI と深度認識を利用可能にします。

FluxML/Metalhead.jl

Flux.jl 用の標準的な機械学習ビジョンモデルのライブラリであり、ResNet、ViT、EfficientNet などの人気のあるアーキテクチャの実装を提供します。

Karine-Huang/T2I-CompBench

テキストから画像を生成するモデル(text-to-image generation models)の、複雑な構成要素、属性の結合、および空間的関係を扱う能力に焦点を当てた、包括的なベンチマークおよび評価スイートです。

frgfm/holocron

コンピュータビジョンタスクのための、最新のディープラーニングのテクニックとモデルアーキテクチャの高品質なPyTorch実装ライブラリです。

rapidsai/cucim

cuCIM は、バイオメディカル、ジオスペーシャル、リモートセンシング用途で使用される大規模な多次元画像向けに設計された、GPU 加速のコンピュータビジョンおよび画像処理ライブラリです。

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

パターン化された光で照射された対象物の画像から 3D ポイントクラウドを再構築する構造光スキャンツールで、CPU と GPU の両方でアクセラレーションが可能です。

alicevision/popsift

CUDA で高速化された SIFT アルゴリズムの実装で、リアルタイムの画像特徴抽出が可能です。

rgeirhos/Stylized-ImageNet

Stylized-ImageNet を作成するためのツールです。テクスチャを歪めて ImageNet のバージョンを作り、CNN がテクスチャよりもオブジェクトの形状を優先するように促し、ロバスト性を向上させます。

VSLAM-LAB/VSLAM-LAB

複数のベースラインアルゴリズムとさまざまなデータセットを、インストール、実行、評価のプロセスを簡素化する包括的なフレームワーク。

l3p-cv/lost

柔軟なウェブベースの協働画像アノテーションフレームワークで、半自動パイプラインをサポートし、機械学習データセットのラベリングを高速化します。

genicam/harvesters

GenICam準拠のデバイスに対して統一インターフェースを提供することで、コンピュータビジョンアプリケーションにおける画像取得を簡化化するPythonライブラリです。

basler/pypylon

Basler pylon C++ APIの公式Pythonバインディング。PythonアプリケーションからBaslerマシンビジョンカメラを制御し、画像処理タスクを実行できるようにします。

cyrusbehr/YOLOv8-TensorRT-CPP

TensorRT を使用した C++ 実装の YOLOv8 で、高性能 GPU 推論を実現し、物体検出、セマンティックセグメンテーション、ポーズ推定をサポートします。

jenissimo/unfake.js

AI生成されたピクセルアートをクリーンアップし、ラスタ画像をきれいなスケーラブルなSVGに変換するJavaScriptライブラリおよびブラウザツール。

insight-platform/Savant

Nvidia ハードウェア上でリアルタイムかつ高性能なコンピュータビジョン・ビデオ分析パイプラインを構築するためのハイレベルフレームワークで、DeepStream の複雑さを抽象化します。

luispedro/mahotas

C++ で実装された高速な Python コンピュータビジョンライブラリで、NumPy 配列上で動作する 100 以上の画像処理アルゴリズムを提供します。

opendatacam/opendatacam

オープンソースのコンピュータビジョンツールで、ビデオフィード内の移動物体を検出・追跡・カウントし、実世界の動きを定量化します。主に交通調査で使用されます。

Visionary-Laboratory/visionary

WebGPUを活用し、ONNX Runtimeを使用してブラウザ上でGaussian Splattingのバリエーションと3Dメッシュをリアルタイムでレンダリングするプラットフォーム。

open-edge-platform/geti_v2

Getiは、スマートなデータアノテーションやアクティブラーニングから、モデルのトレーニング、エッジへのデプロイまで、AIライフサイクル全体を合理化するエンドツーエンドのコンピュータビジョンプラットフォームです。

Koldim2001/YOLO-Patch-Based-Inference

YOLO モデル向けにパッチベース推論を可能にし、画像タイル化と結果統合により大きな画像中の小さな物体検出を改善する Python ライブラリです。

zhiqwang/yolort

YOLOv5 用のランタイムスタックで、前処理と後処理をモデルグラフに埋め込むことで、さまざまなハードウェアアクセラレータでの物体検出のデプロイを簡法化します。

VIAME/VIAME

VIAME は、モジュール式で多言語対応のパイプラインフレームワークを通じて、検出、追跡、アノテーション、検索、その他多くの画像/動画処理機能を提供するオープンソースのコンピュータビジョンツールキットです。デスクトップおよびウェブ GUI、コマンドラインツール、プリビルドバイナリ、Docker イメージが付属し、C++、Python、MATLAB のプラグインで拡張できます。

azavea/raster-vision

PyTorch を使用した、衛星・航空・ドローン画像上でコンピュータビジョンモデルを構築するための Python ライブラリおよびローコードフレームワーク。

opengeos/segment-geospatial

Segment Anything Model (SAM) を地理空間データ向けに適応させた Python パッケージで、テキスト、ポイント、またはボックスを使って衛星画像を簡単にセグメントできます。

orbbec/OrbbecSDK

Orbbec 3Dカメラ向けのソフトウェア開発キットで、さまざまな機器シリーズ across でデータストリームを取得し、ハードウェアを制御できるようにします。

layumi/Person_reID_baseline_pytorch

軽量かつ強力なPyTorchベースラインで、オブジェクトおよび人物再識別を実現。クロスカメラオブジェクト検索に向けた包括的なアーキテクチャと損失関数を提供。

google-research/augmix

AugMixは、拡張された画像を混合し、一貫した埋め込みを強制することで、画像分類モデルの堅牢性と不確実性のキャリブレーションを向上させるデータ処理技術です。

spytensor/plants_disease_detection

作物病害を検出するための PyTorch ベースの画像分類パイプラインです。ResNet50 バックボーンと現代的な PyTorch 2.x 最適化を備えています。

openclimatefix/metnet

Google ResearchのMetNetモデルのPyTorch実装。衛星データおよび大気データを用いた短期および全球降水予測に使用。

FORTH-ModelBasedTracker/MocapNET

リアルタイムの2D‑to‑3Dヒューマンポーズ推定器で、RGBビデオフィードを標準BVHモーションキャプチャファイルに変換し、3Dアニメーションに利用できます。

andrewssobral/bgslibrary

コンピュータビジョンにおける背景差分のための包括的な C++ フレームワークで、ビデオストリーム中の動くオブジェクトを検出する 40 以上のアルゴリズムを提供します。

zhanghang1989/ResNeSt

オブジェクト検出やセマンティックセグメンテーションなどのコンピュータビジョンタスクのパフォーマンスを向上させる、ResNetのスプリットアテンションネットワーク変種。

apple-aiml-research/ml-facelit

FaceLitは、さまざまな照明条件下で現実的に再照明可能な高品質な顔画像を生成できるニューラル3Dレンダリングプロジェクトです。

MrGiovanni/SuPreM

3D 医療画像診断における教師あり事前学習のための、事前学習済み 3D モデルスイートと AbdomenAtlas 1.1 データセット。器官・腫瘍セグメンテーションの精度向上を実現。

MrGiovanni/ModelsGenesis

ラベルなしのCTおよびMRIスキャン上で3Dモデルを事前学習する自己教師学習フレームワークで、医療画像セグメンテーションおよび分類の基盤モデルを構築します。

geezacoleman/OpenWeedLocator

緑色検出アルゴリズムを使用してスポット散布をトリガーする、オープンソースでラズベリーパイベースの雑草検出システム。

rafaelpadilla/Object-Detection-Metrics

PASCAL VOCやCOCOなど、人気のある物体検出指標(平均精度やIOUなど)の標準化され、使いやすい実装を提供するツールキット。異なるデータセット間での一貫したベンチマーク評価を保証します。

luxonis/depthai

depthaiライブラリは、Luxonisプラットフォームのソフトウェアフレームワークであり、開発者がLuxonisハードウェア上でAIおよびコンピュータビジョンアプリケーションを開発できるようにします。