MCG-NJU/MOTIP

MOTIPは、トラッキングをコンテキスト内ID予測問題として扱い、現在の検出に対してIDラベルを直接デコードするマルチオブジェクトトラッキングフレームワークです。

xiaobiaodu/Mobile-GS

Mobile-GSは、モバイルデバイス上で高品質な3Dシーンレンダリングを可能にするリアルタイムガウシアンスプラッティングフレームワークです。

allenai/olmoearth_pretrain

地球観測用のマルチモーダル時空基盤モデルファミリー、衛星データを利用して惑星インテリジェンスのためのスケーラブルなフレームワークを提供します。

Tsinghua-MARS-Lab/SLAM-Former

画像シーケンスからの3D再構成とカメラトラッキングのため、ローカライゼーションとマッピングを1つのモデルに統合するTransformerベースのSLAMシステム。

alicevision/CCTag

同心円で構成される円形フィデューシャルマーカーの検出と正確な位置特定のためのコンピュータビジョンライブラリ。

81NewArk/AntiCAP-WebApi

モデル推論を使用した CAPTCHA 解決用のウェブ API サービス。ローカルおよびパブリックネットワークでのデプロイをサポート。

bhky/opennsfw2

画像や動画内のポルノコンテンツを検出するための、Yahoo Open-NSFW モデルの Keras 実装です。

RenderKit/oidn

モンテカルロノイズを除去することで、レイトレーシングアプリケーションのレンダリング時間を短縮する、ディープラーニングベースの高パフォーマンスフィルタライブラリ。

myBoris/wzry_ai

機械学習とカスタム画面座標マッピングを活用して、Honor of Kingsのゲームプレイを自動化するオープンソースAIモデルプロジェクト。

LuisaGroup/LuisaRender

CUDA、DirectX、Metalなどの複数のハードウェアバックエンドをサポートする、ストリームアーキテクチャ向けの高パフォーマンスでクロスプラットフォームなモンテカルロレンダラーです。

henrywoo/kazam

画面キャプチャからテキストを抽出するAI搭載OCRを備えたLinux用スクリーンレコーダーおよびブロードキャスター。

wenbowen123/BundleTrack

BundleTrack は、対象物やそのカテゴリの 3D CAD モデルを必要とせずに、新規オブジェクトのリアルタイム 6D ポーズ追跡を実現するフレームワークです。

OpenStitching/stitching

OpenCV を使用して、重複する画像からパノラマを作成する高速かつ信頼性の高い画像ステッチング用の Python パッケージ。

NativeSensors/EyeGestures

高価な専用ハードウェアではなく、標準のWebカメラやスマートフォンカメラを使用して、眼制御インターフェースを実装できるオープンソースの眼追跡ライブラリ。

facebookresearch/projectaria_tools

Project Aria ARグラスから得られるセンサーおよび機械認識データを処理・分析するためのC++/Pythonユーティリティのセット。AIおよび機械認識研究を支援する。

FaceAISDK/FaceAISDK_Android

クラウド接続を必要としない、Android向けのオフラインオンデバイス顔認識SDK。顔検出、認識、ライブネス検出をすべて実行可能。

facebookresearch/Ego4d

Ego4D と Ego-Exo4D 用のツールキットとデータセット基盤で、膨大な第一人称およびマルチビュー動画データセットのダウンロード、処理、モデル学習を支援するツールを提供します。

yuxumin/PoinTr

PoinTrは、幾何学を意識したエンコーダ・デコーダ・アーキテクチャを使用して、不完全な点群から完全な3Dオブジェクトを再構成する、Transformerベースの点群補完モデルです。

MeshInspector/MeshLib

複数のプログラミング言語で動作する高パフォーマンスな3Dメッシュ処理SDK。3Dデータの修復、最適化、操作を実現します。

hbb1/2d-gaussian-splatting

2D向き付きディスク(surfels)を用いて幾何学的に正確なレディアンス場と高品質な3Dメッシュを生成する2Dガウススプラッティングの実装です。

nipreps/fmriprep

最先端の神経画像処理ツールを組み合わせることで、運動補正、正規化、脳領域抽出を自動化する、fMRIデータ向けの堅牢な前処理パイプラインです。

lolishinshi/imsearch

小さな切り抜きスクリーンショットを使って、大規模なデータセットから完全な画像を特徴点マッチングで検索するツール。

cdcseacave/openMVS

OpenMVS は、疎な点群とカメラの姿勢を詳細でテクスチャ付きの3Dメッシュに変換するマルチビュー立体再構築ライブラリです。

microsoft/BiomedParse

9つの画像モダリティにわたる生物医学的オブジェクトの統合的セグメンテーション、検出、認識を可能にする基礎モデルで、2Dおよび3Dボリューム推論をサポートしています。

thiagotigaz/ocr-it

テキスト選択ができないページ分割されたウェブドキュメントやビューアから、ローカルOCRを使用してテキストを抽出するChromeおよびFirefoxの拡張機能。

ohirose/bcpd

BCPDは、点群および関数(DET)のベイズ非剛体レジストレーションのためのMATLAB互換コマンドラインスイートであり、高速化された「++」モード、複数のカーネルオプション、および3D再構成、形状転送、空間オミクスデータ向けのデモを備えています。

facebook/ThreatExchange

類似性マッチング用の画像および動画ハッシュアルゴリズムを備えた、コンテンツモデレーションおよびセキュリティ脅威インテリジェンスのためのツールおよびAPIのコレクション。

Linfeng-Tang/Image-Fusion

マルチモーダル、デジタル写真、リモートセンシング画像の組み合わせ技術をカバーする、画像融合に関する研究論文とコード実装の包括的コレクション。

freesurfer/freesurfer

FreeSurferは、構造的および機能的研究からの人間の脳MRIデータを処理、分析、可視化するためのオープンソースのソフトウェアスイートです。

dipy/dipy

DIPY は、MR拡散画像の分析を目的とした Python ライブラリで、研究者が医療画像データを処理できるツールを提供します。

NVIDIA-AI-IOT/Lidar_AI_Solution

3D Lidar知覚のための高度に最適化されたCUDAおよびTensorRT実装のコレクションであり、自動運転システムにおける疎な畳み込みとセンサーフュージョンを高速化します。

the-database/mpv-AnimeJaNai

TensorRTまたはDirectMLを使用して、アニメコンテンツのリアルタイム4Kアップスケーリングを可能にするカスタムmpvビデオプレーヤーのビルドとReal-ESRGANモデルのセット。

naver/anny

Annyは、全年齢をカバーするオープンソースのPyTorchベースの微分可能人体メッシュモデルです。複数のライグ(コンパクトな104ボーンのデフォルト、完全なMakeHuman)、複数のメッシュトポロジー(SMPL-XとSOMAを含む)、および細粒度の形状、ローカル変更、顔アクションパラメータを提供します。pipでインストールし、クイックなPython例を実行して.plyメッシュを出力するか、インタラクティブなGradioデモを起動できます。このライブラリはApache-2.0ライセンスで、MakeHumanアセットを基盤としており、ポーズ推定、アニメーション、年齢横断ボディモデリングなどの研究/本番タスクを目的としています。

arcships/light-ocr

Node.js および C++ 向けの高速でオフラインの OCR ライブラリ。画像および PDF のローカルテキスト認識を、組み込みのハードウェアアクセラレーションで実現。

kha-white/manga-ocr

日本の漫画に特化して最適化された OCR ツールで、複数行テキスト、振り仮名、縦書き・横書きのレイアウトを認識できます。

open-edge-platform/geti

コンピュータビジョンAIモデルを構築するためのエンドツーエンドプラットフォーム。アノテーション、トレーニング、エッジハードウェアへのデプロイに向けた最適化ツールを提供します。

voxelmorph/voxelmorph

ニューラルネットワークを使用して画像の整列と変形モデリングを行う、学習ベースの画像レジストレーションライブラリ。SynthMorphによるコントラストに依存しないトレーニングが特徴です。

JEOresearch/EyeTracker

動画または画像データから瞳孔楕円を検出するための軽量なPythonベースの3D眼追跡アルゴリズム。

hank-ai/darknet

C/C++およびCUDAで書かれたオープンソースのニューラルネットワークフレームワークで、YOLOリアルタイム物体検出システムを駆動します。

hku-mars/GS-SDF

Gaussian SplattingとニューラルSigned Distance Fields (SDF)を組み合わせ、幾何学的に一貫したフォトリアルなレンダリングと3D表面再構成を実現する、LiDAR拡張システム。

stereolabs/zed-sdk

ZED カメラ向けのクロスプラットフォーム空間知覚 SDK。リアルタイムの深度センシング、物体検知、および位置トラッキングを提供します。

shimat/opencvsharp

C#開発者に包括的なコンピュータビジョンおよび画像処理機能を提供する、OpenCVのクロスプラットフォーム.NET ラッパー。

leblancfg/autocrop

Python ベースのツールで、YuNet ニューラルネットワークを使用して、検出された最大の顔の周囲を自動的にクロップします。プロフィール画像や身分証明書に最適です。

imagej/ImageJ

ImageJは、Javaを使用して複数のプラットフォーム上で動作するように設計された、科学画像を処理・分析するためのパブリックドメインソフトウェアです。

kha-white/mokuro

日本語のマンガに対してテキスト検出とOCRを実行し、ブラウザ上で選択可能なテキストオーバーレイを作成するツール。言語学習者のためのポップアップ辞書の利用を容易にする。

ngageoint/hootenanny

機械学習を活用して、複数の地理空間データセットを1つのシームレスな地図に統合するオープンソースの地図データコンフラクションツールです。

facebookresearch/pytorch3d

3Dコンピュータビジョンの研究向けPyTorchベースのライブラリで、微分可能なレンダリングと3Dメッシュおよびポイントクラウドを操作するための効率的なツールを提供します。

luxonis/depthai-core

Luxonis DepthAIハードウェアと連携して空間AIおよびコンピュータビジョンアプリケーションを構築するためのC++およびPythonライブラリ。