google-research/scenic

JAX と Flax をベースにしたコンピュータビジョン研究用ライブラリで、画像・動画・音声にまたがる注意機構モデルの開発のためのスケーラブルなライブラリとプロジェクトテンプレートを提供します。

kotaro-kinoshita/yomitoku

画像化された文書に対して高精度なOCR、レイアウト解析、表構造認識を提供する日本語専用のドキュメントAIエンジンです。

zju3dv/InfiniSplat

InfiniSplat は、単一の RGB 画像または RGB-深度ペアから 3D ガウススプラッティングシーンを再構成する、大基線モノクロ視点合成向けのシステムです。

SarahWeiii/CoACD

複雑な形状を近似凸包に分解する3Dメッシュ分解ツール。衝突検出や物理シミュレーションを効率的に行うために設計されています。

playcanvas/splat-transform

SplatTransform は、3‑D ガウシアンスプラットデータの変換、編集、分析に使えるオープンソースのライブラリおよび CLI です。PLY、SOG、SPZ、GLB、HTML、ボクセル、WebP など多くの入出力フォーマットをサポートし、幾何変換、フィルタリング、減算、LOD ストリーミング、衝突メッシュ生成、GPU アクセラレーション付き操作が可能です。npm でインストール(または Docker バックエンドを使用)し、`splat-transform input.ply output.sog` や `-s`、`-t`、`--filter-box`、`--decimate` などのコマンドを実行できます。ニューラルグラフィックススプラット表現を扱う研究者、エンジン開発者、コンテンツクリエイターに最適です。

PiTracLM/PiTrac

Raspberry Piと機械学習を使用して、ボールの打ち出し速度、角度、およびスピンを追跡する、オープンソースのDIYゴルフ弾道測定器。

twistedfall/opencv-rust

OpenCV コンピュータビジョンライブラリ用の Rust バインディングで、Rust で OpenCV の画像処理および CV ツールを使用可能にします。

davnords/LoMa

LoMa は、コンピュータビジョン向けの高速で正確な局所特徴マッチャーのファミリーです — 画像ペア間の対応する点を検出します。3D再構成や視覚的局所化パイプラインにおける LightGlue のドロップイン置換として使用でき、速度と精度のバランスを取った複数のモデルサイズを備えています。

duy-phamduc68/TrafficLab-3D

コンピュータビジョンとカスタムキャリブレーションパイプラインを使用して、CCTV映像と衛星地図から3Dデジタルツインを生成するエンドツーエンドの交通分析ツールキット。

suzuran0y/CCTV-Smartphone-AI-Monitoring

SentinelはオープンソースのLAN専用システムで、Androidスマートフォンをリアルタイムカメラノード、Python/FlaskベースのPCサーバーをライブプレビュー、セグメント録画、AIトリガー監視ダッシュボードに変換します。モーション検出により外部ビジョンモデルを呼び出し、構造化されたJSONイベントを出力し、すべてのデータをローカルに保持することで、プライバシー重視の監視やデータ収集研究に最適です。

NVlabs/SpatialClaw

SpatialClawは、空間推論エージェント向けのトレーニング不要なコードとしての行動フレームワークです。VLMが、事前に認識ツール(SAM-3、Depth-Anything-3)と科学ライブラリがロードされた永続的なJupyterカーネル内でPythonセルを書く・実行します。システムは計画、コード生成、安全確認実行、観測のループを繰り返し、エージェントが `ReturnAnswer(...)` を返すまで続けます。20のベンチマークで評価され、平均精度59.9%を達成し、前例のエージェントを11.2ポイント上回りました。同じプロンプトとツールを6つのVLMバックエンドで使用。リポジトリにはフルランタイム、ベンチマークローダー、インストールスクリプト、SLURMサポートが含まれます。

Dicklesworthstone/franken_ocr

franken_ocrは、BaiduのUnlimited-OCRおよび4つの関連ビジョン・ランゲージモデルを実行する純Rust、CPU専用OCRエンジンです。単一のポータブルバイナリ(`focr`)として配布され、一度のモデルダウンロード後は完全にオフラインで動作し、Markdown、JSON、チャートデータ、MusicXMLの出力を提供します。プロジェクトは手作業で書かれたSIMDカーネルを使用し、unsafe Rustは審査済みSIMD島以外では禁止。広範な自己テストおよびリリース認証スクリプトを含んでいます。

manycoretech/aholo-viewer

巨大な3Dデータセットを扱えるようにする、チャンク化ストリーミングLODを用いた高性能3Dガウシアンスプラッティングおよびメッシュレンダラー。

opencv/opencv_contrib

OpenCVの公式コア配布版に統合される前の、実験的な機能やコミュニティ提供の追加モジュールをテストするためのリポジトリです。

PointCloudLibrary/pcl

2D/3D 画像と点群処理のための大規模オープンソースライブラリで、ロボティクスや 3D パーセプションで広く利用されています。

robertknight/ocrs

ニューラルネットワークモデルを使用して画像からテキストを抽出する Rust ライブラリおよび CLI ツール。画像前処理の必要性を最小限に抑えることを目的としています。

DeepLabCut/DeepLabCut

DeepLabCutは、ディープラーニングを使用して、物理的なマーカーを付けることなくビデオ内の動物や物体を追跡できる、マーカーレス姿勢推定ツールボックスです。

infinitered/nsfwjs

TensorFlow.js を使用して、画像を安全なカテゴリと NSFW カテゴリに分類するための JavaScript ライブラリ。

antvis/chart-visualization-skills

検索可能なスキルカタログ、CLI、HTTPサービス、npmパッケージを通じて、LLMが正確で実行可能なチャート(G2、G6、X6、インフォグラフィック、ナラティブテキストなど)を生成できるようにするAI強化型AntVスキルライブラリ。

MIT-SPARK/KISS-Matcher

相対的な回転と並進を決定するために3Dポイントクラウドを整列させる、高速かつ堅牢なポイントクラウド登録ライブラリ。

MIC-DKFZ/nnInteractive

3D 医療画像向けの最先端の 3D プロンプト可能なセグメンテーションフレームワーク。点、スクライブ、ラッソプロンプトを使ってボリュームマスクを修正できます。

TencentARC/Track4World

Track4Worldは、単眼動画におけるすべてのピクセルの高密度3D追跡を可能にするフレームワークであり、フィードフォワード方式でワールドセントリックな3Dシーンフローを推定します。

UVA-Computer-Vision-Lab/OmniShotCut

多様な動画ソース間でカットやトランジションを識別する高パフォーマンスなショット境界検出ツール。Shot-Query Transformer を使用。

kocasariumut/FaceAnything

Face Anythingは、任意の画像シーケンスまたは単一の写真から、時間的に一貫性のある4D (3D + 時間) 顔の再構成を行うフィードフォワード・ニューラルモデルです。点群ビデオ、深度/法線マップ、標準座標の可視化、フレームごとのPLYメッシュおよびカメラデータを出力します。CUDA GPU上で動作し、ワンラインのスクリプトでインストールが可能で、設定可能な処理モードと背景除去機能を提供します。

ssrajadh/sentrysearch

自然言語または画像を使って、特定のイベントを映像から検索し、一致するクリップを自動でトリミングする意味的動画検索ツール。

roflcoopter/viseron

自宅やオフィスの監視に最適な、自己ホスト型でローカル専用のNVRおよびAIコンピュータビジョンソフトウェア。オブジェクトと顔認識を備えています。

nvpro-samples/vk_gltf_renderer

glTF 2.0 および 2.1 シーンの高忠実度 PBR マテリアル参照として機能する Vulkan RTX パストレーサーおよび glTF シーンエディタ。

RollingPlain/IVIF_ZOO

赤外線と可視光画像融合(IVIF)の包括的リソースハブおよびベンチマークで、キュレートされたデータセット、分類された融合手法カタログ、評価ツールを提供します。

Pointcept/Utonia

3D点群用のクロスドメイン事前学習されたPoint Transformer V3エンコーダーで、さまざまな下流3D認識タスクに普遍的な表現を提供します。

fegennari/3DWorld

宇宙、都市、地形の広範なプロシージャル生成と、大規模モデルの高性能レンダリングを備えた、クロスプラットフォームなOpenGLベースの3Dゲームエンジン

google/ffn

脳組織の電子顕微鏡データセットにおける、大規模で複雑な3D形状のインスタンスセグメンテーション向けのニューラルネットワークフレームワーク。

Artoriuz/ArtCNN

アニメコンテンツの拡大とクリーニングに最適化された単一画像スーパーレゾリューション(SISR)モデルのコレクション。リアルタイムと高品質非リアルタイムの両方のオプションを提供します。

hybridgroup/gocv

GoCV は OpenCV 4 用の Go 言語バインディングを提供し、Go 開発者が高度なコンピュータビジョンとハードウェアアクセラレーション画像処理をアプリケーションに統合できるようにします。

microsoft/GlobalMLBuildingFootprints

MicrosoftのGlobal Building Footprintsリポジトリは、深層学習セグメンテーションモデルで生成された10億を超える建物ポリゴン(および多数の高さ推定値)を含む、オープンライセンスのデータセットをリリースしています。データはBingクアッドキーでインデックスされたgzip圧縮行区切りGeoJSON形式で提供され、信頼度スコアとドキュメントを備えており、大規模GISまたはAI駆動の都市分析に適しています。

tue-mps/eomt

複雑なデコーダーを必要とせず、単純なVision Transformer (ViT) を再利用することで、高速かつ高精度な画像セグメンテーションを実現するエンコーダー専用モデル。

automeris-io/WebPlotDigitizer

WebPlotDigitizer は、コンピュータビジョンを活用して、研究者や科学者がデータ可視化画像から数値データを抽出するのを支援するツールです。

cvg/resplat

ReSplatは、レンダリング誤差をフィードバックとして用いて、シーン表現を反復的に精緻化するフィードフォワード再帰モデルです。

mikel-brostrom/boxmot

軸に沿った境界ボックス(AABB)と回転境界ボックス(OBB)の両方をサポートする、プラグイン可能な複数オブジェクト追跡フレームワーク。さまざまな検出器と追跡器を統一インターフェースで統合できる。

ok-oldking/ok-script

Windowsアプリ、ゲーム、Androidデバイス向けのコンピュータビジョンベースのPython自動化フレームワーク。OCRおよびテンプレートマッチングをサポート。

QIN2DIM/hcaptcha-challenger

コンピュータビジョンモデルとマルチモーダル大規模言語モデルを組み合わせたAI駆動のツールで、hCaptchaチャレンジを解決します。

vccimaging/DeepLens

PyTorchトレーニングループ内で学習可能なパラメータとしてレンズを最適化できる、計算画像処理および光学設計向けの微分可能な光学レンズシミュレータ。

princeton-vl/infinigen

コンピュータビジョンとロボットシミュレーションのために、無限に生成されるフォトリアルな3D世界、屋内シーン、および関節付きアセットを作成するプロシージャル生成エンジン。

Peterande/D-FINE

D‑FINEは、DETRのボックス回帰を細分化された分布修正として再定義し、自己蒸留モジュールを追加したリアルタイムオブジェクト検出フレームワークです。複数のモデルサイズ(‑N から ‑X)を提供し、T4 GPU上で70〜470 FPSで動作しながら、COCO/APスコアで最先端(42.8 %〜55.8 %)を達成。推論コストは追加なし。リポジトリにはCOCO、Objects365、およびカスタムCOCO形式データセット用の事前学習済みチェックポイント、設定ファイル、完全なトレーニング/評価スクリプトが含まれます。

PozzettiAndrea/ComfyUI-MotionCapture

GVHMRを使用して動画から3D人体の動きとSMPL骨格パラメータを抽出するComfyUIカスタムノードパッケージ。

apple-aiml-research/ml-depth-pro

1秒未満で高解像度かつシャープな深度マップを絶対スケールで生成するゼロショットモノクロナルメトリック深度推定のためのファウンデーションモデル。

dynobo/normcap

Linux、macOS、Windows 向けの OCR 対応スクリーンキャプチャーツール。画像を保存するのではなく、画面からテキストとバーコードを抽出します。

koide3/direct_visual_lidar_calibration

環境の構造とテクスチャを活用して、正確なセンサー整合を実現するターゲット不要で自動的なLiDARカメラ外挿校正ツールボックス。

localai-org/depth-anything.cpp

CPU および GPU 上で高速な単眼メトリック深度とカメラポーズ推論を実現する、依存関係のない C++ ポート。Depth Anything 3 および V2 を対象。