ucam-eo/tessera

TESSERAは、雲によって破損した衛星時系列データを、地球の表現と分析のためのコンパクトな128次元の埋め込みに変換するオープンな地理空間基盤モデルです。

lucidrains/vit-pytorch

画像分類用に、オリジナルのVision Transformer (ViT) とその数十種類のアーキテクチャ変種を実装した包括的なPyTorchライブラリ。

aqlaboratory/openfold-3

タンパク質、RNA、DNA、小分子の3次元構造を予測するためのAlphaFold3のオープンソース再現。

Project-MONAI/MONAI

医療画像におけるディープラーニングのためのPyTorchベースのオープンソースフレームワークで、医療データ向けの標準化されたワークフローとドメイン特化ツールを提供します。

opendatalab/OmniDocBench

現実世界のシナリオにおけるドキュメント解析の評価に向けた包括的なベンチマークで、レイアウト検出、OCR、テーブル、数式認識のための豊富なアノテーションを備えています。

LibreYOLO/libreyolo

MITライセンスのコンピュータビジョンライブラリで、検出、セグメンテーション、ポーズ、深度、OCR、その他のビジョンタスクのための単一APIを提供し、トレーニングおよびエクスポートツールも備えています。

nv-tlabs/vipe

ピンホール、広角、360度パノラマ映像を含む原始動画からカメラの姿勢、内部パラメータ、および密な深度マップを推定する空間AIツール。

aiptimizer/TurboOCR

C++、CUDA、およびTensorRTを使用し、画像とPDFを、表や数式を含む構造化されたMarkdownに変換する高速GPUドキュメントパーサー。

mkturkcan/DART

TensorRTの最適化と蒸留されたバックボーンを使用して、SAM3をリアルタイムのマルチクラス・オープンボキャブラリー検出器に変換する、トレーニング不要のフレームワーク。

TickLabVN/biopass

AI駆動の偽造防止機能とGUIマネージャーを備えた、Linux向けの顔認証と指紋認証に対応するマルチモーダルバイオメトリックログインシステム。

leeyeel/Sketch2Motion

静止画像やスケッチをSVGに変換し、Manimでレンダリングすることで滑らかな描画アニメーションに変換するツール。

opencv/opencv-python

手動でのコンパイルが不要な、pip経由でインストール可能なOpenCVの事前ビルドPythonバインディング。

pytorch/vision

コンピュータビジョンのための、一般的なデータセット、モデルアーキテクチャ、および画像変換を提供する PyTorch ライブラリ。

mindee/doctr

PDFや画像におけるテキスト検出・認識、およびレイアウト・表分析を可能にする、PyTorch駆動のOCRライブラリです。

fabiotosi92/ZipDepth

ZipDepth は 6 M パラメータのゼロショット単眼深度モデルで、GPU 上で 1 k FPS 以上で動作し、モバイルランタイムにエクスポート可能。RepVGG 風の再パラメータ化畳み込み、ストリッププーリングアテンション、軽量 FPN デコーダを組み合わせた。リポジトリには即時実行可能な推論スクリプト、ONNX/TorchScript エクスポートユーティリティ、ベンチマーク、および完全な学習パイプライン(Depth Anything V2 から知識蒸留)が含まれる。

qpuchen/nnUNet_att_position_correction

軸向アテンション(axial attention)と位置修正モジュールを nnU-Net に組み込むことで、限られたラベル付きデータを用いて精度を向上させる半監督式 3D 歯のセグメンテーション・フレームワークです。

mitsuba-renderer/mitsuba3

Pythonとの深い統合を備えた、順方向および逆方向の光輸送シミュレーションのための研究指向の微分可能レンダリングシステム。

obss/sahi

SAHI(Slicing‑Aided Hyper Inference)は、非常に大きな画像や動画におけるオブジェクト検出およびインスタンスセグメンテーションのスライス推論を可能にするオープンソースのPythonライブラリです。YOLO、MMDetection、Detectron2、HuggingFace、TorchVisionなど、ほとんどの人気検出器と互換性があり、CLIとPython APIを提供し、FiftyOneによる可視化に対応しており、COCOデータセットの取り扱いや評価のユーティリティも備えています。

Zarxrax/Sammie-Roto-2

SAM2やMatAnyoneなどのモデルを使用した、AI支援のビデオマスキング、セグメンテーション、オブジェクト除去のためのクロスプラットフォームデスクトップアプリケーション。

WebODM/OpenSplat

OpenSplatは、COLMAP/OpenSfM/ODX/nerfstudioデータをコンパクトなガウシアンベースのシーンファイルに変換するC++実装の3Dガウシアンスプラッティングです。CUDA、ROCm(HIP)、Apple Metal、およびCPUオンリーのビルドをサポートし、Dockerイメージを提供し、.ply/.splat/.spz/.rad形式へのトレーニング、再開、マスク、エクスポートをシンプルなCLIで行えます。

AprilRobotics/apriltag

ロボティクス向けの視覚フィジュアルシステムで、画像内のユニークなマーカーを検出し、正確な識別と3Dポーズ推定を提供します。

GunduLabs/gaze

Linux向けの顔認証システムで、デバイス上での顔認識とPAM統合を提供し、安全でパスワード不要のログインとsudoアクセスを実現します。

Farama-Foundation/ViZDoom

視覚情報のみを使用してゲームをプレイするボットの開発・テストを目的とした、DoomベースのAI研究プラットフォーム。主に強化学習の研究に用いられる。

roboflow/inference

推論エンジンおよびデプロイメントプラットフォームで、エッジデバイスからクラウドまであらゆるハードウェア上でコンピュータビジョンモデルおよび複雑なビジュアルワークフローを実行できるようにします。

jacobgil/pytorch-grad-cam

コンピュータビジョンの説明可能なAI(XAI)のためのPyTorchライブラリ。モデルの予測を可視化し、診断するための幅広いピクセルアトリビューション手法を提供します。

SimonZeng7108/efficientsam3

知識蒸留を用いて視覚およびテキストエンコーダーを圧縮する、SAM3の軽量版。モデルサイズを最大90%削減し、効率的なセグメンテーションを実現。

Tau-J/rtmlib

rtmlib は、RTMPose および ViTPose モデルをラップする軽量な Python ライブラリです。重い OpenMMLab 依存関係を回避し、numpy、OpenCV、ONNX Runtime(GPU/アクセラレータバックエンドをオプションで使用可能)のみを必要とします。高レベルのソリューションクラス(Wholebody、Body、Hand、Animal、Custom、Wholebody3d)は検出器(YOLOX、RFDETR、RTMDet)とポーズ推定器を組み合わせ、スケルトンの描画ユーティリティも提供します。モデルは OpenMMLab または HuggingFace ミラーから自動ダウンロードされます。pip またはソースからインストールでき、Gradio WebUI または Python API を使って単一画像、動画、ウェブカメラの推論を実行できます。

1038lab/ComfyUI-RMBG

RMBG-2.0やSAM2などの幅広いAIモデルを使用して、高度な画像背景削除と精密なオブジェクトセグメンテーションを行うためのComfyUIカスタムノードスイートです。

prs-eth/LitePT

LitePTは、3Dビジョンタスクにおける最先端の精度を維持しつつ、パラメータ数とメモリ使用量を大幅に削減する軽量かつ高パフォーマンスな3Dポイントクラウドアーキテクチャです。

deepfakes/faceswap

画像や動画の顔を認識・交換するための、抽出‑学習‑変換パイプラインを備えたディープラーニングツール。

Udayraj123/OMRChecker

スキャンされたOMRシートやスマートフォンの写真を正確に読み取り評価するオープンソースのOMRチェックソフトウェア。結果をCSVにエクスポートします。

margelo/react-native-vision-camera

プロフェッショナルな写真/動画撮影とリアルタイム AI フレーム処理を可能にする、React Native 向けの高性能カメラライブラリ。

koide3/small_gicp

高速な3D整列に最適化された、並列化されたC++ライブラリ。ICP、GICP、VGICPによる細粒度点群登録を実現。

KennethJAllen/proper-pixel-art

ノイズが多く高解像度のピクセルアート風画像やアニメーションを、元のグリッドを回復することでクリーンで真の解像度のピクセルアセットに変換するツール。

MIT-SPARK/VGGT-SLAM

3D マッピングと自己位置推定のための、リアルタイムかつ高密度なフィードフォワード式シーン再構成システム。オプションとしてオープンセット3D物体検出機能を備えています。

roflcoopter/viseron

自宅やオフィスの監視に最適な、自己ホスト型でローカル専用のNVRおよびAIコンピュータビジョンソフトウェア。オブジェクトと顔認識を備えています。

bhimrazy/receipt-ocr

TesseractとLLMを使用して、レシート画像から生テキストまたは構造化JSONデータを抽出するOCRエンジンです。

Yuliang-Liu/MonkeyOCR

MonkeyOCRは、Structure-Recognition-Relation(構造・認識・関係)の三組パラダイムを使用して、PDFや画像を構造化されたMarkdownに変換するドキュメント解析モデルで、英語と中国語をサポートしています。

Tencent-Hunyuan/HunyuanOCR

軽量でエンドツーエンドのOCR視覚言語モデル。構造化テキスト抽出を高速化するための指示的推論を統合。

VisoMasterFusion/VisoMaster-Fusion

画像、動画、およびライブウェブカメラ映像に対して、AIによる顔の入れ替えと高画質化を行うデスクトップアプリケーション。プロフェッショナルな編集ツールとGPU加速機能を搭載しています。

nilearn/nilearn

Nilearnは、scikit-learnを活用して多変量統計を行う、脳の体積および表面の解析用Pythonライブラリです。

Topdu/OpenOCR

統合テキスト、数式、表認識およびドキュメント解析を可能にする、軽量モデルを備えたオープンソースのOCRツールキット。

NVlabs/SOMA-X

SOMA‑Xは、パラメトリックな人体および手の統一された微分可能な表現を提供するPythonライブラリであり、複数のアイデンティティモデル(MHR、SMPL‑X、MANOなど)をサポートし、NVIDIA Warpによる高速スキニングを提供します。複数の詳細レベルでの全身および手のメッシュのための`SOMALayer`と`SOMAHandLayer`、さらにポーズ逆変換、リグ制御、データI/Oのツールが含まれており、アニメーション、ポーズ推定フィッティング、合成データ生成に有用です。

zs1083339604/FaceWinUnlock-Tauri

OpenCVとカスタム認証プロバイダーを使用して、ネイティブなWindows Helloハードウェアがないデバイスでも顔認識によるロック解除を可能にするWindows用ツール。

AmmarkoV/SAM3DBody-cpp

Python依存なしで2D画像から3D人体ポーズ、形状、カメラパラメータを回帰する、SAM-3D-Body用のスタンドアロンC++推論エンジン。

roboflow/sports

スポーツ分析のためのコンピュータビジョンツールとデータセットのコレクション。ボールの追跡、選手の再識別、ユニフォーム番号の OCR に焦点を当てています。

SharpAI/DeepCamera

ローカルで VLM シーン分析とオブジェクト検出スキルを展開できるオープンソース AI カメラプラットフォームで、自治的かつハードウェア認識型のインストールを実現します。

phongdaot/MocapAnything

任意のスケルトン(動物やカスタムリグを含む)に対して、モノクロ動画を3Dジョイント回転に変換するエンドツーエンドのモーションキャプチャシステム。