liebharc/homr
写真や PDF で撮影された楽譜を機械可読な MusicXML ファイルに変換する光学楽譜認識(OMR)ソフトウェア。
cvg/vidmap
時間的トラッキング、ループクローズ、メトリック深度を活用し、カメラ姿勢を推定してスパース3Dマップを生成する、動画向けのオフラインStructure-from-Motionシステム。
nv-tlabs/NKSR
Neural Kernel Surface Reconstruction (NKSR) は、数百万点を秒単位で処理できる、大規模で疎でノイズの多い点群から高品質な3D陰関数表面を生成する手法です。
ultralytics/yolov3
Ultralytics YOLOv3 は、YOLOv3 オブジェクト検出モデルの PyTorch 実装で、3つのバリアント(フル、SPP、タイニー)を提供し、学習、推論、検証、多数のデプロイフォーマットへのエクスポート用スクリプトを備えています。自動的に COCO 事前学習済み重みをダウンロードでき、PyTorch Hub からの読み込みもサポート。人気のある ML-ops ツールやクラウドノートブックとも連携可能。AGPL‑3.0 ライセンスで、商用エンタープライズオプションも提供。
lightly-ai/lightly
自己教師学習のためのモジュール式コンピュータビジョンフレームワークで、多数の最先端SSLモデルの実装とビルディングブロックを提供します。
google-ai-edge/model-explorer
Model Explorer は、Google‑AI‑Edge のオープンソースビジュアライザーで、TensorFlow、TFLite、TF‑JS、MLIR、PyTorch ExportedProgram モデルをインタラクティブな階層グラフとしてレンダリングします。GPU による加速レンダリング、検索可能なノード、I/O のハイライト、メタデータオーバーレイ、および追加形式用の拡張可能なアダプタシステムを提供します。
ndl-lab/ndlocr-lite
GPUを必要としない、家庭用コンピュータ向けの軽量OCRツール。デジタル化された本や雑誌からテキストを抽出するための設計。
albumentations-team/AlbumentationsX
コンピュータビジョンモデルの品質と頑健性を向上させるために合成学習サンプルを作成する、高性能な画像拡張用Pythonライブラリ。
bytedance/Protenix
AlphaFold3の代替として、タンパク質およびRNAの高精度3次元モデリングを提供するオープンソースの生体分子構造予測フレームワークです。
facebookresearch/MHR
アイデンティティ、ポーズ、顔の表情パラメータを使用して、現実的で微分可能な人体メッシュを生成する高精細なパラメトリック3D人体モデル。
triple-mu/YOLOv8-TensorRT
YOLOv8用の高性能TensorRT加速ラッパーで、検出、セグメンテーション、ポーズ、OBB、分類の高速推論をPythonおよびC++で実現。
cvg/GeoCalib
GeoCalibは、深層ネットワークと幾何最適化を組み合わせた研究用Pythonライブラリで、1枚の画像からカメラの内部パラメータとシーン内の重力方向を予測します。複数のレンズモデル、部分的な事前知識、バッチ処理および複数カメラリグのキャリブレーションをサポートし、インストールが簡単な推論コード、Gradioウェブデモ、Colabノートブック、ライブウェブカメラデモを同梱しています。事前学習済みモデルはOpenPanoデータセット(HDRパノラマから抽出された約37kの透視投影画像)で訓練され、LaMAR、MegaDepth、TartanAir、Stanford2D3Dなどのベンチマークで最先端の結果を達成しています。
SunOner/sunone_aimbot_2
コンピュータビジョンモデルを使用してターゲットを検出し、ゲーム用にマウス操作を自動化するC++ベースのAIアームボット。
orbbec/pyorbbecsdk
Orbbec SDK v2.x用のPythonバインディングで、深度ストリーミング、3Dポイントクラウド生成、コンピュータビジョンタスクに使用可能なRGB-Dカメラとのインターフェースを可能にします。
luicfrr/react-native-vision-camera-face-detector
Google MLKit と Vision Camera を統合し、リアルタイムおよび静的な画像による顔認識機能を提供する React Native ライブラリです。
facebookresearch/detectron2
Detectron2 は Meta AI Research から提供される高性能なコンピュータビジョンライブラリで、最先端の物体検出およびセグメンテーションアルゴリズムを提供します。
LazoVelko/neverclick
コンピュータビジョンを使用して、ユーザーがキーボードだけでマウス操作を行うことができるデスクトップアプリケーション。物理的なマウスの使用を減らすことを目的としています。
dweep-desai/FaceGate-Mac
デバイス上の顔認識、Touch ID、またはパスワードを使用して、特定のアプリケーションへのアクセスを制限するネイティブ macOS アプリロッカー。
mne-tools/mne-python
MEGやEEGなどの人間の神経生理学的データを探索、可視化、分析するためのオープンソースのPythonパッケージ。
egdels/makeacopy
オンデバイス ML と OCR を使用して、セルフホストワークフロー向けに検索可能な PDF を作成する、オフラインでプライバシーを重視した Android ドキュメントスキャナー。
krupkat/xpano
フルレゾリューションのパノラマをエクスポートするための画像グループ検出の自動化と投影調整を提供するパノラマステッチツール
sceneview/sceneview
Jetpack ComposeやSwiftUIなどの宣言型UIフレームワークを使って、マルチプラットフォームの3DおよびAR体験を構築できるフレームワークです。
blakeblackshear/frigate-hass-integration
FrigateのAI駆動の物体検出機能とNVR機能をスマートホームハブに接続するHome Assistant統合で、自動化されたセキュリティ監視を実現します。
perfanalytics/pose2sim
OpenSim を使用して、低コストカメラからの2D動画を研究レベルの3D関節角度と骨格解析に変換するマーカーレス3D運動解析ワークフロー。
playcanvas/supersplat-viewer
WebGPUまたはWebGLを使用して、インタラクティブな3Dガウススプラッティングシーンをウェブ上で高パフォーマンスで表示するためのWebビューア。
microsoft/aurora
Auroraは、一般用途の事前学習モデルを特殊な予測タスクに適応させることで、気温、大気汚染、海波などの大気変数を予測する地球システム用の基礎モデルです。
yatengLG/ISAT_with_segment_anything
Segment Anything Model(SAM)を使用して、ラベル付きデータセットの作成を加速するインタラクティブな半自動画像セグメンテーションアノテーションツールです。
secluso/core
Raspberry Pi 用のプライベートで DIY のホームセキュリティカメラシステムで、クラウド監視を回避するエンドツーエンド暗号化を採用しています。
mahmoodlab/TRIDENT
AI病理学における大規模な全スライド画像処理のためのツールキットで、多数の基礎モデルを使用して組織セグメンテーションと特徴抽出のエンドツーエンドパイプラインを提供します。
CERN/TIGRE
PythonとMATLABを用いたGPU加速型のツールボックスで、幅広い反復アルゴリズムと柔軟なCT幾何構成をサポートする、高速かつ高精度な3Dトモグラフィック再構成を実現します。
InsightSoftwareConsortium/ITK
N次元の科学的画像処理、セグメンテーション、レジストレーションのためのオープンソースでクロスプラットフォームのツールキット。主に医療画像解析に使用される。
mtalcott/google-photos-deduper
OAuthの設定を必要とせずに、ローカルの画像埋め込みを使用してGoogleフォトライブラリ内の重複写真を検出し削除するChrome拡張機能です。
Geekgineer/YOLOs-CPP
YOLOファミリー全体に対して統一されたAPIを提供し、物体検出からメトリック深度推定までのタスクをサポートする、プロダクションレディなC++推論エンジン。
alicevision/AliceVision
無秩序な写真や動画から 3D 再構成とカメラトラッキングを行うためのアルゴリズムを提供する、フォトグラメトリ(写真測量)コンピュータビジョンフレームワークです。
chaofengc/IQA-PyTorch
フルリファレンスおよびノーリファレンス品質指標の多数をGPUアクセラレーションで実装した、PyTorchベースの画像品質評価 (IQA) ツールボックス。
Babyhamsta/Aimmy
YOLOv8 と DirectML を使用し、身体や視覚的な障害のあるゲーマーが FPS ゲームでの命中率を向上させるのを支援する AI ベースのエイムアラインメントツール。
pur1fying/blue_archive_auto_script
YOLOv8を用いたキャラクター検出により、ブルーアーカイブの戦闘、毎日のタスク、リソース管理を自動化するスクリプト。
withoutbg/withoutbg-python
無料のローカルONNXモデルまたはプロフェッショナルなクラウドAPIを使用して、画像から背景を削除するためのPythonライブラリです。
apple-aiml-research/ARKitScenes
モバイルLiDARで撮影された室内シーンの大規模なRGB-Dデータセット。3Dオブジェクト検出および深度アップサンプリングのための真値を提供。
lukasHoel/video_to_world
動画拡散モデルによって生成された動画における幾何学的不整合を解消し、安定した3D世界を生成する3D再構築パイプライン。
Slicer/Slicer
3D Slicerは、3D医療画像データの可視化と解析のための無料でオープンソースのソフトウェアパッケージです。
qupath/qupath
QuPathは、機械学習と専用アルゴリズムを用いて、全スライド画像や顕微鏡画像の注釈および分析を行うオープンソースのバイオイメージ分析ソフトウェアです。
mudler/locate-anything.cpp
NVIDIAの LocateAnything-3B の C++/ggml 推論移植版で、Pythonランタイムを必要とせず、CPUおよびGPU上で高速なオープンボリュームオブジェクト検出を実現します。
deepinv/deepinv
DeepInverseは、モジュール式のオペレーターとアルゴリズムのフレームワークを通じて、ディープラーニングを用いたイメージング逆問題の解決を目的とした、オープンソースのPyTorchベースのライブラリです。
Junjue-Wang/LoveDA
都市および農村環境におけるセマンティックセグメンテーションとドメイン適応を改善するための高解像度リモートセンシング土地被覆データセット。
chenwei-zhao/captcha-recognizer
スライダーキャプチャにおけるギャップ座標と信頼度を識別するためのディープラーニングベースのライブラリ。
privatenumber/mac-ocr
macOS 向けのコマンドラインツールおよび Node.js API。Apple の Vision フレームワークを使用して、画像や PDF からテキストを抽出し、検索可能な PDF を作成するローカルでプライベートな OCR を実現。
nsfw-filter/nsfw-filter
データをサーバーにアップロードせずに、デバイス上でAIを実行してNSFW画像をブロックするプライバシー重視のブラウザ拡張機能。