kevinhughes27/TensorKart
人間のプレイ録画から学習することで、マリオカート64を走行するようにAIエージェントを訓練するTensorFlowベースのプロジェクトです。
spytensor/prepare_detection_dataset
CSV、COCO、Pascal VOC、Labelmeフォーマット間でオブジェクト検出データセットのアノテーションを変換するためのPythonスクリプトのコレクション。
XieZhiFa/IdCardOCR
Android向けのオフラインOCRライブラリで、インターネット接続なしで中国の身分証明書、運転免許証、パスポートの高速認識を可能にします。
kadirnar/segment-anything-video
Segment Anything Model (SAM) のパッケージ化されたバージョンで、pipによる簡単なインストールと、動画セグメンテーション、クラウドGPU統合の拡張サポートを提供します。
neka-nat/probreg
確率的モデルを使用した点群登録用ライブラリ。剛体および非剛体変換の両方に対して、ICPのより堅牢な代替手段を提供します。
facebookresearch/mobile-vision
FBNetやChamNetを含む、モバイルデバイス上でコンピュータビジョンのパフォーマンスとレイテンシを最適化するためのハードウェアに配慮した効率的なConvNetモデルとツールのコレクション。
XiandaGuo/OpenStereo
17のデータセットと複数の最先端モデルを統合した、深度推定のための包括的なベンチマークとフレームワーク。
JoHof/lungmask
CTスキャンにおける肺の自動セグメンテーションを可能にする、重度の病変にも対応した訓練済みU-netモデルのパッケージ。肺葉ごとのマスクも可能。
TechStark/opencv-js
Node.jsおよびWebブラウザでOpenCVコンピュータビジョンライブラリを提供するNPMパッケージ。JavaScriptでリアルタイム顔検出などのタスクを実行可能。
oarriaga/paz
TensorFlowとKerasを使用してコンピュータビジョン・パイプラインを構築するためのモジュール式APIを提供する、自律システム向け階層型知覚ライブラリ。
Deep-MI/FastSurfer
体積的および表面ベースの脳 MRI 画像の厚さ解析のための高速で深層学習ベースの神経画像処理パイプライン。FreeSurfer の高速代替手段として機能します。
yzfzzz/depth-detect
YOLOオブジェクト検出と単眼/双眼深度推定を統合し、物体の追跡と運動状態をリアルタイムで推定する高性能C++およびTensorRTフレームワーク。
prov-gigapath/prov-gigapath
巨大な病理画像を分析するための全体スライド基礎モデルで、タイルとスライドエンコーダアーキテクチャを採用しています。
david8862/keras-YOLOv3-model-set
TensorFlow Kerasベースの包括的なYOLOv2、v3、v4物体検出パイプラインで、多様なバックボーン、高度なトレーニング技術、およびデバイス内でのデプロイをサポートします。
talmolab/sleap
人間が関与するGUIを用いて、迅速にラベル付け・行動を定量化するための多動物ポーズ追跡用ディープラーニングフレームワーク。
francescofugazzi/3dgsconverter
GPU加速フィルタリングと圧縮を備えた、複数フォーマット間で3Dガウシアンスプラッティングファイルを高速に変換するツール。
matiasdelellis/facerecognition
ローカルで画像内の顔を検出し、分析・グループ化するNextcloud用の顔認識アプリ。プライバシーを確保した人物ベースの写真整理を実現します。
FaceAISDK/FaceRecognition_ReactNative
iOSおよびAndroidで1:1認証とライブネス検出をサポートするオフライン顔認識SDKのReact Nativeデモと統合ガイド。
kanadeblisst00/wechat_ocr
WeChat Windowsクライアントに内蔵されたローカルOCRモデルを呼び出して、画像からテキスト認識を行うことができるPythonライブラリ。
kyegomez/VisionMamba
Vision Mambaは、従来のVision Transformerよりもはるかに高速で、メモリ効率が高い、効率的な視覚的表現学習のための双方向状態空間モデルです。
facebookresearch/pixio
Pixioは、強化されたピクセル再構成による事前学習により、深度推定やセマンティックセグメンテーションなどの密な予測タスクに最適化されたビジョンエンコーダーです。
microblink/blinkid-android
機械学習とネイティブC++ライブラリを使用した、安全な身分証明書スキャンとデータ抽出のためのAndroid SDK。
jiafeng5513/Evision
ELASやADCensusなどのアルゴリズムを用いたカメラキャリブレーション、ディスパリティマッピング、3D再構成に対応するバイノキュラー視覚システム。
infinitered/react-native-mlkit
GoogleのMLKitネイティブライブラリをラップするExpoモジュールのセットで、Expoアプリで顔やオブジェクト検出などのデバイス内機械学習機能を可能にします。
hujiecpp/PE3R
PE3Rは、ゼロショット一般化を活用して2D画像から意味的に理解可能な3Dシーンへと変換する、知覚効率的な3D再構成システムです。
dluvizon/deephar
リアルタイムでの2次元および3次元人体ポーズ推定と行動認識を実現するマルチタスクディープラーニングフレームワーク。
aparsoft/yolo-streamlit-detection-tracking
YOLO26およびYOLO World v2を使用したリアルタイムオブジェクト検出、セグメンテーション、ポーズ推定、トラッキングを実現するStreamlitベースのビジョンスタジオ。
prov-gigatime/GigaTIME
通常のH&E病理スライドから腫瘍微小環境モデリング用の仮想空間的プロテオミクス(mIF)プロファイルを生成するマルチモーダルAIプロジェクト。
AI4EPS/PhaseNet
生の地震データからP波およびS波の到着時刻を自動的に抽出する、深層ニューラルネットワークベースの手法。
ml-struct-bio/cryodrgn
連続的な3D構造の分布をモデル化するニューラルネットワークベースのアルゴリズム。異種的な低温EMおよび低温ET再構成に適しています。
lartpang/PyIRSTDMetrics
ピクセルレベル、ターゲットレベル、およびハイブリッド指標を使用して赤外線小目標検出モデルのパフォーマンスを分析する軽量なPythonライブラリ。
lingxitong/MIL_BASELINE
計算病理学におけるMultiple Instance Learning (MIL) のための統一されたライブラリであり、ホールスライドイメージ解析のために多数のMILアーキテクチャを実装・比較するための標準化されたフレームワークを提供します。
FaceAISDK/FaceAISDK_iOS
ネットワーク接続なしで安全な本人確認を可能にする、顔検出、認識、およびライブネス検出を提供するiOS向けデバイス内完全オフラインSDK。
quickpose/quickpose-ios-sdk
リアルタイムのポーズ推定とスケルトン追跡用の iOS SDK。運動回数カウントと可動域分析のための事前構築ツールを提供。
PozzettiAndrea/ComfyUI-SAM3DBody
MetaのSAM 3D Body用のComfyUIラッパーで、1枚の画像から全身の3D人体メッシュを復元可能にします。
paninski-lab/lightning-pose
単一視点および複数視点の動画において、特に遮蔽状況下でも頑健に動きを追跡できるエンドツーエンドの動物姿勢推定パッケージ。トランスフォーマー・アーキテクチャを活用。
rendeirolab/LazySlide
scverseエコシステムと統合されたPythonフレームワークで、相互運用性とスケーラビリティを備えた組織学的ワークフローを可能にします。
radekd91/inferno
実環境における3D顔再構成とアニメーションのためのディープラーニングライブラリ。音声駆動アバターと感情認識のツールを備える。
NKI-AI/direct
深層学習を用いたMRI再構成のためのPyTorchツールキットで、サンプリング、再構成、検証のエンドツーエンドパイプラインを提供します。
BuntingLabs/mundi.ai
Mundi は、LLM を活用してベクターデータ、ラスターデータ、ポイントクラウドデータのジオプロセッシングアルゴリズムとシンボロジー編集を自動化するオープンソースのウェブGISです。
mapillary/seamseg
画像内のすべてのピクセルに対してクラスおよびインスタンス固有のラベルを予測するCNNベースのアーキテクチャ。
RongLiu-Leo/beta-splatting
リアルタイムのレディアンスフィールドレンダリングプロジェクトで、ガウスカーネルの代わりに可変のベータカーネルを使用し、幾何学的詳細、色表現、メモリ効率を向上させます。
RizwanMunawar/yolov7-object-tracking
さまざまなソースからのビデオストリーム全体で、リアルタイムの物体検出とトラッキングを行うために YOLOv7 と YOLOv8 を統合したコンピュータビジョンプロジェクト。
realsee-developer/RealSee3D
3D再構成およびセマンティックセグメンテーションのAIモデル学習用に設計された、10,000の屋内シーンを含む大規模なマルチビューRGB-Dデータセット。
Tobias-Fischer/rt_gene
PyTorch と ROS 2 を使用したリアルタイムの目線と瞬き推定システム。自然環境における視線方向と瞬き確率の追跡を実現。
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasonerは、視覚言語モデルに視覚操作(ズームイン、フレーム選択など)を追加する研究フレームワークであり、インストラクションチューニングと好奇心駆動型強化学習により訓練される。リポジトリにはインストールガイド、SFTおよびRLのスクリプト、事前訓練済み7Bチェックポイント、データセット、画像および動画ベンチマーク用の評価パイプラインが含まれる。
jabberjabberjabber/ImageIndexer
画像のキャプションとキーワードを自動生成し、インデックス作成や検索を容易にするために画像メタデータへ直接書き込むローカルAIツール。
yuanze-lin/Olympus
コンピュータビジョン向けのユニバーサルタスクルーターで、単一の自然言語指示を、画像、動画、3Dモデルの生成に必要な専門モデルの連続呼び出しに変換します。