Xiaoqi-Zhao-DLUT/MSNet-M2SNet
MSNetおよびM2SNetアーキテクチャを備えた医療画像セグメンテーションフレームワーク。マルチスケール減算を活用し、ポリープや肺感染症などの病変を正確に分離します。
MrBlankness/LightM-UNet
LightM-UNetは、UNetとMambaの軽量な統合であり、わずか1Mのパラメータで高い性能を発揮する医療画像セグメンテーションモデルです。
OvidijusParsiunas/myvision
コンピュータビジョンの機械学習トレーニングデータを生成するための、自動バウンディングボックス生成とデータセット形式変換をサポートする無料のオンライン画像アノテーションツール。
laugh12321/TensorRT-YOLO
NVIDIA デバイス上の YOLO シリーズモデル向けの高性能推論デプロイツールで、TensorRT と CUDA を使用して前処理と後処理を最適化します。
xiaofengShi/CHINESE-OCR
自然シーンにおける中国語OCRの包括的なパイプラインで、テキスト向き検出、CTPNによる領域検出、およびCRNNによるエンドツーエンド文字認識を統合しています。
guochengqian/openpoints
PointNetやPointNeXtなどのモデル向けに、ポイントクラウド理解のポイントベース手法のベンチマークと再現を可能にする標準化されたエンジンを提供するライブラリ。
oculus-samples/Unity-PassthroughCameraApiSamples
Quest 3/3SヘッドセットのパススルーカメラAPIを使用して、MRアプリケーション向けに生のカメラデータとメタデータにアクセスするUnityサンプルのセットです。
CNES/cars
CARSは、写真測量を使用して衛星画像からデジタル表面モデル(DSM)を生成するオープンソースのマルチビューステレオフレームワークです。
photonixapp/photonix
オブジェクト認識と色分析を使用して、写真コレクションを自動的に整理・フィルタリングする自己ホスト型の写真管理アプリ
Xiaohan-Chen/bear_fault_diagnosis
振動データを使用して回転機械のベアリング故障を診断するためのマルチスケールCNN-LSTMモデルのPyTorch実装。
ShiqiYu/OpenGait
人間識別と健康スクリーニングのための柔軟で拡張可能な歩行解析フレームワークであり、シルエット、スケルトン、LiDARポイントクラウドなどの複数のモダリティをサポートします。
jinlife/Synology_Photos_Face_Patch
対応していないNASハードウェア上でGPU要件を回避することで、Synology Photosの顔認識およびオブジェクト認識を有効にするパッチ。
YuChuang1205/PAL
全マスクではなく単一点のラベルのみを使用して、高い性能を達成できる赤外線小目標検出のプログレッシブアクティブラーニングフレームワーク。
azxcvn/mpv-android-anime4k
libmpv を基盤とした Android 動画プレーヤーで、Anime4K アルゴリズムを使用してアニメおよびアニメーション動画のリアルタイムスーパーレゾリューション拡大を提供します。
oculix-org/SikuliX1
画像認識を用いて画面上の要素を識別し、マウスとキーボード入力をシミュレートすることで、画面要素とインタラクションを行う、コンピュータビジョンベースの自動化ツールです。
ruoyuw22-byte/NeuroMorph-Assessment
CAT12処理を統合した自動化された構造的MRIモルフォメトリシステムで、脳組織の体積を測定し、定量的レポートを生成します。
hcliucs/APSD
画像内の敵対的摂動の隠蔽性を評価するための、人間中心のフレームワークと新しいデータセット (APSD) およびアテンションベースの予測モデル (A2SM) を提供します。
OCR4all/OCR4all
歴史的な印刷物や初期の刊本の高品質なテキスト認識のために特別に設計された、半自動OCRワークフローを提供するオープンソースツール。
jakobwilm/slstudio
単一のカメラとプロジェクターを使用してリアルタイム3D構造光スキャナーを構築するためのオープンソースフレームワーク。
jenly1314/WeChatQRCode
OpenCVベースのWeChat QRエンジンを移植し、より高速なマルチコードスキャンとデコードを実現するAndroid用QRコード認識ライブラリ。
zju3dv/Wis3D
Wis3D は、コンピュータビジョン研究者向けのウェブベースの 3D 可視化ツールで、Python から 3D バウンディングボックス、点群、メッシュを直接インポートして表示できます。
D-Ogi/WatermarkRemover-AI
Florence-2とLaMAモデルを活用し、画像やAI生成動画から透かし(ウォーターマーク)を検出し、シームレスに除去するAIツールです。
zju3dv/LoG
LoGは、単一のRTX 4090 GPU上でGaussian Splattingを使用して、高精細な都市規模の3Dモデルを学習およびリアルタイムレンダリングするためのフレームワークです。
zju3dv/DetectorFreeSfM
従来の特徴点検出器に依存せず、画像から3Dシーンを再構築する検出器不要のStructure from Motion (SfM) システム。Image Matching Challenge 2023でトップの成績を収めました。
zju3dv/EasyMocap
RGBビデオからのマーカーレス人体動作キャプチャおよび新規視点合成のためのオープンソースツールボックス。マルチビュー設定からインターネット上のビデオまで、さまざまな入力ソースをサポートします。
zju3dv/GVHMR
GVHMRは、単眼ビデオから世界座標系に接地された3D人体動作を復元するSIGGRAPH-Asia 2024の研究コードベースです。視覚オドメトリ(DPVOまたはSimpleVO)と重力に合わせた座標系を組み合わせ、すぐに実行可能なデモスクリプト、Colab/HuggingFaceデモ、および3DPW、RICH、EMDBでのベンチマーク結果を再現するためのスクリプトを提供します。
zju3dv/EasyVolcap
ニューラルボリュームビデオ研究を加速するためのPyTorchライブラリ。ボリュームビデオのキャプチャ、再構成、レンダリングのためのツールを提供します。
zju3dv/snake
Deep Snakeは、学習可能なアクティブ・コンター(スネーク)モジュールを使用したリアルタイム・インスタンスセグメンテーションのためのオープンソースのCVPR 2020実装です。このリポジトリにはCityscapes、KITTI、SBDの事前学習済みモデルが含まれており、評価、速度テスト、可視化、デモ推論、およびトレーニング(Cityscapesは2段階、KITTI/SBDは1段階)のためのコマンドラインツールが提供されています。すべての機能はYAML設定ファイルによって駆動され、TensorBoardログによる監視も可能です。高速で正確なマスク予測を必要とする研究者やエンジニアに適しています。
nghorbani/amass
人体のモーションキャプチャのための統合データベースおよびツールキットであり、様々なマーカーベースのデータセットをアニメーションやディープラーニング学習のための共通フレームワークに統合します。
HenriquesLab/ZeroCostDL4Mic
顕微鏡研究者がコーディングの専門知識なしでディープラーニングネットワークを学習・利用できるようにする、グラフィカルインターフェースを備えた無料のオープンソース Google Colab ノートブックツールボックス。
zju3dv/OnePose_Plus_Plus
OnePose++ は、CADモデルを必要とせず、キーポイントを用いない1ショット物体ポーズ推定システムであり、物体の3次元位置と向きを決定します。
zju3dv/AutoRecon
AutoReconは、RGB画像のセットから個々のオブジェクトを自動的に発見し、ニューラルSDF表面として再構成し、標準的なメッシュファイルをエクスポートする研究用パイプラインです。粗いオブジェクト分解ステージ(AutoDecomp)と、nerfstudio/sdfstudioに基づくニューラル表面再構成ステージを組み合わせており、デモ、BlendedMVS、CO3Dデータセット用の実行可能スクリプトを提供しています。
naver/must3r
MUSt3Rは、マルチビュー3D再構成用の研究用Pythonライブラリです。DUSt3Rモデルを拡張し、対称処理、マルチレイヤーメモリ、オンラインカメラポーズ推定を追加することで、順序のない画像セットのオフライン再構成、およびビデオやウェブカメラストリームからのリアルタイムSLAMスタイルマッピングを可能にします。リポジトリにはインストールスクリプト、複数の事前学習済みViTベースのチェックポイント(224pxおよび512px)、Gradio/viserおよびOpen3Dデモインターフェース、完全なトレーニングパイプラインが含まれます。非営利ライセンスでリリースされており、データセット利用に制限があります。
lucidrains/perceiver-pytorch
PerceiverおよびPerceiver IOアーキテクチャ(および小さな実験的バリアント)を実装したPyTorchライブラリです。すぐに使えるPerceiver、PerceiverIO、PerceiverLMクラスを提供し、フーリエ位置エンコーディングをサポートしており、pip install perceiver-pytorchでインストール可能です。このリポジトリは、大規模なマルチモーダル入力を処理するための最先端のTransformerモデルに焦点を当てたAI/MLプロジェクトです。
zcablii/LSKNet
リモートセンシング向けの軽量な基盤バックボーンであり、Large Selective Kernelメカニズムを使用して受容野を動的に調整し、物体検出とセグメンテーションの精度を向上させます。
zju3dv/NeuralRecon-W
制御されていない現実世界の環境で撮影された画像から高品質な3Dメッシュを再構築するために設計されたニューラル3D再構築フレームワーク。
HongwenZhang/PyMAF
PyMAFおよびPyMAF-Xは、ピラミッド型メッシュアライメントフィードバックループを使用して、単眼画像や動画から3Dの人体ポーズと形状を回帰するためのフレームワークです。
zju3dv/ENeRF
ENeRFは、効率的なニューラルレンジアンスフィールドを実装する研究用コードベースであり、インタラクティブ(約20–50 FPS)な自由視点動画の実現を可能にします。DTUでの学習、特定スキャンやヒューマンキャプチャデータでのファインチューニング、標準指標による評価、リアルタイムレンダリング用GUIを提供します。データセットのダウンロード手順、事前学習済みDTUモデル、マルチGPU学習・評価の詳細コマンドを含みます。
PABannier/sam3.cpp
SAM 2、2.1、3およびEdgeTAMを使用した高パフォーマンスな画像および動画セグメンテーションのポータブルC++ライブラリ。PythonおよびCUDAの必要なし。
Joey-S-Liu/MedSAM3
境界ボックスやポイントを必要とせず、多様なモダリティにわたるターゲットを医療概念に基づいて識別・セグメントするテキストガイド付き医療画像セグメンテーションモデル
sunsmarterjie/yolov12
アテンションメカニズムの精度とCNNベースの検出器の速度を組み合わせた、アテンション中心のリアルタイム物体検出フレームワーク。
emilianavt/OpenSeeFace
OpenSeeFaceは、ONNXにエクスポートされたMobileNetV3モデルをベースにした、オープンソースのCPU専用フェイシャルランドマークトラッカー(66点)です。UDP経由でランドマーク、視線、瞬きのデータをストリーミングし、Unity、Godot、VSeeFaceなどでリアルタイムのアバターアニメーションを実現します。複数のモデルサイズにより、速度(最大213 fps)と精度のバランスを調整可能です。データ受信、ポイントの可視化、IK駆動、SVMベースの表情分類器のトレーニングを行うためのUnityコンポーネントが含まれています。低照度、ノイズ、部分的な遮蔽下でも堅牢に動作しますが、目元の精度は控えめで、30 fpsで1つの顔を追跡するとCPUコアを1つほぼ占有します。BSD-2-clauseライセンスで提供されています。
zju3dv/4K4D
新しい視点から動的シーンの高解像度4Kレンダリングを可能にするリアルタイム4Dビュー合成システム。
huggingface/gsplat.js
ブラウザで3D Gaussian SplattingデータをレンダリングするためのJavaScriptライブラリで、three.jsに似た高レベルなAPIを提供します。
FeiYull/TensorRT-Alpha
TensorRT‑Alphaは、主要なコンピュータビジョンモデル(YOLO、EfficientDet、U‑2‑Netなど)をPyTorchからONNX経由でTensorRTに変換し、マルチバッチ前処理、デコード、NMSを備えた推論パイプラインを提供するC++/CUDAツールキットです。Ubuntu 18.04およびWindows 10のGPU環境をターゲットとしています。
huridocs/pdf-document-layout-analysis
PDFのレイアウト解析、OCR、コンテンツ抽出を行うDockerベースのマイクロサービス。PDFを構造化されたMarkdownやHTMLに変換し、自動翻訳もサポートします。
zju3dv/street_gaussians
Street Gaussiansは、3-D Gaussian splattingを拡張し、動的な街路シーン(Waymoデータなど)を再構築およびレンダリングするための研究グレードのコードベースです。データ変換ツール、学習/評価スクリプト、オプションのLiDAR深度/スカイマスク前処理機能を提供し、すべて設定可能なYAMLパイプラインでラップされています。
zju3dv/InfiniDepth
InfiniDepthは、単一のRGB画像(またはRGB+疎な深度)を任意の解像度の深度マップおよび3D Gaussian‑splattingモデルに変換するCVPR‑2026プロジェクトです。すぐに実行可能な推論スクリプト、Hugging Face Gradioデモ、マルチビュービデオ処理、およびカスタムデータでのファインチューニング用の完全なトレーニングパイプラインを提供します。