Xiaoqi-Zhao-DLUT/MSNet-M2SNet
一個包含 MSNet 與 M2SNet 架構的醫療影像分割框架,利用多尺度減法技術,精準分離息肉與肺部感染等病灶。
MrBlankness/LightM-UNet
LightM-UNet 是 UNet 與 Mamba 的輕量級融合模型,僅用 1M 參數即可實現高性能量醫學影像分割。
OvidijusParsiunas/myvision
一款免費的線上圖像標註工具,用於生成電腦視覺機器學習訓練數據,支援自動邊界框生成與數據集格式轉換。
laugh12321/TensorRT-YOLO
一個針對 NVIDIA 裝置上 YOLO 系列模型的高效能推論部署工具,使用 TensorRT 和 CUDA 最佳化前處理與後處理。
xiaofengShi/CHINESE-OCR
一個用於自然場景中文OCR的綜合性流程,結合文字方向檢測、CTPN區域檢測與CRNN端對端字元識別。
guochengqian/openpoints
一個用於基準測試與重現基於點的點雲理解方法的程式庫,為 PointNet 和 PointNeXt 等模型提供標準化引擎。
oculus-samples/Unity-PassthroughCameraApiSamples
一組 Unity 範例,展示如何使用 Quest 3/3S 頭戴裝置的 Passthrough Camera API 來存取原始相機資料與元資料,以應用於 MR 應用程式。
CNES/cars
CARS 是一個開源的多視角立體框架,利用攝影測量技術從衛星影像生成數位表面模型(DSM)。
photonixapp/photonix
一款使用物件辨識與色彩分析自動組織與過濾照片集合的自架設照片管理應用
Xiaohan-Chen/bear_fault_diagnosis
使用振動資料診斷旋轉機械軸承故障的多尺度 CNN-LSTM 模型的 PyTorch 實作。
ShiqiYu/OpenGait
一個靈活且可擴展的步態分析框架,用於人類識別和健康篩查,支援輪廓、骨架和LiDAR點雲等多種模態。
jinlife/Synology_Photos_Face_Patch
一個繞過 GPU 要求的補丁,讓不支援的 Synology NAS 硬體也能在 Synology Photos 中啟用人臉與物件辨識功能。
YuChuang1205/PAL
一種用於紅外線小目標檢測的漸進式主動學習框架,僅需單點監督即可使模型達到高性能量,無需完整掩碼。
azxcvn/mpv-android-anime4k
基於 libmpv 的 Android 影片播放器,利用 Anime4K 算法為動畫與動畫影片提供即時超解析度放大。
oculix-org/SikuliX1
一款基於電腦視覺的自動化工具,透過影像辨識來識別並與螢幕元素進行互動,以模擬滑鼠與鍵盤輸入。
ruoyuw22-byte/NeuroMorph-Assessment
一個整合 CAT12 處理的自動化結構式 MRI 形態計量系統,用於測量腦組織體積並生成定量報告。
hcliucs/APSD
一個以人為中心的框架,用於評估影像中對抗性擾動的隱蔽性,並包含一個新數據集 (APSD) 和一個基於注意力機制的預測模型 (A2SM)。
OCR4all/OCR4all
一個開源工具,提供專為歷史印刷品和早期印本的高品質文字識別而設計的半自動 OCR 工作流程。
jakobwilm/slstudio
一個用於構建即時 3D 結構光掃描儀的開源框架,僅需單一相機與投影機。
jenly1314/WeChatQRCode
一個 Android QR Code 識別庫,移植了基於 OpenCV 的微信 QR Code 引擎,實現更快速的多碼掃描與解碼。
zju3dv/Wis3D
Wis3D 是一個基於網頁的 3D 視覺化工具,專為電腦視覺研究人員設計,可從 Python 直接匯入並檢視 3D 邊界框、點雲和網格。
D-Ogi/WatermarkRemover-AI
一款由 AI 驅動的工具,利用 Florence-2 和 LaMA 模型來檢測並無縫移除圖像及 AI 生成影片中的浮水印。
zju3dv/LoG
LoG 是一個使用 Gaussian Splatting 在單張 RTX 4090 GPU 上訓練並即時渲染高擬真城市規模 3D 模型的框架。
zju3dv/DetectorFreeSfM
一個無需特徵檢測器的運動恢復結構 (SfM) 系統,無需依賴傳統特徵檢測器即可從圖像重建 3D 場景,並在 2023 年圖像匹配挑戰賽中獲得頂尖成績。
zju3dv/EasyMocap
一個用於無標記人體動作捕捉和從 RGB 影片進行新視角合成的開源工具箱,支援從多視角設置到網路影片等多種輸入源。
zju3dv/GVHMR
GVHMR 是一個 SIGGRAPH-Asia 2024 的研究代碼庫,用於從單眼影片中恢復世界座標系下的 3D 人體動作。它結合了視覺里程計(DPVO 或 SimpleVO)與重力對齊的座標系統,提供可直接執行的演示腳本、Colab/HuggingFace 演示,以及用於在 3DPW、RICH 和 EMDB 上重現基準測試結果的腳本。
zju3dv/EasyVolcap
一個用於加速神經體積視訊研究的 PyTorch 函式庫,提供捕捉、重建與渲染體積視訊的工具。
zju3dv/snake
Deep Snake 是一個開源的 CVPR 2020 實作,利用可學習的主動輪廓 (snake) 模組進行即時實例分割。該儲存庫提供 Cityscapes、KITTI 和 SBD 的預訓練模型,並提供用於評估、速度測試、視覺化、演示推論和訓練(Cityscapes 為兩階段,KITTI/SBD 為單階段)的命令列工具。所有功能均由 YAML 設定檔驅動,並支援 TensorBoard 日誌監控。適合需要快速、準確遮罩預測的研究人員與工程師。
nghorbani/amass
一個用於人體動作捕捉的統一資料庫與工具包,將各種基於標記的資料集整合至一個用於動畫製作與深度學習訓練的通用框架中。
HenriquesLab/ZeroCostDL4Mic
一套免費且開源的 Google Colab 筆記本工具箱,具備圖形化介面,讓顯微鏡研究人員無需程式設計專業知識即可訓練並使用深度學習網路。
zju3dv/OnePose_Plus_Plus
OnePose++ 是一種無需 CAD 模型、無關鍵點的單次物體姿態估計系統,可確定物體的 3D 位置和方向。
zju3dv/AutoRecon
AutoRecon 是一個研究級管道,可自動發現一組 RGB 圖像中的個別物件,並重建為神經 SDF 表面,匯出標準網格檔案。它結合了粗略物件分解階段(AutoDecomp)與基於 nerfstudio/sdfstudio 的神經表面重建階段,並提供可用於示範、BlendedMVS 與 CO3D 資料集的即用型指令碼。
naver/must3r
MUSt3R 是一個研究級 Python 庫,用於多視角 3D 重建。它在 DUSt3R 模型基礎上擴展了對稱處理、多層記憶與線上位姿估計,支援無序影像集的離線重建,以及影片或網路攝影機串流的即時 SLAM 風格地圖。該倉儲提供安裝指令碼、多個預訓練的 ViT 基礎檢查點(224px 與 512px)、Gradio/viser 與 Open3D 示範介面,以及完整的訓練流程。採用非商業授權發布,資料集使用條款具有限制性。
lucidrains/perceiver-pytorch
一個實作 Perceiver 和 Perceiver IO 架構(以及一個小型實驗性變體)的 PyTorch 函式庫。它提供開箱即用的 Perceiver、PerceiverIO 和 PerceiverLM 類別,支援傅立葉位置編碼,並可透過 pip install perceiver-pytorch 安裝。此儲存庫是一個專注於處理大型多模態輸入的前沿 Transformer 模型 AI/ML 專案。
zcablii/LSKNet
一個用於遙測的輕量級基礎骨幹網絡,利用大型選擇性核機制動態調整感受野,以實現更好的目標檢測與分割。
zju3dv/NeuralRecon-W
一個神經 3D 重建框架,旨在從非受控的真實世界環境中拍攝的圖像重建高品質 3D 網格。
HongwenZhang/PyMAF
PyMAF 和 PyMAF-X 是利用金字塔網格對齊反饋迴路,從單眼影像和影片中回歸 3D 人體姿勢與形狀的框架。
zju3dv/ENeRF
ENeRF 是一個研究用程式碼庫,實作高效神經輻射場,支援互動式(約 20–50 FPS)自由視角影片。提供在 DTU 上訓練、在特定掃描或人體捕捉資料上微調、使用標準指標評估,以及即時渲染用 GUI。該倉儲包含資料集下載說明、預訓練 DTU 模型,以及多 GPU 訓練與評估的詳細指令。
PABannier/sam3.cpp
使用SAM 2、2.1、3與EdgeTAM的高效率影像與影片分割可攜式C++函式庫,無需Python與CUDA。
Joey-S-Liu/MedSAM3
一種不需邊界框或點,即可透過醫學概念在多樣模態中識別與分割目標的文本引導醫學影像分割模型
sunsmarterjie/yolov12
一個以注意力機制為核心的即時物件偵測框架,結合了注意力機制的準確性與基於 CNN 偵測器的速度。
emilianavt/OpenSeeFace
OpenSeeFace 是一個開源、僅使用 CPU 的臉部特徵點追蹤器(66 個點),基於匯出為 ONNX 的 MobileNetV3 模型構建。它透過 UDP 串流傳輸特徵點、視線和眨眼數據,用於 Unity、Godot、VSeeFace 等軟體中的即時虛擬角色動畫。多種模型尺寸讓您可以在速度(最高 213 fps)與準確度之間取得平衡。該專案包含用於接收數據、視覺化特徵點、驅動 IK 以及訓練小型基於 SVM 表情分類器的 Unity 組件。它在低光、雜訊和部分遮擋下表現穩健,但眼部區域的精度一般,且以 30 fps 追蹤單一人臉可能會佔用一個完整的 CPU 核心。採用 BSD-2-clause 授權。
zju3dv/4K4D
一個即時 4D 視角合成系統,能夠從新視角對動態場景進行高解析度 4K 渲染。
huggingface/gsplat.js
一個用於在瀏覽器中渲染 3D Gaussian Splatting 數據的 JavaScript 函式庫,提供類似 three.js 的高階 API。
FeiYull/TensorRT-Alpha
TensorRT‑Alpha 是一個 C++/CUDA 工具包,可將熱門的電腦視覺模型(如 YOLO、EfficientDet、U‑2‑Net 等)從 PyTorch 轉換為 ONNX 再轉至 TensorRT,並提供包含多批次預處理、解碼與 NMS 的現成推論管線,適用於 Ubuntu 18.04 與 Windows 10 GPU 環境。
huridocs/pdf-document-layout-analysis
一個基於 Docker 的微服務,用於 PDF 版面分析、OCR 和內容提取,可將 PDF 轉換為結構化的 Markdown 或 HTML,並支援自動翻譯。
zju3dv/street_gaussians
Street Gaussians 是一個研究級代碼庫,將 3-D Gaussian splatting 擴展至重建與渲染動態街景(例如 Waymo 數據)。它提供數據轉換工具、訓練/評估腳本,以及可選的 LiDAR 深度/天空遮罩預處理功能,並透過可配置的 YAML 管道進行封裝。
zju3dv/InfiniDepth
InfiniDepth 是一個 CVPR‑2026 專案,能將單張 RGB 影像(或 RGB 加稀疏深度圖)轉換為任意解析度的深度圖與 3D Gaussian‑splatting 模型。它提供開箱即用的推論腳本、Hugging Face Gradio 演示、多視角影片處理,以及用於自訂資料微調的完整訓練流程。