luxonis/depthai
depthai 库是 Luxonis 平台的软件框架,使开发者能够在 Luxonis 硬件上创建 AI 和计算机视觉应用程序。
Xiaoqi-Zhao-DLUT/MSNet-M2SNet
一个包含 MSNet 和 M2SNet 架构的医疗图像分割框架,利用多尺度减法技术,精准分离息肉和肺部感染等病灶。
MrBlankness/LightM-UNet
LightM-UNet 是 UNet 与 Mamba 的轻量级融合模型,仅用 1M 参数即可实现高性能医学图像分割。
OvidijusParsiunas/myvision
一款免费的在线图像标注工具,用于生成计算机视觉机器学习训练数据,支持自动边界框生成和数据集格式转换。
laugh12321/TensorRT-YOLO
一个针对 NVIDIA 设备上 YOLO 系列模型的高性能推理部署工具,使用 TensorRT 和 CUDA 优化预处理和后处理。
xiaofengShi/CHINESE-OCR
一个用于自然场景中文OCR的综合性流水线,结合了文本方向检测、CTPN区域检测和CRNN端到端字符识别。
guochengqian/openpoints
一个用于基准测试和复现基于点的点云理解方法的库,为 PointNet 和 PointNeXt 等模型提供标准化引擎。
oculus-samples/Unity-PassthroughCameraApiSamples
一组 Unity 样例,展示如何使用 Quest 3/3S 头显的 Passthrough Camera API 来访问原始摄像头数据和元数据,用于 MR 应用程序。
CNES/cars
CARS 是一个开源的多视图立体视觉框架,利用摄影测量法从卫星影像生成数字表面模型(DSM)。
photonixapp/photonix
一款使用对象识别和颜色分析自动组织和过滤照片集合的自托管照片管理应用
Xiaohan-Chen/bear_fault_diagnosis
使用振动数据诊断旋转机械轴承故障的多尺度 CNN-LSTM 模型的 PyTorch 实现。
ShiqiYu/OpenGait
一个灵活且可扩展的步态分析框架,用于人类识别和健康筛查,支持轮廓、骨架和LiDAR点云等多种模态。
jinlife/Synology_Photos_Face_Patch
一个绕过 GPU 要求的补丁,使不支持的 Synology NAS 硬件也能在 Synology Photos 中启用人脸和物体识别功能。
YuChuang1205/PAL
一种用于红外小目标检测的渐进式主动学习框架,仅需单点监督即可使模型达到高性能,无需完整掩码。
azxcvn/mpv-android-anime4k
基于 libmpv 的 Android 视频播放器,利用 Anime4K 算法为动画和动画视频提供实时超分辨率放大。
oculix-org/SikuliX1
一款基于计算机视觉的自动化工具,通过图像识别来识别并与屏幕元素进行交互,以模拟鼠标和键盘输入。
ruoyuw22-byte/NeuroMorph-Assessment
一个集成 CAT12 处理的自动化结构式 MRI 形态计量系统,用于测量脑组织体积并生成定量报告。
hcliucs/APSD
一个以人为中心的框架,用于评估图像中对抗性扰动的隐蔽性,并包含一个新数据集 (APSD) 和一个基于注意力机制的预测模型 (A2SM)。
OCR4all/OCR4all
一个开源工具,提供专为历史印刷品和早期印本的高质量文字识别而设计的半自动 OCR 工作流程。
jakobwilm/slstudio
一个用于构建实时 3D 结构光扫描仪的开源框架,仅需单一相机与投影仪。
jenly1314/WeChatQRCode
一个 Android QR Code 识别库,移植了基于 OpenCV 的微信 QR Code 引擎,实现更快速的多码扫描与解码。
zju3dv/Wis3D
Wis3D 是一个基于网页的 3D 可视化工具,专为计算机视觉研究人员设计,可从 Python 直接导入并查看 3D 边界框、点云和网格。
D-Ogi/WatermarkRemover-AI
一款由 AI 驱动的工具,利用 Florence-2 和 LaMA 模型来检测并无缝移除图像及 AI 生成视频中的水印。
zju3dv/LoG
LoG 是一个使用 Gaussian Splatting 在单张 RTX 4090 GPU 上训练并实时渲染高拟真城市规模 3D 模型的框架。
zju3dv/DetectorFreeSfM
一个无需特征检测器的运动恢复结构 (SfM) 系统,无需依赖传统特征检测器即可从图像重建 3D 场景,并在 2023 年图像匹配挑战赛中获得顶尖成绩。
zju3dv/EasyMocap
一个用于无标记人体动作捕捉和从 RGB 视频进行新视角合成的开源工具箱,支持从多视角设置到互联网视频等多种输入源。
zju3dv/GVHMR
GVHMR 是一个 SIGGRAPH-Asia 2024 的研究代码库,用于从单目视频中恢复世界坐标系下的 3D 人体动作。它结合了视觉里程计(DPVO 或 SimpleVO)与重力对齐的坐标系统,提供可直接运行的演示脚本、Colab/HuggingFace 演示,以及用于在 3DPW、RICH 和 EMDB 上复现基准测试结果的脚本。
zju3dv/EasyVolcap
一个用于加速神经体积视频研究的 PyTorch 库,提供捕捉、重建和渲染体积视频的工具。
zju3dv/snake
Deep Snake 是一个开源的 CVPR 2020 实现,利用可学习的主动轮廓 (snake) 模块进行实时实例分割。该仓库提供 Cityscapes、KITTI 和 SBD 的预训练模型,并提供用于评估、速度测试、可视化、演示推理和训练(Cityscapes 为两阶段,KITTI/SBD 为单阶段)的命令行工具。所有功能均由 YAML 配置文件驱动,并支持 TensorBoard 日志监控。适合需要快速、准确掩码预测的研究人员与工程师。
nghorbani/amass
一个用于人体动作捕捉的统一数据库与工具包,将各种基于标记的数据集整合至一个用于动画制作与深度学习训练的通用框架中。
HenriquesLab/ZeroCostDL4Mic
一套免费且开源的 Google Colab 笔记本工具箱,具备图形化界面,让显微镜研究人员无需编程专业知识即可训练并使用深度学习网络。
zju3dv/OnePose_Plus_Plus
OnePose++ 是一种无需 CAD 模型、无关键点的单次物体姿态估计系统,可确定物体的 3D 位置和方向。
zju3dv/AutoRecon
AutoRecon 是一个研究级管道,可自动发现一组 RGB 图像中的个体对象,并将其重建为神经 SDF 表面,导出标准网格文件。它结合了粗略对象分解阶段(AutoDecomp)和基于 nerfstudio/sdfstudio 的神经表面重建阶段,并提供用于演示、BlendedMVS 和 CO3D 数据集的即用型脚本。
naver/must3r
MUSt3R 是一个研究级 Python 库,用于多视图 3D 重建。它在 DUSt3R 模型基础上扩展了对称处理、多层记忆和在线位姿估计,支持无序图像集的离线重建以及视频或网络摄像头流的实时 SLAM 风格映射。该仓库提供安装脚本、多个预训练的 ViT 基础检查点(224px 和 512px)、Gradio/viser 和 Open3D 演示界面,以及完整的训练流程。采用非商业许可证发布,数据集使用条款具有限制性。
lucidrains/perceiver-pytorch
一个实现 Perceiver 和 Perceiver IO 架构(以及一个小型实验性变体)的 PyTorch 库。它提供开箱即用的 Perceiver、PerceiverIO 和 PerceiverLM 类,支持傅立叶位置编码,并可通过 pip install perceiver-pytorch 安装。此仓库是一个专注于处理大型多模态输入的前沿 Transformer 模型 AI/ML 项目。
zcablii/LSKNet
一个用于遥感的轻量级基础骨干网络,利用大型选择性核机制动态调整感受野,以实现更好的目标检测与分割。
zju3dv/NeuralRecon-W
一个神经 3D 重建框架,旨在从非受控的真实世界环境中拍摄的图像重建高质量 3D 网格。
HongwenZhang/PyMAF
PyMAF 和 PyMAF-X 是利用金字塔网格对齐反馈回路,从单眼图像和视频中回归 3D 人体姿势与形状的框架。
zju3dv/ENeRF
ENeRF是一个研究代码库,实现了高效神经辐射场,支持交互式(约20–50 FPS)自由视角视频。它提供在DTU上训练、在特定扫描或人体捕获数据上微调、使用标准指标评估以及实时渲染的GUI。该仓库包含数据集下载说明、预训练DTU模型,以及多GPU训练和评估的详细命令。
PABannier/sam3.cpp
使用SAM 2、2.1、3和EdgeTAM的高性能图像和视频分割的便携式C++库,无需Python和CUDA。
Joey-S-Liu/MedSAM3
一种无需边界框或点即可通过医学概念在多种模态中识别和分割目标的文本引导医学图像分割模型
sunsmarterjie/yolov12
一个以注意力机制为核心的实时目标检测框架,结合了注意力机制的准确性与基于 CNN 检测器的速度。
emilianavt/OpenSeeFace
OpenSeeFace 是一个开源、仅使用 CPU 的面部特征点追踪器(66 个点),基于导出为 ONNX 的 MobileNetV3 模型构建。它通过 UDP 流传输特征点、视线和眨眼数据,用于 Unity、Godot、VSeeFace 等软件中的实时虚拟角色动画。多种模型尺寸让您可以在速度(最高 213 fps)与准确度之间取得平衡。该项目包含用于接收数据、可视化特征点、驱动 IK 以及训练小型基于 SVM 表情分类器的 Unity 组件。它在低光、噪声和部分遮挡下表现稳健,但眼部区域的精度一般,且以 30 fps 追踪单一人脸可能会占用一个完整的 CPU 核心。采用 BSD-2-clause 授权。
zju3dv/4K4D
一个实时 4D 视角合成系统,能够从新视角对动态场景进行高分辨率 4K 渲染。
huggingface/gsplat.js
一个用于在浏览器中渲染 3D Gaussian Splatting 数据的 JavaScript 库,提供类似 three.js 的高阶 API。
FeiYull/TensorRT-Alpha
TensorRT‑Alpha 是一个 C++/CUDA 工具包,可将热门的计算机视觉模型(如 YOLO、EfficientDet、U‑2‑Net 等)从 PyTorch 转换为 ONNX 再转至 TensorRT,并提供包含多批次预处理、解码与 NMS 的现成推理管线,适用于 Ubuntu 18.04 与 Windows 10 GPU 环境。
huridocs/pdf-document-layout-analysis
一个基于 Docker 的微服务,用于 PDF 版面分析、OCR 和内容提取,可将 PDF 转换为结构化的 Markdown 或 HTML,并支持自动翻译。
zju3dv/street_gaussians
Street Gaussians 是一个研究级代码库,将 3-D Gaussian splatting 扩展至重建与渲染动态街景(例如 Waymo 数据)。它提供数据转换工具、训练/评估脚本,以及可选的 LiDAR 深度/天空遮罩预处理功能,并透过可配置的 YAML 管道进行封装。