yuanze-lin/Olympus
一个计算机视觉的通用任务路由器,可将单一自然语言指令转换为一系列专业模型调用,以生成图像、视频和3D模型。
Jumpat/SegAnyGAussians
SAGA 是一个用于分割 3D 高斯溶射场景的框架,允许用户通过交互点提示或开放词汇文本查询来隔离 3D 对象。
jasmcaus/caer
Caer 是一个仅使用 Python、GPU 加速的计算机视觉库,提供快速的图像/视频工具(缩放、颜色转换、增强等),拥有干净、类型检查的 API。它可以替代 OpenCV 用于研究原型,通过 `pip` 安装,采用 MIT 许可证。
Pbatch/ClashRoyaleBuildABot
一个用于皇室冲突的自动化机器人,使用先进的状态生成器和目标检测,用于教育和研究目的。
adipandas/multi-object-tracker
一个 Python 库,提供易于使用的多目标跟踪算法实现和基于 OpenCV 的目标检测器,用于视频分析。
parkpow/deep-license-plate-recognition
一组示例客户端和操作实用工具,用于将 Plate Recognizer 的车牌识别 API 集成到图像和视频流中。
VisualComputingInstitute/diffusion-e2e-ft
一个将图像条件扩散模型微调为单步确定性估计器的框架,实现快速、准确的深度和表面法线估计。
shoumikchow/bbox-visualizer
一个支持 VOC、COCO 和 YOLO 格式的 Python 包,用于在图像上绘制带标签的边界框,简化目标检测的可视化过程。
hysts/pytorch_mpiigaze_demo
一个用于注视点估计的演示程序,使用预训练模型来追踪人在图像和视频中注视的位置。
hysts/pytorch_mpiigaze
A PyTorch implementation of gaze estimation methods from the MPIIGaze and MPIIFaceGaze papers for training and evaluation of appearance-based gaze tracking.
luxonis/depthai-ros
Luxonis OAK 相机的 ROS 集成,使机器人系统能够使用硬件加速的 AI 与深度感知。
FluxML/Metalhead.jl
Flux.jl 的标准机器学习视觉模型库,提供 ResNet、ViT 和 EfficientNet 等热门架构的实现。
Karine-Huang/T2I-CompBench
一个针对文本生成图像模型(text-to-image generation models)的全面基准测试与评估套件,重点关注其处理复杂组合式提示词、属性绑定以及空间关系的能力。
frgfm/holocron
一个提供近期深度学习技巧与计算机视觉任务模型架构的高质量 PyTorch 实现库。
rapidsai/cucim
cuCIM 是一个 GPU 加速的计算机视觉和图像处理库,专为生物医学、地理空间和遥感应用中使用的大型多维图像而设计。
theICTlab/3DUNDERWORLD-SLS-GPU_CPU
一个结构光扫描工具,可从受图案光照射的物体图像中重建 3D 点云,支持 CPU 与 GPU 加速。
alicevision/popsift
一个使用 CUDA 加速的 SIFT 算法实现,可实时进行图像特征提取。
rgeirhos/Stylized-ImageNet
一个用于创建 Stylized-ImageNet 的工具,该版本的 ImageNet 会扭曲纹理,以鼓励 CNN 更优先考虑对象形状而非纹理,从而提升鲁棒性。
VSLAM-LAB/VSLAM-LAB
一个全面的视觉 SLAM 框架,可简化在多个数据集上对多种基线算法的安装、执行和评估流程。
l3p-cv/lost
一个灵活的、基于网页的协作图像标注框架,支持半自动化流水线以加速机器学习数据集的标注。
genicam/harvesters
一个用于简化计算机视觉应用中图像采集的 Python 库,通过提供符合 GenICam 标准的设备统一接口来实现。
basler/pypylon
Basler pylon C++ API 的官方 Python 绑定,使 Python 应用程序能够控制 Basler 机器视觉相机并执行图像处理任务。
cyrusbehr/YOLOv8-TensorRT-CPP
一个使用 TensorRT 的 C++ 实现 YOLOv8,以高性能 GPU 推理为目标,支持目标检测、语义分割和姿态估计。
jenissimo/unfake.js
一个 JavaScript 库和浏览器工具,可清理 AI 生成的像素艺术,并将光栅图像转换为干净、可扩展的 SVG。
insight-platform/Savant
一个高层框架,用于在 Nvidia 硬件上构建实时、高性能的计算机视觉和视频分析管道,抽象化 DeepStream 的复杂性。
luispedro/mahotas
一个以 C++ 实现的快速 Python 计算机视觉库,提供超过 100 种在 NumPy 数组上运行的图像处理算法。
opendatacam/opendatacam
一个开源的计算机视觉工具,能够检测、跟踪并计数视频流中的移动物体,以量化现实世界的运动,常用于交通研究。
Visionary-Laboratory/visionary
一个基于 WebGPU 的平台,使用 ONNX Runtime 在浏览器中直接进行 Gaussian Splatting 变体和 3D meshes 的实时渲染。
open-edge-platform/geti_v2
Geti 是一个端到端的计算机视觉平台,可简化从智能数据标注和主动学习到模型训练和边缘部署的整个 AI 生命周期。
Koldim2001/YOLO-Patch-Based-Inference
一个 Python 库,通过图像切片和结果合并,实现基于补丁的 YOLO 推理,从而提升在大图像中对小目标的检测能力。
zhiqwang/yolort
一个为 YOLOv5 设计的运行时堆栈,通过将预处理和后处理嵌入到模型图中,简化了各种硬件加速器的目标检测部署。
VIAME/VIAME
VIAME 是一个开源计算机视觉工具包,通过模块化、多语言的管道框架,提供检测、跟踪、标注、搜索以及许多其他图像/视频处理功能。它附带桌面版和网页版图形界面、命令行工具、预构建二进制文件和 Docker 镜像,并可通过 C++、Python 或 MATLAB 插件进行扩展。
azavea/raster-vision
一个使用 PyTorch 的 Python 库和低代码框架,用于在卫星、航空和无人机影像上构建计算机视觉模型。
opengeos/segment-geospatial
一个 Python 包,将 Segment Anything Model (SAM) 适配为地理空间数据使用,使得通过文本、点或框即可轻松分割卫星影像。
orbbec/OrbbecSDK
适用于 Orbbec 3D 相机的软件开发工具包,使开发者能够跨多种设备系列捕获数据流并控制硬件。
layumi/Person_reID_baseline_pytorch
一个轻量且强大的 PyTorch 基准,用于对象和人员再识别,提供一套完整的架构和损失函数,适用于跨摄像头对象检索。
google-research/augmix
AugMix 是一种数据处理技术,通过混合增强图像并强制执行一致的嵌入,来提高图像分类模型的鲁棒性和不确定性校准。
spytensor/plants_disease_detection
一个基于 PyTorch 的图像分类流水线,用于检测作物病害,具有 ResNet50 骨干网络和现代 PyTorch 2.x 优化。
openclimatefix/metnet
Google Research 的 MetNet 模型的 PyTorch 实现,用于利用卫星和大气数据进行短期和全球降水预测。
FORTH-ModelBasedTracker/MocapNET
实时 2D‑to‑3D 人体姿态估计器,将 RGB 视频流转换为标准 BVH 动作捕捉文件,用于 3D 动画。
andrewssobral/bgslibrary
一个全面的 C++ 框架,用于计算机视觉中的背景减除,提供超过 40 种算法来检测视频流中的移动对象。
zhanghang1989/ResNeSt
一种 ResNet 的分拆注意力网络变种,可提升计算机视觉任务(如目标检测和语义分割)的性能。
apple-aiml-research/ml-facelit
FaceLit 是一个神经 3D 渲染项目,能够生成在不同光照条件下可真实重照明的高质量面部图像。
MrGiovanni/SuPreM
一套用于 3D 医疗影像监督式预训练的预训练 3D 模型套件与 AbdomenAtlas 1.1 数据集,旨在提升器官与肿瘤分割的准确度。
MrGiovanni/ModelsGenesis
一种在无标签CT和MRI扫描上预训练3D模型的自监督学习框架,用于创建医学图像分割和分类的基础模型。
rafaelpadilla/Object-Detection-Metrics
提供 PASCAL VOC 和 COCO 等流行物体检测指标(如平均精度和 IOU)的标准化、易用实现,确保在不同数据集间的一致性基准测试。
luxonis/depthai
depthai 库是 Luxonis 平台的软件框架,使开发者能够在 Luxonis 硬件上创建 AI 和计算机视觉应用程序。
Xiaoqi-Zhao-DLUT/MSNet-M2SNet
一个包含 MSNet 和 M2SNet 架构的医疗图像分割框架,利用多尺度减法技术,精准分离息肉和肺部感染等病灶。