yuanze-lin/Olympus

一个计算机视觉的通用任务路由器,可将单一自然语言指令转换为一系列专业模型调用,以生成图像、视频和3D模型。

Jumpat/SegAnyGAussians

SAGA 是一个用于分割 3D 高斯溶射场景的框架,允许用户通过交互点提示或开放词汇文本查询来隔离 3D 对象。

jasmcaus/caer

Caer 是一个仅使用 Python、GPU 加速的计算机视觉库,提供快速的图像/视频工具(缩放、颜色转换、增强等),拥有干净、类型检查的 API。它可以替代 OpenCV 用于研究原型,通过 `pip` 安装,采用 MIT 许可证。

Pbatch/ClashRoyaleBuildABot

一个用于皇室冲突的自动化机器人,使用先进的状态生成器和目标检测,用于教育和研究目的。

adipandas/multi-object-tracker

一个 Python 库,提供易于使用的多目标跟踪算法实现和基于 OpenCV 的目标检测器,用于视频分析。

parkpow/deep-license-plate-recognition

一组示例客户端和操作实用工具,用于将 Plate Recognizer 的车牌识别 API 集成到图像和视频流中。

VisualComputingInstitute/diffusion-e2e-ft

一个将图像条件扩散模型微调为单步确定性估计器的框架,实现快速、准确的深度和表面法线估计。

shoumikchow/bbox-visualizer

一个支持 VOC、COCO 和 YOLO 格式的 Python 包,用于在图像上绘制带标签的边界框,简化目标检测的可视化过程。

hysts/pytorch_mpiigaze_demo

一个用于注视点估计的演示程序,使用预训练模型来追踪人在图像和视频中注视的位置。

hysts/pytorch_mpiigaze

A PyTorch implementation of gaze estimation methods from the MPIIGaze and MPIIFaceGaze papers for training and evaluation of appearance-based gaze tracking.

luxonis/depthai-ros

Luxonis OAK 相机的 ROS 集成,使机器人系统能够使用硬件加速的 AI 与深度感知。

FluxML/Metalhead.jl

Flux.jl 的标准机器学习视觉模型库,提供 ResNet、ViT 和 EfficientNet 等热门架构的实现。

Karine-Huang/T2I-CompBench

一个针对文本生成图像模型(text-to-image generation models)的全面基准测试与评估套件,重点关注其处理复杂组合式提示词、属性绑定以及空间关系的能力。

frgfm/holocron

一个提供近期深度学习技巧与计算机视觉任务模型架构的高质量 PyTorch 实现库。

rapidsai/cucim

cuCIM 是一个 GPU 加速的计算机视觉和图像处理库,专为生物医学、地理空间和遥感应用中使用的大型多维图像而设计。

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

一个结构光扫描工具,可从受图案光照射的物体图像中重建 3D 点云,支持 CPU 与 GPU 加速。

alicevision/popsift

一个使用 CUDA 加速的 SIFT 算法实现,可实时进行图像特征提取。

rgeirhos/Stylized-ImageNet

一个用于创建 Stylized-ImageNet 的工具,该版本的 ImageNet 会扭曲纹理,以鼓励 CNN 更优先考虑对象形状而非纹理,从而提升鲁棒性。

VSLAM-LAB/VSLAM-LAB

一个全面的视觉 SLAM 框架,可简化在多个数据集上对多种基线算法的安装、执行和评估流程。

l3p-cv/lost

一个灵活的、基于网页的协作图像标注框架,支持半自动化流水线以加速机器学习数据集的标注。

genicam/harvesters

一个用于简化计算机视觉应用中图像采集的 Python 库,通过提供符合 GenICam 标准的设备统一接口来实现。

basler/pypylon

Basler pylon C++ API 的官方 Python 绑定,使 Python 应用程序能够控制 Basler 机器视觉相机并执行图像处理任务。

cyrusbehr/YOLOv8-TensorRT-CPP

一个使用 TensorRT 的 C++ 实现 YOLOv8,以高性能 GPU 推理为目标,支持目标检测、语义分割和姿态估计。

jenissimo/unfake.js

一个 JavaScript 库和浏览器工具,可清理 AI 生成的像素艺术,并将光栅图像转换为干净、可扩展的 SVG。

insight-platform/Savant

一个高层框架,用于在 Nvidia 硬件上构建实时、高性能的计算机视觉和视频分析管道,抽象化 DeepStream 的复杂性。

luispedro/mahotas

一个以 C++ 实现的快速 Python 计算机视觉库,提供超过 100 种在 NumPy 数组上运行的图像处理算法。

opendatacam/opendatacam

一个开源的计算机视觉工具,能够检测、跟踪并计数视频流中的移动物体,以量化现实世界的运动,常用于交通研究。

Visionary-Laboratory/visionary

一个基于 WebGPU 的平台,使用 ONNX Runtime 在浏览器中直接进行 Gaussian Splatting 变体和 3D meshes 的实时渲染。

open-edge-platform/geti_v2

Geti 是一个端到端的计算机视觉平台,可简化从智能数据标注和主动学习到模型训练和边缘部署的整个 AI 生命周期。

Koldim2001/YOLO-Patch-Based-Inference

一个 Python 库,通过图像切片和结果合并,实现基于补丁的 YOLO 推理,从而提升在大图像中对小目标的检测能力。

zhiqwang/yolort

一个为 YOLOv5 设计的运行时堆栈,通过将预处理和后处理嵌入到模型图中,简化了各种硬件加速器的目标检测部署。

VIAME/VIAME

VIAME 是一个开源计算机视觉工具包,通过模块化、多语言的管道框架,提供检测、跟踪、标注、搜索以及许多其他图像/视频处理功能。它附带桌面版和网页版图形界面、命令行工具、预构建二进制文件和 Docker 镜像,并可通过 C++、Python 或 MATLAB 插件进行扩展。

azavea/raster-vision

一个使用 PyTorch 的 Python 库和低代码框架,用于在卫星、航空和无人机影像上构建计算机视觉模型。

opengeos/segment-geospatial

一个 Python 包,将 Segment Anything Model (SAM) 适配为地理空间数据使用,使得通过文本、点或框即可轻松分割卫星影像。

orbbec/OrbbecSDK

适用于 Orbbec 3D 相机的软件开发工具包,使开发者能够跨多种设备系列捕获数据流并控制硬件。

layumi/Person_reID_baseline_pytorch

一个轻量且强大的 PyTorch 基准,用于对象和人员再识别,提供一套完整的架构和损失函数,适用于跨摄像头对象检索。

google-research/augmix

AugMix 是一种数据处理技术,通过混合增强图像并强制执行一致的嵌入,来提高图像分类模型的鲁棒性和不确定性校准。

spytensor/plants_disease_detection

一个基于 PyTorch 的图像分类流水线,用于检测作物病害,具有 ResNet50 骨干网络和现代 PyTorch 2.x 优化。

openclimatefix/metnet

Google Research 的 MetNet 模型的 PyTorch 实现,用于利用卫星和大气数据进行短期和全球降水预测。

FORTH-ModelBasedTracker/MocapNET

实时 2D‑to‑3D 人体姿态估计器,将 RGB 视频流转换为标准 BVH 动作捕捉文件,用于 3D 动画。

andrewssobral/bgslibrary

一个全面的 C++ 框架,用于计算机视觉中的背景减除,提供超过 40 种算法来检测视频流中的移动对象。

zhanghang1989/ResNeSt

一种 ResNet 的分拆注意力网络变种,可提升计算机视觉任务(如目标检测和语义分割)的性能。

apple-aiml-research/ml-facelit

FaceLit 是一个神经 3D 渲染项目,能够生成在不同光照条件下可真实重照明的高质量面部图像。

MrGiovanni/SuPreM

一套用于 3D 医疗影像监督式预训练的预训练 3D 模型套件与 AbdomenAtlas 1.1 数据集,旨在提升器官与肿瘤分割的准确度。

MrGiovanni/ModelsGenesis

一种在无标签CT和MRI扫描上预训练3D模型的自监督学习框架,用于创建医学图像分割和分类的基础模型。

rafaelpadilla/Object-Detection-Metrics

提供 PASCAL VOC 和 COCO 等流行物体检测指标(如平均精度和 IOU)的标准化、易用实现,确保在不同数据集间的一致性基准测试。

luxonis/depthai

depthai 库是 Luxonis 平台的软件框架,使开发者能够在 Luxonis 硬件上创建 AI 和计算机视觉应用程序。

Xiaoqi-Zhao-DLUT/MSNet-M2SNet

一个包含 MSNet 和 M2SNet 架构的医疗图像分割框架,利用多尺度减法技术,精准分离息肉和肺部感染等病灶。