StanfordVL/taskonomy

一个用于解耦计算机视觉中任务迁移学习的框架和数据集,提供预训练任务库和分析任务亲和性的工具。

qaz812345/TrackNetV3

一项计算机视觉项目,通过轨迹预测结合背景估计和基于图像修复的校正模块,提升羽毛球视频中球托追踪的性能,有效处理遮挡问题。

EthanH3514/AL_Yolo

基于 YOLOv5 的实时视觉目标检测与跟踪系统,专为游戏场景中的低延迟屏幕捕获和 GPU 推理进行优化。

Breakthrough/DVR-Scan

一个命令行和 GUI 应用程序,可自动检测视频文件中的运动事件,并将每个事件保存为独立的片段。

soruly/trace.moe-telegram-bot

一个使用 trace.moe 服务从截图或视频中识别动画标题、集数和时间戳的 Telegram 机器人。

pupil-labs/pupil

一个开源的眼动追踪平台,提供用于捕捉、回放和分析眼动追踪数据的软件基础设施。

ermig1979/Simd

一个使用SIMD CPU扩展加速算法的高性能C/C++图像处理和机器学习库,适用于x86、ARM和Hexagon架构。

iago-suarez/ELSED

ELSED 是一种专为无人机和智能手机等资源受限设备设计的高速线段检测器。

Faceplugin-ltd/FaceRecognition-Android

适用于 Android 的本地设备人脸识别与活体检测 SDK,支持私密、离线生物识别身份验证和属性分析。

stereolabs/zed-unity

一个 Unity 插件,将 ZED 相机的深度感知、空间映射和目标检测功能集成到 Unity 引擎,用于 AR/MR 开发。

deepfates/memery

利用 OpenAI 的 CLIP 技术,通过文本或图像查询在本地文件夹中查找特定图像的自然语言图像搜索工具。

nachifur/MulimgViewer

专为高效比较、过滤和拼接大规模图像数据集而设计的多图查看器,具有并行缩放和自动图表生成功能。

VicenteVivan/geo-clip

GeoCLIP 是一种受 CLIP 启发的模型,将图像与地理位置对齐,以实现高精度的全球图像地理定位和 GPS 到向量的嵌入。

lartpang/PySODEvalToolkit

一个用于评估灰度图像和二值图像分割模型的 Python 工具箱,提供全面的指标和自动化的曲线绘图功能。

OSU-NLP-Group/UGround

UGround 是一个开源视觉语言模型(2B/7B/72B),经过微调以根据文本描述在截图中定位 UI 元素。该仓库提供预训练权重、超过 100 万张图像的 GUI 定位数据集、四个基准的评估脚本以及 Hugging Face 演示。推理通过 vLLM 实现,使用简单提示即可返回 (x, y) 坐标。72B 模型在 ScreenSpot 基准上达到最先进水平,并被 ICLR 2025 接受为口头报告论文。

juliansteenbakker/mobile_scanner

一个快速、轻量的 Flutter 插件,支持 Android、iOS、macOS 和 Web,通过设备摄像头实现实时条形码和二维码扫描,并支持可自定义的摄像头行为。

bopen/sarsen

一个用于云原生合成孔径雷达(SAR)处理的 Python 库,提供 Sentinel-1 卫星数据的几何与辐射地形校正。

leomariga/pyRANSAC-3D

用于将基本几何形状拟合到3D点云的Python实现,适用于3D重建和SLAM。

ouster-lidar/ouster-sdk

一个跨平台的 C++/Python 开发工具包,用于连接、配置和可视化来自 Ouster 激光雷达传感器的数据。

opencv/opencv_extra

补充 OpenCV 计算机视觉库核心功能的额外数据与资源库。

Thinklab-SJTU/ThinkMatch

一个用于开发和基准测试深度图匹配算法的研究框架,旨在在图之间找到节点到节点的对应关系。

liuliu/ccv

一个极简且可移植的基于 C 的计算机视觉库,提供用于人脸、物体和文本检测的最先进算法。

PaddlePaddle/PaddleClas

一个全面的图像识别与分类工具包,为高性能视觉应用提供超轻量级模型和工业级骨干网络。

SegmentationBLWX/sssegmentation

一个基于 PyTorch 的监督式语义分割工具箱,提供统一的框架和丰富的模型库,用于训练和测试分割算法。

LAION-AI/CLIP_benchmark

一个标准化的评估框架,用于衡量 CLIP 类模型在零样本分类、检索、图像描述生成和线性探测等任务上,跨多种数据集的性能。

facebookresearch/mvdust3r

一种单阶段 3D 场景重建工具,只需约 2 秒即可从稀疏 RGB 视图中创建 3D 点云和相机姿态,无需预先知道相机姿态。

zsylvester/segmenteverygrain

一个用于通过混合 U-Net 和 SAM 2.1 方法检测和分割图像中颗粒的 Python 包,专为地貌学和沉积地质学研究设计。

phamquiluan/ResidualMaskingNetwork

使用残差掩码网络检测图像和实时视频流中人类情感的面部表情识别系统。

NVlabs/nvdiffrecmc

使用蒙特卡洛渲染和去噪技术,基于多视角图像联合重建3D拓扑、材质和光照的PyTorch实现。

adalca/neurite

用于医学图像分析的神经网络工具箱,提供专用张量操作、预构建架构和空间数据绘图工具。

scribeocr/scribe.js

一个用于从图像和 PDF 进行 OCR 和文本提取的 JavaScript 库,能够创建具有不可见文本层的可搜索 PDF。

hysts/anime-face-detector

一个基于 PyTorch 的工具,用于检测动漫人脸并使用预训练的 Faster R-CNN、YOLOv3 和 HRNetV2 模型估计 28 个面部关键点。

mkalten/reacTIVision

一个跨平台的计算机视觉框架,用于跟踪基准标记和多点触控手指,以实现有形用户界面的创建。

roboflow/roboflow-python

Roboflow 的官方 Python 包,使开发者能够以程序化方式与模型、数据集和项目交互,从而自动构建和部署计算机视觉模型。

lessthanoptimal/BoofCV

用 Java 编写的实时计算机视觉库,提供低级图像处理、相机校准和特征跟踪的工具。

githubharald/SimpleHTR

一个基于 TensorFlow 的手写文本识别系统,使用 CNN 和 LSTM 层将单词或文本行的图像转换为数字文本。

scribeocr/scribeocr

一个浏览器端的网络应用,用于从图像中识别文本,以高精度校对OCR数据,并创建完全数字化的ebook风格文档。

visionworkbench/visionworkbench

由 NASA 开发的 C++ 库,用于通用型图像处理和计算机视觉,提供相机模型、地图投影和马赛克拼接的工具。

openclimatefix/graph_weather

一个基于 PyTorch 的库,实现了多种用于天气预报和数据同化的图神经网络,包括 GenCast 和 Aurora 等模型。

norlab-ulaval/libpointmatcher

一个带有 Python 绑定的模块化 C++ 库,用于在机器人学和计算机视觉中对 3D 点云进行配准。

owensgroup/RXMesh

一个用于处理三角网格的 GPU 加速库,具备集成的矩阵基础设施和用于几何处理任务的自动微分功能。

PoseLib/PoseLib

一套用于相机位姿估计的极小求解器与稳健估计器集合,支持多种对应关系与相机模型,且依赖项极少。

PozzettiAndrea/ComfyUI-SAM3

Meta的SAM3 ComfyUI集成,支持使用自然语言文本提示进行开放词汇图像和视频分割。

UCSC-VLAA/OpenVision

一组面向多模态学习的开源、低成本视觉编码器,优化了理解与生成任务中的训练效率与性能。

Seeed-Studio/OSHW-reCamera-Series

面向边缘 AI 的 reCamera 系列 AI 驱动视觉模块的开源硬件文档与设计资源中心。

CellProfiler/CellProfiler

CellProfiler 是一款开源软件,使生物学家无需编程或计算机视觉专业知识,即可自动且定量地从数千张图像中测量表型。

TechyNilesh/DeepImageSearch

一个用于构建支持文本、图像和混合搜索的 AI 驱动图像搜索系统的 Python 库,采用多模态嵌入和向量索引技术。

MITK/MITK

一个开源的 C++ 工具包,通过结合 ITK 和 VTK,用于开发交互式医学图像处理软件。