scikit-image/scikit-image

scikit-image 是一个用于图像处理的 Python 库,提供了一系列用于分析和操作图像的算法。

google-research/scenic

一个基于 JAX 与 Flax 的计算机视觉研究库,提供可扩展的库和项目模板,用于开发跨图像、视频和音频的注意力模型。

kotaro-kinoshita/yomitoku

专为日文文档图像提供高精度 OCR、布局分析和表格结构识别的文档 AI 引擎。

zju3dv/InfiniSplat

InfiniSplat 是一种用于大基线单目视图合成的系统,能够从单张 RGB 图像或 RGB-深度对中重建 3D 高斯点云场景。

SarahWeiii/CoACD

一个将复杂形状分解为近似凸包的3D网格分解工具,用于实现高效的碰撞检测和物理模拟。

playcanvas/splat-transform

SplatTransform 是一个开源库和 CLI, 用于转换, 编辑, 和分析 3‑D Gaussian splat 数据。它支持多种输入/输出格式 (PLY, SOG, SPZ, GLB, HTML, 体素, WebP, 等), 提供几何变换, 过滤, 抽稀, LOD 流式传输, 碰撞网格生成, 和 GPU 加速操作。可以通过 npm 安装 (或使用 Docker backend) 并运行命令如 `splat-transform input.ply output.sog` 或链式操作 (`-s`, `-t`, `--filter-box`, `--decimate`)。它是研究人员, 引擎开发人员, 和内容创作者处理神经图形 splat 表示法的理想选择。

PiTracLM/PiTrac

一个使用树莓派和机器学习追踪球飞行的开源 DIY 高尔夫发射监测仪。

twistedfall/opencv-rust

OpenCV 计算机视觉库的 Rust 绑定,使开发者能够在 Rust 中使用 OpenCV 的图像处理和 CV 工具。

davnords/LoMa

LoMa 是一组用于计算机视觉的快速、准确的局部特征匹配器 — 它能高效地在图像对之间找到对应点,可作为 3D 重建和视觉定位流水线中 LightGlue 的即插即用替代品,提供多种模型尺寸以平衡速度与精度。

duy-phamduc68/TrafficLab-3D

一个端到端的交通分析套件,利用计算机视觉和自定义校准流程,从 CCTV 视频和卫星地图生成 3D 数字孪生。

suzuran0y/CCTV-Smartphone-AI-Monitoring

Sentinel 是一个开源的仅限局域网系统,可将 Android 手机变为实时摄像头节点,将 Python/Flask PC 服务器变为实时预览、分段录制和 AI 触发监控仪表板。它通过运动检测调用外部视觉模型,输出结构化 JSON 事件,并将所有数据本地化,适用于注重隐私的监控或数据收集研究。

NVlabs/SpatialClaw

SpatialClaw 是一个无需训练的空间推理代理框架。一个 VLM 在预加载感知工具(SAM-3、Depth-Anything-3)和科学库的持久化 Jupyter 内核中编写并运行 Python 代码。系统循环执行规划、代码生成、安全检查执行和观察,直到代理返回答案。在 20 个基准上评估,平均准确率达 59.9%,比之前最佳代理高出 11.2 分,且在六个 VLM 后端上使用相同的提示和工具。仓库提供完整运行时、基准加载器、安装脚本和 SLURM 支持。

Dicklesworthstone/franken_ocr

franken_ocr 是一个纯 Rust、仅 CPU 的 OCR 引擎,可运行百度的 Unlimited-OCR 及四个相关视觉-语言模型。它以单个可移植二进制文件(`focr`)形式发布,一次模型下载后即可完全离线运行,并提供 Markdown、JSON、图表数据和 MusicXML 输出。项目使用手写 SIMD 内核,除经审计的 SIMD 岛外禁止使用 unsafe Rust,并包含广泛的自检和发布认证脚本。

manycoretech/aholo-viewer

使用分块流式 LOD 的高性能 3D 高斯溅射和网格渲染器,可处理海量 3D 数据集。

opencv/opencv_contrib

这是一个用于 OpenCV 实验性及社区贡献额外模块的仓库,作为这些功能移至官方核心发行版之前的测试场。

PointCloudLibrary/pcl

一个大型开源库,用于 2D/3D 图像和点云处理,广泛用于机器人和 3D 感知。

robertknight/ocrs

一个使用神经网络模型从图像中提取文本的 Rust 库和 CLI 工具,旨在最大限度减少图像预处理的需求。

DeepLabCut/DeepLabCut

DeepLabCut 是一个无需标记的姿态估计工具箱,允许研究人员使用深度学习在视频中追踪动物和物体,而无需使用物理标记。

infinitered/nsfwjs

一个使用 TensorFlow.js 在客户端对图像进行分类,以识别安全与 NSFW 内容的 JavaScript 库。

antvis/chart-visualization-skills

通过可搜索的技能目录、CLI、HTTP 服务和 npm 包,让 LLM 能够生成准确、可直接运行的图表(G2、G6、X6、信息图、叙事文本等)的 AI 增强型 AntV 技能库。

MIT-SPARK/KISS-Matcher

一种快速且稳健的点云配准库,用于对齐 3D 点云以确定相对旋转和平移。

MIC-DKFZ/nnInteractive

专为医学图像设计的前沿 3D 可提示分割框架,支持通过点、涂鸦和套索提示来优化体数据掩码。

TencentARC/Track4World

Track4World 是一个用于单目视频中每个像素的密集 3D 追踪的框架,以前馈方式提供以世界为中心的 3D 场景光流估计。

UVA-Computer-Vision-Lab/OmniShotCut

一种使用 Shot-Query Transformer 识别跨多种视频源的切口与过渡的高性能镜头边界检测工具。

kocasariumut/FaceAnything

Face Anything 是一款前馈神经网络模型,能够从任何图像序列或单张照片重建构构建时间一致的 4D (3D + 时间) 人脸,并输出点云视频、深度/法线图、标准坐标视觉化、逐帧 PLY 网格和相机数据。它在 CUDA GPU 上运行,可以通过单行脚本安装,并提供可配置的處理模式和背景移除功能。

ssrajadh/sentrysearch

一款语义视频搜索工具,可通过自然语言或图像查找特定事件,并自动剪裁匹配的视频片段。

nvpro-samples/vk_gltf_renderer

一个 Vulkan RTX 路径追踪器和 glTF 场景编辑器,作为 glTF 2.0 和 2.1 场景的高保真 PBR 材质参考。

RollingPlain/IVIF_ZOO

红外与可见光图像融合(IVIF)的综合性资源中心与基准,提供精选数据集、分类融合方法目录和评估工具。

Pointcept/Utonia

一种用于3D点云的跨域预训练 Point Transformer V3 编码器,为各种下游3D感知任务提供通用表示。

fegennari/3DWorld

具备宇宙、城市和地形的广泛程序化生成,以及大规模模型高性能渲染的跨平台 OpenGL 3D 游戏引擎

google/ffn

一种用于脑组织电子显微镜数据集中大型复杂3D形状实例分割的神经网络框架。

Artoriuz/ArtCNN

一组专为放大和清理动画内容而优化的单图像超分辨率模型,提供实时和高质量非实时两种选项。

hybridgroup/gocv

GoCV 为 OpenCV 4 提供 Go 语言绑定,使 Go 开发者能够在其应用程序中集成先进的计算机视觉和硬件加速图像处理功能。

microsoft/GlobalMLBuildingFootprints

Microsoft的全球建筑轮廓仓库发布了一个超过10亿个建筑的开放许可数据集,包含多边形轮廓(以及大量高度估计值),由深度学习分割模型生成。数据以gzip压缩的行分隔GeoJSON文件形式提供,按Bing四叉树键索引,附带置信度分数和文档,适用于大规模GIS或AI驱动的城市分析。

tue-mps/eomt

一种仅使用普通 Vision Transformer (ViT) 的编码器-only 图像分割模型,无需复杂解码器,实现高速与高精度。

automeris-io/WebPlotDigitizer

WebPlotDigitizer 是一款通过计算机视觉辅助,为研究人员和科学家从数据可视化图像中提取数值数据工具。

cvg/resplat

ReSplat 是一种前馈递归模型,用于 3D 高斯点云,通过渲染误差作为反馈,迭代优化场景表示。

mikel-brostrom/boxmot

一个可插拔的多对象跟踪框架,提供统一接口以集成各种检测器和跟踪器,支持轴对齐和方向边界框。

ok-oldking/ok-script

基于计算机视觉的 Python 自动化框架,适用于 Windows 应用、游戏和 Android 设备,支持 OCR 和模板匹配。

QIN2DIM/hcaptcha-challenger

一个结合计算机视觉模型和多模态大语言模型的AI驱动工具,用于解决hCaptcha挑战。

vccimaging/DeepLens

一个可微分的光学镜头模拟器,用于计算成像和光学设计,允许镜头作为 PyTorch 训练循环中的可学习参数进行优化。

princeton-vl/infinigen

一个用于为计算机视觉和机器人仿真创建无限逼真 3D 世界、室内场景和关节式资产的程序化生成引擎。

Peterande/D-FINE

D‑FINE 是一个实时目标检测框架,将 DETR 的框回归重新定义为细粒度分布精炼,并引入自蒸馏模块。它提供多种模型尺寸(‑N 至 ‑X),在 T4 GPU 上以 70–470 FPS 运行,同时达到最先进的 COCO/AP 分数(42.8 %–55.8 %),且无额外推理开销。仓库提供 COCO、Objects365 和自定义 COCO 格式数据集的预训练检查点、配置文件和完整的训练/评估脚本。

PozzettiAndrea/ComfyUI-MotionCapture

一个使用 GVHMR 从视频中提取 3D 人体运动和 SMPL 骨骼参数的 ComfyUI 自定义节点包。

apple-aiml-research/ml-depth-pro

一种可在不到一秒内生成高分辨率、清晰度高的绝对尺度深度图的零样本单目度量深度估计基础模型。

koide3/direct_visual_lidar_calibration

一种无需靶标、自动化的LiDAR-相机外参校准工具箱,利用环境结构和纹理实现精确的传感器对齐。

localai-org/depth-anything.cpp

一个无依赖的 C++ 实现,用于在 CPU 和 GPU 上快速进行单目度量深度和相机位姿推断,支持 Depth Anything 3 和 V2。

liebharc/homr

一个将乐谱照片或 PDF 转换为机器可读 MusicXML 文件的光学乐谱识别(OMR)软件。