liebharc/homr

一个将乐谱照片或 PDF 转换为机器可读 MusicXML 文件的光学乐谱识别(OMR)软件。

cvg/vidmap

一种用于视频的离线运动恢复结构系统,利用时间轨迹、闭环检测和度量深度来估计相机姿态并生成稀疏 3D 地图。

nv-tlabs/NKSR

Neural Kernel Surface Reconstruction (NKSR) 是一种从大规模、稀疏且噪声严重的点云中生成高质量 3D 隐式表面的方法,能够在秒级内处理数百万个点。

ultralytics/yolov3

Ultralytics YOLOv3 是 YOLOv3 目标检测模型的 PyTorch 实现,提供三种变体(完整版、SPP、轻量版),并附带训练、推理、验证和多种部署格式导出的脚本。支持自动下载 COCO 预训练权重,兼容 PyTorch Hub 加载,并与主流 ML-ops 工具和云笔记本集成。采用 AGPL‑3.0 开源许可,同时提供商业企业版选项。

lightly-ai/lightly

一个为自监督学习设计的模块化计算机视觉框架,提供众多前沿 SSL 模型的模块化构建块和实现。

google-ai-edge/model-explorer

Model Explorer 是 Google‑AI‑Edge 的开源可视化工具,可将 TensorFlow、TFLite、TF‑JS、MLIR 和 PyTorch ExportedProgram 模型渲染为交互式分层图。它提供 GPU 加速渲染、可搜索节点、I/O 高亮、元数据叠加以及可扩展的适配器系统以支持更多格式。

ndl-lab/ndlocr-lite

一款专为家用电脑设计的轻量级OCR工具,无需GPU即可从数字化书籍和杂志中提取文本。

albumentations-team/AlbumentationsX

一个高性能的 Python 图像增强库,通过创建合成训练样本来提高计算机视觉模型的质量和鲁棒性。

bytedance/Protenix

一个提供蛋白质和 RNA 高精度 3D 建模的开源生物分子结构预测框架,旨在作为 AlphaFold3 的可访问替代方案。

facebookresearch/MHR

一种使用身份、姿态和面部表情参数生成逼真、可微分人体网格的高保真参数化3D人体模型。

triple-mu/YOLOv8-TensorRT

YOLOv8的高性能TensorRT加速封装,可在Python和C++中实现检测、分割、姿态、OBB和分类的快速推理。

cvg/GeoCalib

GeoCalib 是一个研究级 Python 库,通过深度网络结合几何优化,从单张图像预测相机内参和场景重力方向。支持多种镜头模型、部分先验、批量处理和多相机阵列标定,并附带易安装的推理代码、Gradio 网页演示、Colab 笔记本和实时网络摄像头演示。预训练模型在 OpenPano 数据集(约 37k 个来自 HDR 全景图的透视裁剪图像)上训练,已在 LaMAR、MegaDepth、TartanAir 和 Stanford2D3D 等基准上达到最先进水平。

SunOner/sunone_aimbot_2

一个基于C++的AI瞄准助手,利用计算机视觉模型检测目标并自动化游戏中的鼠标移动。

orbbec/pyorbbecsdk

Orbbec SDK v2.x 的 Python 绑定,使开发者能够与 RGB-D 相机进行交互,实现深度流传输、3D 点云生成和计算机视觉任务。

luicfrr/react-native-vision-camera-face-detector

一个将 Google MLKit 与 Vision Camera 整合的 React Native 库,提供实时与静态图像的人脸检测功能。

facebookresearch/detectron2

Detectron2 是由 Meta AI Research 提供的高性能计算机视觉库,提供最先进的物体检测和分割算法。

LazoVelko/neverclick

一款使用计算机视觉技术,让用户仅通过键盘即可执行鼠标操作的桌面应用程序,旨在减少对物理鼠标的需求。

dweep-desai/FaceGate-Mac

一款原生 macOS 应用锁定工具,使用设备端面部识别、Touch ID 或密码来限制对特定应用程序的访问。

mne-tools/mne-python

一个开源的 Python 包,用于探索、可视化和分析人类神经生理数据,如 MEG 和 EEG。

egdels/makeacopy

一款注重隐私的离线 Android 文档扫描器,利用设备端机器学习和 OCR 技术,为自托管工作流创建可搜索的 PDF。

krupkat/xpano

一款用于全景拼接的工具,可自动检测图像分组并提供导出全分辨率全景图的投影调整功能

sceneview/sceneview

一个允许开发者使用 Jetpack Compose 和 SwiftUI 等声明式 UI 框架构建跨平台 3D 和 AR 沉浸式体验的多平台框架。

blakeblackshear/frigate-hass-integration

一个将 Frigate 的 AI 驱动的物体检测和 NVR 功能连接到智能家居中心的 Home Assistant 集成,实现自动化的安全监控。

perfanalytics/pose2sim

一种无需标记的3D运动学工作流,利用OpenSim将低成本摄像头拍摄的2D视频转换为研究级3D关节角度和骨骼分析。

playcanvas/supersplat-viewer

一个高性能的网页查看器,支持使用 WebGPU 或 WebGL 在网页中嵌入交互式 3D 高斯点阵场景。

microsoft/aurora

Aurora 是一个地球系统的基础模型,通过将通用预训练模型适配到特定预测任务,来预测温度、空气污染和海浪等大气变量。

yatengLG/ISAT_with_segment_anything

一个交互式半自动图像分割标注工具,使用 Segment Anything Model(SAM)加速标记数据集的创建。

secluso/core

一个为 Raspberry Pi 设计的私有 DIY 家庭安全摄像头系统,通过端到端加密避免云监控。

mahmoodlab/TRIDENT

用于 AI 病理学中大规模全切片图像处理的工具包,提供使用多种基础模型进行组织分割和特征提取的端到端流程。

CERN/TIGRE

基于 Python 和 MATLAB 的 GPU 加速工具箱,支持广泛的迭代算法和灵活的 CT 几何结构,实现快速且精确的 3D 体层重建

InsightSoftwareConsortium/ITK

一个用于 N 维科学图像处理、分割和配准的开源跨平台工具包,主要用于医学图像分析。

mtalcott/google-photos-deduper

一款无需 OAuth 设置即可使用本地图像嵌入从 Google 相册库中查找并删除重复照片的 Chrome 扩展程序。

Geekgineer/YOLOs-CPP

一个可投入生产的 C++ 推理引擎,为整个 YOLO 家族提供统一的 API,支持从目标检测到度量深度估计的各种任务。

alicevision/AliceVision

一个摄影测量计算机视觉框架,提供从无序照片或视频进行 3D 重建与相机追踪的算法。

chaofengc/IQA-PyTorch

一个基于 PyTorch 的图像质量评估(IQA)工具箱,提供大量全参考和无参考质量指标的 GPU 加速实现。

Babyhamsta/Aimmy

一款基于 AI 的瞄准辅助工具,使用 YOLOv8 和 DirectML 来帮助有身体或视觉障碍的玩家在 FPS 游戏中提升准确度。

pur1fying/blue_archive_auto_script

一款利用YOLOv8进行角色检测的自动化脚本,可自动完成《蓝色档案》中的战斗、日常任务和资源管理。

withoutbg/withoutbg-python

一个使用免费本地 ONNX 模型或专业云端 API 来去除图像背景的 Python 库。

apple-aiml-research/ARKitScenes

通过移动LiDAR捕获的室内场景大规模RGB-D数据集,为3D物体检测和深度上采样提供真实标签。

lukasHoel/video_to_world

一种能够解决视频扩散模型生成视频中几何不一致性的3D重建流程,用于创建稳定的3D世界。

Slicer/Slicer

3D Slicer 是一个用于可视化和分析 3D 医学影像数据的免费开源软件包。

qupath/qupath

QuPath 是一款开源的生物图像分析软件,利用机器学习和专用算法,提供对全切片图像和显微镜图像的注释与分析功能。

mudler/locate-anything.cpp

NVIDIA的LocateAnything-3B的C++/ggml推理移植版本,可在无需Python运行时的情况下,实现CPU和GPU上的快速开放词汇物体检测。

deepinv/deepinv

DeepInverse 是一个基于 PyTorch 的开源库,旨在通过算子和算法的模块化框架,利用深度学习解决成像逆问题。

Junjue-Wang/LoveDA

用于提升城市和农村环境中语义分割与域适应性能的高分辨率遥感土地覆盖数据集。

chenwei-zhao/captcha-recognizer

一种基于深度学习的库,用于识别滑块 CAPTCHA 中的缺口坐标和置信度水平。

privatenumber/mac-ocr

macOS 命令行工具和 Node.js API,利用 Apple 的 Vision 框架从图像和 PDF 中提取文本,并创建可搜索的 PDF,实现本地、私有的 OCR。

nsfw-filter/nsfw-filter

一款注重隐私的浏览器扩展,通过在设备上运行 AI 来阻止 NSFW 图像,而无需将数据上传到任何服务器。