liebharc/homr
一个将乐谱照片或 PDF 转换为机器可读 MusicXML 文件的光学乐谱识别(OMR)软件。
cvg/vidmap
一种用于视频的离线运动恢复结构系统,利用时间轨迹、闭环检测和度量深度来估计相机姿态并生成稀疏 3D 地图。
nv-tlabs/NKSR
Neural Kernel Surface Reconstruction (NKSR) 是一种从大规模、稀疏且噪声严重的点云中生成高质量 3D 隐式表面的方法,能够在秒级内处理数百万个点。
ultralytics/yolov3
Ultralytics YOLOv3 是 YOLOv3 目标检测模型的 PyTorch 实现,提供三种变体(完整版、SPP、轻量版),并附带训练、推理、验证和多种部署格式导出的脚本。支持自动下载 COCO 预训练权重,兼容 PyTorch Hub 加载,并与主流 ML-ops 工具和云笔记本集成。采用 AGPL‑3.0 开源许可,同时提供商业企业版选项。
lightly-ai/lightly
一个为自监督学习设计的模块化计算机视觉框架,提供众多前沿 SSL 模型的模块化构建块和实现。
google-ai-edge/model-explorer
Model Explorer 是 Google‑AI‑Edge 的开源可视化工具,可将 TensorFlow、TFLite、TF‑JS、MLIR 和 PyTorch ExportedProgram 模型渲染为交互式分层图。它提供 GPU 加速渲染、可搜索节点、I/O 高亮、元数据叠加以及可扩展的适配器系统以支持更多格式。
ndl-lab/ndlocr-lite
一款专为家用电脑设计的轻量级OCR工具,无需GPU即可从数字化书籍和杂志中提取文本。
albumentations-team/AlbumentationsX
一个高性能的 Python 图像增强库,通过创建合成训练样本来提高计算机视觉模型的质量和鲁棒性。
bytedance/Protenix
一个提供蛋白质和 RNA 高精度 3D 建模的开源生物分子结构预测框架,旨在作为 AlphaFold3 的可访问替代方案。
facebookresearch/MHR
一种使用身份、姿态和面部表情参数生成逼真、可微分人体网格的高保真参数化3D人体模型。
triple-mu/YOLOv8-TensorRT
YOLOv8的高性能TensorRT加速封装,可在Python和C++中实现检测、分割、姿态、OBB和分类的快速推理。
cvg/GeoCalib
GeoCalib 是一个研究级 Python 库,通过深度网络结合几何优化,从单张图像预测相机内参和场景重力方向。支持多种镜头模型、部分先验、批量处理和多相机阵列标定,并附带易安装的推理代码、Gradio 网页演示、Colab 笔记本和实时网络摄像头演示。预训练模型在 OpenPano 数据集(约 37k 个来自 HDR 全景图的透视裁剪图像)上训练,已在 LaMAR、MegaDepth、TartanAir 和 Stanford2D3D 等基准上达到最先进水平。
SunOner/sunone_aimbot_2
一个基于C++的AI瞄准助手,利用计算机视觉模型检测目标并自动化游戏中的鼠标移动。
orbbec/pyorbbecsdk
Orbbec SDK v2.x 的 Python 绑定,使开发者能够与 RGB-D 相机进行交互,实现深度流传输、3D 点云生成和计算机视觉任务。
luicfrr/react-native-vision-camera-face-detector
一个将 Google MLKit 与 Vision Camera 整合的 React Native 库,提供实时与静态图像的人脸检测功能。
facebookresearch/detectron2
Detectron2 是由 Meta AI Research 提供的高性能计算机视觉库,提供最先进的物体检测和分割算法。
LazoVelko/neverclick
一款使用计算机视觉技术,让用户仅通过键盘即可执行鼠标操作的桌面应用程序,旨在减少对物理鼠标的需求。
dweep-desai/FaceGate-Mac
一款原生 macOS 应用锁定工具,使用设备端面部识别、Touch ID 或密码来限制对特定应用程序的访问。
mne-tools/mne-python
一个开源的 Python 包,用于探索、可视化和分析人类神经生理数据,如 MEG 和 EEG。
egdels/makeacopy
一款注重隐私的离线 Android 文档扫描器,利用设备端机器学习和 OCR 技术,为自托管工作流创建可搜索的 PDF。
krupkat/xpano
一款用于全景拼接的工具,可自动检测图像分组并提供导出全分辨率全景图的投影调整功能
sceneview/sceneview
一个允许开发者使用 Jetpack Compose 和 SwiftUI 等声明式 UI 框架构建跨平台 3D 和 AR 沉浸式体验的多平台框架。
blakeblackshear/frigate-hass-integration
一个将 Frigate 的 AI 驱动的物体检测和 NVR 功能连接到智能家居中心的 Home Assistant 集成,实现自动化的安全监控。
perfanalytics/pose2sim
一种无需标记的3D运动学工作流,利用OpenSim将低成本摄像头拍摄的2D视频转换为研究级3D关节角度和骨骼分析。
playcanvas/supersplat-viewer
一个高性能的网页查看器,支持使用 WebGPU 或 WebGL 在网页中嵌入交互式 3D 高斯点阵场景。
microsoft/aurora
Aurora 是一个地球系统的基础模型,通过将通用预训练模型适配到特定预测任务,来预测温度、空气污染和海浪等大气变量。
yatengLG/ISAT_with_segment_anything
一个交互式半自动图像分割标注工具,使用 Segment Anything Model(SAM)加速标记数据集的创建。
secluso/core
一个为 Raspberry Pi 设计的私有 DIY 家庭安全摄像头系统,通过端到端加密避免云监控。
mahmoodlab/TRIDENT
用于 AI 病理学中大规模全切片图像处理的工具包,提供使用多种基础模型进行组织分割和特征提取的端到端流程。
CERN/TIGRE
基于 Python 和 MATLAB 的 GPU 加速工具箱,支持广泛的迭代算法和灵活的 CT 几何结构,实现快速且精确的 3D 体层重建
InsightSoftwareConsortium/ITK
一个用于 N 维科学图像处理、分割和配准的开源跨平台工具包,主要用于医学图像分析。
mtalcott/google-photos-deduper
一款无需 OAuth 设置即可使用本地图像嵌入从 Google 相册库中查找并删除重复照片的 Chrome 扩展程序。
Geekgineer/YOLOs-CPP
一个可投入生产的 C++ 推理引擎,为整个 YOLO 家族提供统一的 API,支持从目标检测到度量深度估计的各种任务。
alicevision/AliceVision
一个摄影测量计算机视觉框架,提供从无序照片或视频进行 3D 重建与相机追踪的算法。
chaofengc/IQA-PyTorch
一个基于 PyTorch 的图像质量评估(IQA)工具箱,提供大量全参考和无参考质量指标的 GPU 加速实现。
Babyhamsta/Aimmy
一款基于 AI 的瞄准辅助工具,使用 YOLOv8 和 DirectML 来帮助有身体或视觉障碍的玩家在 FPS 游戏中提升准确度。
pur1fying/blue_archive_auto_script
一款利用YOLOv8进行角色检测的自动化脚本,可自动完成《蓝色档案》中的战斗、日常任务和资源管理。
withoutbg/withoutbg-python
一个使用免费本地 ONNX 模型或专业云端 API 来去除图像背景的 Python 库。
apple-aiml-research/ARKitScenes
通过移动LiDAR捕获的室内场景大规模RGB-D数据集,为3D物体检测和深度上采样提供真实标签。
lukasHoel/video_to_world
一种能够解决视频扩散模型生成视频中几何不一致性的3D重建流程,用于创建稳定的3D世界。
Slicer/Slicer
3D Slicer 是一个用于可视化和分析 3D 医学影像数据的免费开源软件包。
qupath/qupath
QuPath 是一款开源的生物图像分析软件,利用机器学习和专用算法,提供对全切片图像和显微镜图像的注释与分析功能。
mudler/locate-anything.cpp
NVIDIA的LocateAnything-3B的C++/ggml推理移植版本,可在无需Python运行时的情况下,实现CPU和GPU上的快速开放词汇物体检测。
deepinv/deepinv
DeepInverse 是一个基于 PyTorch 的开源库,旨在通过算子和算法的模块化框架,利用深度学习解决成像逆问题。
Junjue-Wang/LoveDA
用于提升城市和农村环境中语义分割与域适应性能的高分辨率遥感土地覆盖数据集。
chenwei-zhao/captcha-recognizer
一种基于深度学习的库,用于识别滑块 CAPTCHA 中的缺口坐标和置信度水平。
privatenumber/mac-ocr
macOS 命令行工具和 Node.js API,利用 Apple 的 Vision 框架从图像和 PDF 中提取文本,并创建可搜索的 PDF,实现本地、私有的 OCR。
nsfw-filter/nsfw-filter
一款注重隐私的浏览器扩展,通过在设备上运行 AI 来阻止 NSFW 图像,而无需将数据上传到任何服务器。