lucidrains/vit-pytorch

一个全面的 PyTorch 库,实现了原始 Vision Transformer (ViT) 及其数十种架构变体,用于图像分类。

aqlaboratory/openfold-3

AlphaFold3 的开源复现,用于预测蛋白质、RNA、DNA 和小分子的三维结构。

Project-MONAI/MONAI

一个基于 PyTorch 的开源框架,用于医疗影像领域的深度学习,提供针对医疗数据的标准化工作流和领域专用工具。

LibreYOLO/libreyolo

一个 MIT 许可的计算机视觉库,提供检测、分割、姿态、深度、OCR 及其他视觉任务的单一 API,包含训练和导出工具。

nv-tlabs/vipe

一款从原始视频(包括广角和 360 度全景视频)中估计相机姿态、内参和密集深度图的空间 AI 工具。

aiptimizer/TurboOCR

一款使用 C++、CUDA 和 TensorRT 构建的高速 GPU 文档解析器,可将图像和 PDF 转换为包含表格和公式的结构化 Markdown。

mkturkcan/DART

一个无需训练的框架,通过 TensorRT 优化和蒸馏主干网络,将 SAM3 转换为实时多类别开放词汇检测器。

TickLabVN/biopass

一个为 Linux 设计的多模态生物识别登录系统,支持面部和指纹认证,具备 AI 驱动的防伪功能和图形化管理界面。

leeyeel/Sketch2Motion

一个将静态图像或草图转换为平滑绘制动画的工具,通过将其转换为 SVG 并使用 Manim 渲染。

opencv/opencv-python

无需手动编译即可通过 pip 安装的 OpenCV 预构建 Python 绑定。

pytorch/vision

一个为计算机视觉提供热门数据集、模型架构和图像转换的 PyTorch 库。

mindee/doctr

一个基于 PyTorch 的 OCR 库,提供 PDF 和图像中文字检测与识别的无缝流程,支持布局和表格分析。

fabiotosi92/ZipDepth

ZipDepth 是一个 6 M 参数的零样本单目深度模型,可在 GPU 上实现 >1 k FPS 的运行速度,并可导出至移动运行时。它结合了 RepVGG 风格的可重参数化卷积、条带池化注意力和轻量级 FPN 解码器。该仓库提供了即用型推理脚本、ONNX/TorchScript 导出工具、基准测试以及完整的训练流程(从 Depth Anything V2 知识蒸馏而来)。

qpuchen/nnUNet_att_position_correction

一种半监督式 3D 牙齿分割框架,通过引入轴向注意力机制(axial attention)与位置修正模块来增强 nnU-Net,旨在利用有限的标注数据来提升准确度。

mitsuba-renderer/mitsuba3

一个面向研究、可微分的渲染系统,用于正向和反向光传输模拟,并具有深度的 Python 集成。

obss/sahi

SAHI(Slicing‑Aided Hyper Inference)是一个开源 Python 库,可实现超大图像或视频上的切片推理,用于目标检测和实例分割。它兼容大多数主流检测器(YOLO、MMDetection、Detectron2、HuggingFace、TorchVision 等),提供 CLI 和 Python API,支持 FiftyOne 可视化,并包含 COCO 数据集处理与评估的实用工具。

Zarxrax/Sammie-Roto-2

一款使用 SAM2 和 MatAnyone 等模型进行 AI 辅助视频遮罩、分割和对象移除的跨平台桌面应用程序。

WebODM/OpenSplat

OpenSplat 是 3-D Gaussian splatting 的 C++ 实现,可将 COLMAP/OpenSfM/ODX/nerfstudio 数据转换为紧凑的 Gaussian-based 场景文件。它支持 CUDA、ROCm (HIP)、Apple Metal 和纯 CPU 构建版本,提供 Docker 镜像,并提供了一个简单的 CLI 供训练、恢复、掩码处理以及导出为 .ply/.splat/.spz/.rad 格式。

Tencent-Hunyuan/HunyuanOCR

一个轻量级、端到端的 OCR 视觉语言模型,通过指示性解码实现快速结构化文本提取

Intellindust-AI-Lab/DEIMv2

DEIMv2 是一个实时目标检测框架,利用 DINOv3 特征,为边缘和服务器部署在各种模型规模中提供可扩展且最先进的性能。

AprilRobotics/apriltag

一种用于机器人领域的视觉标识系统,可在图像中检测独特标记,实现精确识别和3D姿态估计。

GunduLabs/gaze

一个面向Linux的人脸认证系统,提供设备端人脸识别和PAM集成,实现安全、无密码登录和sudo访问。

roboflow/inference

一个推理引擎和部署平台,使用户能够在任何硬件上运行计算机视觉模型和复杂的视觉工作流,从边缘设备到云端。

jacobgil/pytorch-grad-cam

一个用于计算机视觉中可解释人工智能(XAI)的 PyTorch 库,提供广泛的像素归因方法,用于可视化和诊断模型预测。

SimonZeng7108/efficientsam3

利用知识蒸馏压缩视觉和文本编码器的 SAM3 轻量版本,模型大小最多减少 90%,实现高效分割。

Tau-J/rtmlib

rtmlib 是一个轻量级 Python 库,用于人体和动物姿态估计,封装了 RTMPose 和 ViTPose 模型。它避免了重型 OpenMMLab 依赖,仅需 numpy、OpenCV 和 ONNX Runtime(支持可选 GPU/加速器后端)。该包提供高阶解决方案类(Wholebody、Body、Hand、Animal、Custom、Wholebody3d),结合检测器(YOLOX、RFDETR、RTMDet)和姿态估计器,并附带骨架绘制工具。模型可自动从 OpenMMLab 或 HuggingFace 镜像下载。可通过 pip 或源码安装,并运行 Gradio WebUI 或使用 Python API 进行单图、视频或摄像头推理。

1038lab/ComfyUI-RMBG

一套用于进阶图像背景移除与精确对象分割的 ComfyUI 自定义节点套件,使用了如 RMBG-2.0 和 SAM2 等多种 AI 模型。

prs-eth/LitePT

LitePT 是一种轻量级、高性能的 3D 点云架构,在保持 3D 视觉任务最先进精度的同时,显著减少了参数量和内存占用。

deepfakes/faceswap

一个通过提取‑训练‑转换流水线,使用深度学习识别并交换图片和视频中人脸的工具。

Farama-Foundation/ViZDoom

一个基于 Doom 的 AI 研究平台,用于开发和测试仅使用视觉信息玩游戏的机器人,主要用于强化学习研究。

Udayraj123/OMRChecker

一款开源的 OMR 检查软件,利用计算机视觉技术准确读取和评估扫描的 OMR 表格或手机照片,并将结果导出为 CSV。

kotaro-kinoshita/yomitoku

专为日文文档图像提供高精度 OCR、布局分析和表格结构识别的文档 AI 引擎。

margelo/react-native-vision-camera

一款为 React Native 提供专业级照片/视频拍摄和实时 AI 帧处理能力的高性能相机库。

koide3/small_gicp

专为高速 3D 对齐设计的高性能、并行化 C++ 库,支持 ICP、GICP、VGICP 等精细点云配准。

KennethJAllen/proper-pixel-art

一种将嘈杂、高分辨率的像素艺术风格图像和动画转换为干净、真实分辨率像素资产的工具,通过恢复底层网格实现。

MIT-SPARK/VGGT-SLAM

一个用于 3D 地图构建与定位的实时、稠密前馈式场景重建系统,并具备可选的开放集 3D 物件检测功能。

roflcoopter/viseron

专为家庭和办公室监控设计的自托管、仅限本地运行的 NVR 和 AI 计算机视觉软件,支持对象和人脸识别。

bhimrazy/receipt-ocr

一个使用 Tesseract 和 LLM 从收据图像中提取原始文本或结构化 JSON 数据的 OCR 引擎。

Yuliang-Liu/MonkeyOCR

MonkeyOCR 是一个文档解析模型,它使用 Structure-Recognition-Relation(结构-识别-关系)三元组范式将 PDF 和图像转换为结构化的 Markdown,支持英语和中文。

VisoMasterFusion/VisoMaster-Fusion

一款用于图像、视频、以及实时网络摄像头画面进行 AI 换脸与增强的桌面应用程序,具备专业编辑工具与 GPU 加速功能。

NVlabs/SOMA-X

SOMA‑X 是一个 Python 库,提供参数化人体和手部的统一可微分表示,支持多种身份模型(MHR、SMPL‑X、MANO 等),并通过 NVIDIA Warp 提供快速蒙皮。它包含用于不同细节级别全身和手部网格的 `SOMALayer` 和 `SOMAHandLayer`,以及姿态逆解、绑定控制和数据 I/O 工具,使其适用于动画、姿态估计拟合和合成数据生成。

zs1083339604/FaceWinUnlock-Tauri

一款利用 OpenCV 和自定义凭据提供程序,使无原生 Windows Hello 硬件的设备也能实现人脸识别解锁的 Windows 工具。

AmmarkoV/SAM3DBody-cpp

一个无需 Python 依赖的独立 C++ 推理引擎,用于从 2D 图像中回归 SAM-3D-Body 的 3D 人体姿态、形状和相机参数。

ButzYung/SystemAnimatorOnline

一款基于网络摄像头的 AI 动作捕捉应用程序,可为 VTubing 和 XR 目的实时驱动 3D 虚拟角色 (VRM/MMD)。

roboflow/sports

一个用于运动分析的计算机视觉工具与数据集集合,专注于球类追踪、球员重识别与球衣号码 OCR 的挑战。

SharpAI/DeepCamera

一个开源的 AI 相机平台,能够在本地部署 VLM 场景分析和目标检测技能,并具备自主、硬件感知的安装方式。

phongdaot/MocapAnything

一个端到端的动作捕捉系统,可将单目视频转换为任意骨骼(包括动物和自定义绑定)的 3D 关节旋转。

scikit-image/scikit-image

scikit-image 是一个用于图像处理的 Python 库,提供了一系列用于分析和操作图像的算法。