lucidrains/vit-pytorch
一个全面的 PyTorch 库,实现了原始 Vision Transformer (ViT) 及其数十种架构变体,用于图像分类。
aqlaboratory/openfold-3
AlphaFold3 的开源复现,用于预测蛋白质、RNA、DNA 和小分子的三维结构。
Project-MONAI/MONAI
一个基于 PyTorch 的开源框架,用于医疗影像领域的深度学习,提供针对医疗数据的标准化工作流和领域专用工具。
LibreYOLO/libreyolo
一个 MIT 许可的计算机视觉库,提供检测、分割、姿态、深度、OCR 及其他视觉任务的单一 API,包含训练和导出工具。
nv-tlabs/vipe
一款从原始视频(包括广角和 360 度全景视频)中估计相机姿态、内参和密集深度图的空间 AI 工具。
aiptimizer/TurboOCR
一款使用 C++、CUDA 和 TensorRT 构建的高速 GPU 文档解析器,可将图像和 PDF 转换为包含表格和公式的结构化 Markdown。
mkturkcan/DART
一个无需训练的框架,通过 TensorRT 优化和蒸馏主干网络,将 SAM3 转换为实时多类别开放词汇检测器。
TickLabVN/biopass
一个为 Linux 设计的多模态生物识别登录系统,支持面部和指纹认证,具备 AI 驱动的防伪功能和图形化管理界面。
leeyeel/Sketch2Motion
一个将静态图像或草图转换为平滑绘制动画的工具,通过将其转换为 SVG 并使用 Manim 渲染。
opencv/opencv-python
无需手动编译即可通过 pip 安装的 OpenCV 预构建 Python 绑定。
pytorch/vision
一个为计算机视觉提供热门数据集、模型架构和图像转换的 PyTorch 库。
mindee/doctr
一个基于 PyTorch 的 OCR 库,提供 PDF 和图像中文字检测与识别的无缝流程,支持布局和表格分析。
fabiotosi92/ZipDepth
ZipDepth 是一个 6 M 参数的零样本单目深度模型,可在 GPU 上实现 >1 k FPS 的运行速度,并可导出至移动运行时。它结合了 RepVGG 风格的可重参数化卷积、条带池化注意力和轻量级 FPN 解码器。该仓库提供了即用型推理脚本、ONNX/TorchScript 导出工具、基准测试以及完整的训练流程(从 Depth Anything V2 知识蒸馏而来)。
qpuchen/nnUNet_att_position_correction
一种半监督式 3D 牙齿分割框架,通过引入轴向注意力机制(axial attention)与位置修正模块来增强 nnU-Net,旨在利用有限的标注数据来提升准确度。
mitsuba-renderer/mitsuba3
一个面向研究、可微分的渲染系统,用于正向和反向光传输模拟,并具有深度的 Python 集成。
obss/sahi
SAHI(Slicing‑Aided Hyper Inference)是一个开源 Python 库,可实现超大图像或视频上的切片推理,用于目标检测和实例分割。它兼容大多数主流检测器(YOLO、MMDetection、Detectron2、HuggingFace、TorchVision 等),提供 CLI 和 Python API,支持 FiftyOne 可视化,并包含 COCO 数据集处理与评估的实用工具。
Zarxrax/Sammie-Roto-2
一款使用 SAM2 和 MatAnyone 等模型进行 AI 辅助视频遮罩、分割和对象移除的跨平台桌面应用程序。
WebODM/OpenSplat
OpenSplat 是 3-D Gaussian splatting 的 C++ 实现,可将 COLMAP/OpenSfM/ODX/nerfstudio 数据转换为紧凑的 Gaussian-based 场景文件。它支持 CUDA、ROCm (HIP)、Apple Metal 和纯 CPU 构建版本,提供 Docker 镜像,并提供了一个简单的 CLI 供训练、恢复、掩码处理以及导出为 .ply/.splat/.spz/.rad 格式。
Tencent-Hunyuan/HunyuanOCR
一个轻量级、端到端的 OCR 视觉语言模型,通过指示性解码实现快速结构化文本提取
Intellindust-AI-Lab/DEIMv2
DEIMv2 是一个实时目标检测框架,利用 DINOv3 特征,为边缘和服务器部署在各种模型规模中提供可扩展且最先进的性能。
AprilRobotics/apriltag
一种用于机器人领域的视觉标识系统,可在图像中检测独特标记,实现精确识别和3D姿态估计。
GunduLabs/gaze
一个面向Linux的人脸认证系统,提供设备端人脸识别和PAM集成,实现安全、无密码登录和sudo访问。
roboflow/inference
一个推理引擎和部署平台,使用户能够在任何硬件上运行计算机视觉模型和复杂的视觉工作流,从边缘设备到云端。
jacobgil/pytorch-grad-cam
一个用于计算机视觉中可解释人工智能(XAI)的 PyTorch 库,提供广泛的像素归因方法,用于可视化和诊断模型预测。
SimonZeng7108/efficientsam3
利用知识蒸馏压缩视觉和文本编码器的 SAM3 轻量版本,模型大小最多减少 90%,实现高效分割。
Tau-J/rtmlib
rtmlib 是一个轻量级 Python 库,用于人体和动物姿态估计,封装了 RTMPose 和 ViTPose 模型。它避免了重型 OpenMMLab 依赖,仅需 numpy、OpenCV 和 ONNX Runtime(支持可选 GPU/加速器后端)。该包提供高阶解决方案类(Wholebody、Body、Hand、Animal、Custom、Wholebody3d),结合检测器(YOLOX、RFDETR、RTMDet)和姿态估计器,并附带骨架绘制工具。模型可自动从 OpenMMLab 或 HuggingFace 镜像下载。可通过 pip 或源码安装,并运行 Gradio WebUI 或使用 Python API 进行单图、视频或摄像头推理。
1038lab/ComfyUI-RMBG
一套用于进阶图像背景移除与精确对象分割的 ComfyUI 自定义节点套件,使用了如 RMBG-2.0 和 SAM2 等多种 AI 模型。
prs-eth/LitePT
LitePT 是一种轻量级、高性能的 3D 点云架构,在保持 3D 视觉任务最先进精度的同时,显著减少了参数量和内存占用。
deepfakes/faceswap
一个通过提取‑训练‑转换流水线,使用深度学习识别并交换图片和视频中人脸的工具。
Farama-Foundation/ViZDoom
一个基于 Doom 的 AI 研究平台,用于开发和测试仅使用视觉信息玩游戏的机器人,主要用于强化学习研究。
Udayraj123/OMRChecker
一款开源的 OMR 检查软件,利用计算机视觉技术准确读取和评估扫描的 OMR 表格或手机照片,并将结果导出为 CSV。
kotaro-kinoshita/yomitoku
专为日文文档图像提供高精度 OCR、布局分析和表格结构识别的文档 AI 引擎。
margelo/react-native-vision-camera
一款为 React Native 提供专业级照片/视频拍摄和实时 AI 帧处理能力的高性能相机库。
koide3/small_gicp
专为高速 3D 对齐设计的高性能、并行化 C++ 库,支持 ICP、GICP、VGICP 等精细点云配准。
KennethJAllen/proper-pixel-art
一种将嘈杂、高分辨率的像素艺术风格图像和动画转换为干净、真实分辨率像素资产的工具,通过恢复底层网格实现。
MIT-SPARK/VGGT-SLAM
一个用于 3D 地图构建与定位的实时、稠密前馈式场景重建系统,并具备可选的开放集 3D 物件检测功能。
roflcoopter/viseron
专为家庭和办公室监控设计的自托管、仅限本地运行的 NVR 和 AI 计算机视觉软件,支持对象和人脸识别。
bhimrazy/receipt-ocr
一个使用 Tesseract 和 LLM 从收据图像中提取原始文本或结构化 JSON 数据的 OCR 引擎。
Yuliang-Liu/MonkeyOCR
MonkeyOCR 是一个文档解析模型,它使用 Structure-Recognition-Relation(结构-识别-关系)三元组范式将 PDF 和图像转换为结构化的 Markdown,支持英语和中文。
VisoMasterFusion/VisoMaster-Fusion
一款用于图像、视频、以及实时网络摄像头画面进行 AI 换脸与增强的桌面应用程序,具备专业编辑工具与 GPU 加速功能。
NVlabs/SOMA-X
SOMA‑X 是一个 Python 库,提供参数化人体和手部的统一可微分表示,支持多种身份模型(MHR、SMPL‑X、MANO 等),并通过 NVIDIA Warp 提供快速蒙皮。它包含用于不同细节级别全身和手部网格的 `SOMALayer` 和 `SOMAHandLayer`,以及姿态逆解、绑定控制和数据 I/O 工具,使其适用于动画、姿态估计拟合和合成数据生成。
zs1083339604/FaceWinUnlock-Tauri
一款利用 OpenCV 和自定义凭据提供程序,使无原生 Windows Hello 硬件的设备也能实现人脸识别解锁的 Windows 工具。
AmmarkoV/SAM3DBody-cpp
一个无需 Python 依赖的独立 C++ 推理引擎,用于从 2D 图像中回归 SAM-3D-Body 的 3D 人体姿态、形状和相机参数。
ButzYung/SystemAnimatorOnline
一款基于网络摄像头的 AI 动作捕捉应用程序,可为 VTubing 和 XR 目的实时驱动 3D 虚拟角色 (VRM/MMD)。
roboflow/sports
一个用于运动分析的计算机视觉工具与数据集集合,专注于球类追踪、球员重识别与球衣号码 OCR 的挑战。
SharpAI/DeepCamera
一个开源的 AI 相机平台,能够在本地部署 VLM 场景分析和目标检测技能,并具备自主、硬件感知的安装方式。
phongdaot/MocapAnything
一个端到端的动作捕捉系统,可将单目视频转换为任意骨骼(包括动物和自定义绑定)的 3D 关节旋转。
scikit-image/scikit-image
scikit-image 是一个用于图像处理的 Python 库,提供了一系列用于分析和操作图像的算法。