qubvel-org/segmentation_models.pytorch
一个提供图像语义分割高阶 API 的 PyTorch 库,具有 12 种架构和超过 800 个预训练编码器。
10x-Engineers/Infinite-ISP
一个从基于 Python 的算法设计到 RTL 和 FPGA 实现的完整 ISP 开发平台,用于将 RAW 传感器图像转换为 RGB。
scier/MetalSplatter
一个基于 Swift/Metal 的库,可在 iOS、macOS 和 visionOS 上实现实时 3D 场景可视化。
google-ar/arcore-android-sdk
ARCore SDK for Android 提供用于运动追踪、环境理解以及光照估计的 API,以构建增强现实体验。
Smorodov/Multitarget-tracker
一个结合了 SOTA 深度学习检测器、匹配算法与 Kalman filters 的全面性多目标跟踪框架,用于在视频中跟踪多个目标。
VisionDepth/VisionDepth3D
VisionDepth 3D 是一款 Windows 桌面应用程序,它使用 AI 深度模型、深度图混合、RIFE 帧插值和 AI 超分辨率技术,将 2D 图像或视频转换为立体 3D。它提供了一个免费版(长度受限、1080p、有水印)和一个一次性付费 59.99 美元的 Pro 专业版(无限制、4K+、批处理、高级控制)。安装方式是通过 Itch.io 的“Setup Hub”来提供 CUDA (NVIDIA) 或 DirectML (AMD/Intel) 版本。该软件是专有软件,但它下载的 AI 模型是在其各自许可证下的开源模型。
SimpleITK/SimpleITK
一个为图像分割和配准提供对 Insight Segmentation and Registration Toolkit (ITK) 简化接口的图像分析工具包。
rdk/p2rank
一种基于机器学习的命令行工具,可快速且准确地从蛋白质结构中预测配体结合位点。
illuin-tech/colpali
ColPali 是一个用于视觉文档检索的研究库。它使用视觉-语言模型(如 PaliGemma、Qwen‑VL)将文档图像编码为多向量嵌入,并使用类似 ColBERT 的延迟交互方法对查询嵌入进行评分。原始的 `colpali-engine` 包(现已弃用)提供模型类、处理器、可选融合内核、快速 Plaid 索引、令牌池化和可解释性工具。新项目应使用 Sentence‑Transformers v6 的 `MultiVectorEncoder`,它集成了 ColPali 风格的模型。
zju3dv/MatchAnything
MatchAnything 是一项研究项目,训练单一神经网络以在任何视觉模态(如 RGB、红外线、草图等)的图像之间找到对应关系。预训练权重托管在 Hugging Face 上,用户可通过在线演示立即尝试跨模态匹配。该方法旨在用一个通用模型替代多个专用匹配流水线,适用于机器人、遥感、医学成像和 AR 等领域。
weecology/DeepForest
一个用于在航空 RGB 影像中使用深度学习目标检测进行树冠和鸟类等生态对象训练和预测的 Python 包。
nianticlabs/map-free-reloc
A reference implementation for map-free visual relocalization that enables metric pose estimation relative to a single image, removing the need for large 3D maps.
alephpi/Texo
一个仅包含 20M 参数的极简开源 LaTeX OCR 模型,可将数学公式图像转换为 LaTeX 代码。
xg-chu/GAGAvatar
GAGAvatar 是一个利用 3D 高斯点阵从单张图像实现 3D 头部虚拟形象重建并支持实时重演的框架。
mgonzs13/yolo_ros
一个用于 Ultralytics YOLO 模型的 ROS 2 封装,使机器人能够实现物体检测、跟踪、实例分割和 3D 物体定位。
MrGiovanni/UNetPlusPlus
一种用于医学图像分割的嵌套 U-Net 架构,通过重新设计跳过连接并支持灵活的网络深度,改进了原始 U-Net。
microsoft/farmvibes-ai
面向农业与可持续性的多模态地理空间机器学习框架,融合卫星影像、气象数据与高程图,生成稳健的农业洞察。
z1069614715/objectdetection_script
一个用于改进和压缩目标检测模型的综合工具包,具有改进的 YOLO 和 RT-DETR 架构、剪枝、蒸馏和多模态支持。
ucam-eo/geotessera
一个用于读取、导出和可视化 Tessera Earth 基础模型地理空间嵌入的 Python 库,支持云原生流式传输和本地瓦片下载。
opencap-org/opencap-core
一个从多个智能手机视频中估计3D人体运动学和标记位置的管道,输出数据为 OpenSim 格式。
openmv/openmv
一个开源的机器视觉平台,使初学者能够使用 Python3 在微控制器上实现 AI 和图像处理。
DanBloomberg/leptonica
一个由 Tesseract 和 OpenCV 等项目使用的全面 ANSI C 图像处理和分析库,用于处理文档和自然图像。
nipreps/mriqc
一个开源工具,可从结构、功能和扩散 MRI 数据中提取无参考图像质量指标,实现自动化质量评估。
luxonis/oak-examples
Luxonis OAK 设备的一系列演示和教程,展示了使用 DepthAI 实现人工智能视觉、深度测量和神经网络应用。
ANTsX/ANTsPy
ANTs C++ 框架的 Python 封装,提供高性能工具用于生物医学图像配准、分割和处理。
sstary/SSRS
一个 PyTorch 集合,包含用于遥感语义分割的深度学习模型,涵盖单模态、多模态融合和无监督域适应技术。
jianboqi/CSF
一种基于布料模拟的 LiDAR 滤波方法,用于分离空中点云中的地面点与非地面点。
sentinel-hub/eo-learn
一个将地球观测数据与机器学习生态系统相连接的 Python 库,简化从时空卫星影像中提取信息的过程。
zibo-chen/ocr-rs
基于 PaddleOCR 模型和 MNN 推理运行时的轻量级 Rust OCR 库,支持 50 多种语言的文本检测与识别。
apple-aiml-research/ml-cvnets
一个用于训练和评估标准及新型移动端和非移动端模型,以执行分类、检测和分割等任务的计算机视觉工具箱。
vietanhdev/samexporter
一个用于在 ONNX Runtime 中导出并运行 SAM, SAM 2, SAM 3, MobileSAM 和 EfficientSAM 模型的工具,以实现便携式且高效的部署。
NativeSensors/EyeGestures
一个开源眼动追踪库,可使用标准网络摄像头和手机摄像头而非昂贵的专用硬件,实现眼控界面。
Jianghanxiao/PhysTwin
PhysTwin 是一个研究代码库,它能够从 RGB-D 视频中重建物理感知的可变形物体数字孪生,并提供交互式仿真、分析工具,以及用于机器人规划和批量仿真的示例流水线。
Yuliang-Liu/MultimodalOCR
一套用于评估大型多模态模型在多种语言和真实世界场景下OCR与文档解析能力的基准测试(MDPBench、OCRBench v2、OCRBench)集合。
yehonathanlitman/Lift4D
Lift4D 通过将每帧的 3D 估计融合到一个可变形模型中,从单视角的「野外」视频中重建出时间一致的 4D 资产。
NVIDIA-RTX/RTXNS
一个用于将机器学习集成到图形应用程序中的开发者框架,使神经网络能够表示着色器和纹理。
ultralytics/yolo-flutter-app
一个官方的 Ultralytics 插件,用于在 iOS 和 Android 上实现对象检测、分割和姿态估计的实时 YOLO 模型推理。
agentmorris/MegaDetector
一个能够识别相机陷阱图像中动物、人和车辆的AI模型,帮助保护生物学家高效去除空白图像。
alexandremendoncaalvaro/CorridorKey-Runtime
一款原生 AI 抠像运行时和 OFX 插件,适用于 DaVinci Resolve 与 Foundry Nuke,为视频编辑者提供自动化、机器学习加速的背景移除功能。
torchgeo/terratorch
一个基于 PyTorch 的领域库,用于微调和使用预训练的地理空间基础模型,支持图像分割和分类等任务。
kornia/kornia-rs
一个用 Rust 编写的低层级计算机视觉库,为实时 ML 流水线在 CPU 和 NVIDIA GPU 上提供快速、零拷贝的图像处理能力。
raphaelvallat/yasa
一个基于 Python 的睡眠分析工具箱,用于自动进行多导睡眠图和 EEG 数据的睡眠分期和事件检测。
allenai/olmoearth_pretrain
一系列用于地球观测的跨模态、时空基础模型,为利用卫星数据进行行星智能提供可扩展的框架。
ultralytics/yolo-ios-app
一个原生 iOS 应用和 Swift SDK,利用 Core ML 和 Apple Neural Engine 实现设备端实时 YOLO 推理,支持对象检测、分割和姿态估计。
next-state/open-dreamer
Open Dreamer 是 JAX/Flax 实现的 Dreamer 4 世界模型管道,提供 Minecraft 游戏玩法数据上视频分词器和动作条件的潜在动力学模型的训练代码,以及滚动生成和 FVD 评估工具。包含一个浏览器内实时演示和一个用于运行训练检查点的独立推理仓库。
noahcao/OC_SORT
一种纯运动模型的多目标跟踪器,通过重新思考 SORT 算法,在拥挤场景和非线性运动下提升鲁棒性。
zju3dv/manhattan_sdf
Manhattan‑SDF 是 CVPR‑2022 的研究代码,通过学习室内 3‑D 重建的神经符号距离函数(SDF),并引入曼哈顿世界(轴对齐)正则化以提升几何质量。提供基于 conda 的安装方式、ScanNet(或自定义数据)的训练脚本、网格提取功能以及与多种基线的评估功能。
StanfordVL/taskonomy
一个用于解耦计算机视觉中任务迁移学习的框架和数据集,提供预训练任务库和分析任务亲和性的工具。