google/cameratrapai

一个使用目标检测器和物种分类器自动对相机陷阱图像中的野生动物物种进行分类的 AI 模型集成。

mprib/caliscope

用于 3D 运动捕捉的多相机校准工具,可估计相机内参和空间位置,以实现精确的 3D 三角化。

linwhitehat/ET-BERT

一种基于 Transformer 的加密网络流量分类模型,通过预训练和微调学习数据报的上下文关系

allenv0/AirPosture

一款利用 AirPods 的头部追踪和本地 AI 技术,为减少颈部压力提供实时姿势指导和提醒的 iOS 应用。

LiteReality/LiteReality

LiteReality 将移动设备获取的 RGB-D 扫描数据转换为具备物理基础渲染材质的图形就绪 3D 场景,实现高保真重建。

3dem/relion

RELION 是一款用于在冷冻电子显微镜中进行 3D 重建和 2D 类别平均值的最大后验概率(Maximum A Posteriori)精炼软件程序。

cvg/glue-factory

A library for training and evaluating deep neural networks that extract and match local visual features, supporting state-of-the-art models like LightGlue and GlueStick.

cvg/limap

一个用于全面 3D 制图和运动恢复结构的工具箱,通过联合优化点、线、平面和参数化原语,实现更准确的 3D 重建。

nvpro-samples/vk_gaussian_splatting

一个基于Vulkan的高性能查看器和测试平台,用于比较3D高斯溅射模型的光栅化、光线追踪和混合渲染技术。

OschAI/VisioFirm

一个基于 AI 的图像和视频标注工具,利用 SAM2 和 YOLO 等模型,为计算机视觉数据集提供半自动化预标注。

PRBonn/RAP

一种使用流匹配将多个未对齐扫描对齐到统一坐标系的 3D 点云配准框架,将配准视为条件生成任务。

UB-Mannheim/zotero-ocr

一个使用 Tesseract OCR 为 Zotero 库中的扫描 PDF 添加可搜索文本层的 Zotero 插件。

Linketic/CityGaussian

基于高斯点阵的高保真、大规模 3D 场景重建框架,支持多 GPU 和几何精确渲染。

drivelineresearch/openbiomechanics

一个提供清洗后的运动捕捉文件、时序生物力学数据和身体评估指标的公开研究数据集,用于棒球投球与击球分析。

ScrollPrize/villa

一套用于Vesuvius Challenge的机器学习与计算机视觉工具,可从CT扫描中虚拟展开并读取古代赫库兰尼姆卷轴。

dstl/Stone-Soup

Stone Soup 是一个用于开发与测试目标跟踪与状态估计算法的框架。

SubhamTyagi/android-ocr

一款注重隐私的 Android 应用,使用 Tesseract 5 在超过 120 种语言中实现离线光学字符识别(OCR)

hmorimitsu/ptlflow

一个统一的 PyTorch Lightning 框架,用于训练和评估大量最先进的光学流估计模型。

oliverbravery/PrintGuard

一种本地视觉监控系统,实时检测3D打印失败,自动暂停打印机并提醒用户,避免浪费耗材。

inspatio/querysplat

QuerySplat 是一个 3D Gaussian Splatting 预测框架,通过解耦几何和外观表示来提高从图像进行 3D 场景重建的质量。

bytedeco/javacv

OpenCV 和 FFmpeg 等流行计算机视觉及视频处理库的 Java 封装,可在 Java 和 Android 上实现高性能的图像和视频处理。

tomas-gajarsky/facetorch

一个 Python 库,用于面部检测与分析,汇集开源模型并将其打包为可移植的 torch.export 模型,以实现高效推理。

ch-sa/labelCloud

一个轻量级的 3D 边界框标注工具,用于点云,能够生成 3D 目标检测和 6D 姿态估计的训练数据。

databricks-industry-solutions/pixels

一个医学影像解决方案加速器,可摄入并索引 DICOM 文件,以实现基于 SQL 的元数据分析和使用 MONAI 的 AI 驱动图像分割。

fastvideo/gpu-camera-sample

一个高性能 GPU 加速的相机应用程序,支持实时原始图像处理和 ISP 流水线,兼容多种工业相机。

jamjamjon/usls

一个基于 ONNX Runtime 的跨平台 Rust 库,可高效推理参数量低于 10 亿的视觉与视觉-语言模型。

pymatting/pymatting

一个使用 trimap 估计前景对象透明度的 Python 库,可实现精确的背景移除和合成。

apple-aiml-research/ml-hypersim

Hypersim 是一个大型合成室内数据集(约 77,000 张 HDR 图像,1.9TB),包含像素级几何、语义和材质通道,并附带基于 V‑Ray 的工具包,用于生成和编辑类似数据。专为训练和评估场景理解模型(深度、法线、分割、内在图像分解)而设计,包含预设的训练/验证/测试划分。

apple-aiml-research/ml-hugs

HUGS 是一个参考实现,使用高斯点阵从单个视频中重建可动画化的人体及其周围背景场景。

jasongzy/Make-It-Animatable

一个高效的框架,通过从3D网格预测关节位置和蒙皮权重,自动化创建可动画化的3D角色。

nmwsharp/polyscope

一个轻量级的 C++/Python 3D 查看器和 UI,可快速可视化网格和点云及其关联的标量和向量数据。

PFCCLab/PPOCRLabel

用于OCR的半自动图形标注工具,利用内置的PP-OCR模型自动检测和识别文本,用于训练数据集的创建。

amebalabs/TRex

一款 macOS 实用工具,使用 OCR 从任意屏幕区域提取不可选文本并直接复制到剪贴板。

rtr46/meikipop

一个通用的日本语 OCR 弹出词典,可从任何屏幕内容(包括游戏、漫画和视频)中即时查找单词。

deepdoctection/deepdoctection

一个用于文档理解的 Python 库,通过编排布局分析、OCR 和标记分类,从 PDF 和扫描件中提取结构化数据。

nutonomy/nuscenes-devkit

一个用于 nuScenes 和 nuImages 数据集的软件开发工具包,提供加载、分析和评估自动驾驶研究中多模态传感器数据的工具。

espressif/esp-who

专为 Espressif 芯片设计的图像处理开发平台,提供人脸与行人检测及二维码识别示例。

facebookresearch/OrienterNet

一种深度神经网络,通过将图像与 OpenStreetMap 等 2D 公开地图匹配,确定图像的位置和方向。

mjkwon2021/CAT-Net

一种通过分析 JPEG 压缩伪影来检测和定位图像篡改的网络,为图像取证研究提供工具。

Project-MONAI/MONAILabel

一个用于 AI 辅助医学图像标注的智能开源生态系统,采用服务器-客户端架构,为放射学、病理学和内窥镜检查实现交互式和自动化的标注。

yihong1120/Construction-Hazard-Detection

一个利用YOLO从实时摄像头流中检测PPE违规和接近危险的AI驱动建筑工地安全监控系统。

zae-bayern/elpv-dataset

一个包含 2,624 张已标注电致发光图像的基准数据集,用于视觉识别降低功率效率的缺陷。

Climate-Vision/ClimateVision

一个开源机器学习平台,使用深度学习和卫星影像自动检测森林砍伐、北极冰层融化和洪水。

cuevhv/mamma

MAMMA 是一个无标记的多人 3D 动作获取系统,能够从多视角视频中重建精确的人体姿态。

emgucv/emgucv

一个用于 OpenCV 库的跨平台 .NET 封装,使得图像处理功能可以在 .NET 兼容语言中使用。

tianrun-chen/SAM-Adapter-PyTorch

一个用于适配 Segment Anything Model (SAM) 的框架,以提升在伪装、阴影和医学影像等挑战性场景中的性能。

cameraui/camera.ui

一个自托管的安全摄像头平台,可在用户自有硬件上保留视频资料的同时,提供实时查看、录制以及本地设备AI检测功能。

facebookresearch/ocean

Ocean 是一个用于在移动、桌面和 Meta Quest 等多种平台上构建计算机视觉和增强现实应用的 C++ 框架。