vturrisi/solo-learn

基于 PyTorch Lightning 的自监督学习方法库,用于无监督视觉表示学习,提供训练和比较 SOTA 视觉模型的统一环境。

kevinhughes27/TensorKart

这是一个基于 TensorFlow 的项目,通过学习人类的游戏录像来训练 AI 智能体驾驶《马力欧卡丁车 64》。

spytensor/prepare_detection_dataset

一组用于在 CSV、COCO、Pascal VOC 和 Labelme 格式之间转换目标检测数据集标注的 Python 脚本。

XieZhiFa/IdCardOCR

一个适用于 Android 的离线 OCR 库,可在无需互联网连接的情况下实现对中国身份证、驾驶证和护照的高速识别。

kadirnar/segment-anything-video

Segment Anything Model (SAM) 的打包版本,支持通过 pip 简易安装,并扩展了视频分割与云 GPU 集成功能。

neka-nat/probreg

一种使用概率模型的点云配准库,为刚性和非刚性变换提供了比ICP更稳健的替代方案。

facebookresearch/mobile-vision

一个包含 FBNet 和 ChamNet 等硬件感知高效 ConvNet 模型及工具的集合,旨在优化移动设备上的计算机视觉性能和延迟。

XiandaGuo/OpenStereo

一个整合了17个数据集和多个最先进模型的深度估计综合基准与框架。

JoHof/lungmask

一套用于CT扫描中自动肺分割的训练好的U-net模型,能够处理严重病理并实现肺叶特异性掩码。

TechStark/opencv-js

一个将 OpenCV 计算机视觉库带入 Node.js 和 Web 浏览器的 NPM 包,使 JavaScript 能够执行实时人脸检测等任务。

oarriaga/paz

用于自主系统的分层感知库,提供使用 TensorFlow 和 Keras 构建计算机视觉流水线的模块化 API。

Deep-MI/FastSurfer

一种基于深度学习的快速神经影像处理流程,用于脑部 MRI 图像的体积和基于表面的厚度分析,作为 FreeSurfer 的高速替代方案。

yzfzzz/depth-detect

一个高性能 C++ 和 TensorRT 框架,融合 YOLO 物体检测与单目/双目深度估计,用于实时追踪物体并估算其运动状态。

prov-gigapath/prov-gigapath

一种用于数字病理学的全切片基础模型,采用切片与全切片编码器架构,用于分析巨大的病理图像。

david8862/keras-YOLOv3-model-set

一个全面的 TensorFlow Keras 流水线,支持 YOLOv2、v3 和 v4 物体检测,涵盖多种骨干网络、高级训练技术,并支持设备端部署。

talmolab/sleap

一个利用人机协同 GUI 快速标注并量化动物行为的多动物姿态追踪深度学习框架。

francescofugazzi/3dgsconverter

一款高性能工具,支持在多种格式间转换3D高斯溅射文件,并具备GPU加速过滤和压缩功能。

matiasdelellis/facerecognition

一个为 Nextcloud 设计的面部识别应用,可在本地检测、分析并分组图像中的人脸,实现私密的基于人物的照片组织。

FaceAISDK/FaceRecognition_ReactNative

一个 React Native 演示和集成指南,用于支持 iOS 和 Android 上 1:1 验证和活体检测的离线人脸识别 SDK。

kanadeblisst00/wechat_ocr

一个允许用户调用 WeChat Windows 客户端内置本地 OCR 模型来对图像进行文本识别的 Python 库。

kyegomez/VisionMamba

Vision Mamba是一种双向状态空间模型,用于高效视觉表示学习,其速度显著快于传统视觉Transformer,且内存效率更高。

facebookresearch/pixio

Pixio 是一种通过增强像素重建预训练优化的视觉编码器,适用于深度估计和语义分割等密集预测任务。

microblink/blinkid-android

使用机器学习和原生 C++ 库的 Android SDK,用于安全的身份证明文件扫描和数据提取。

jiafeng5513/Evision

一个使用 ELAS 和 ADCensus 等算法进行相机校准、视差映射和 3D 重建的双目视觉系统。

infinitered/react-native-mlkit

一组封装 Google 的 MLKit 原生库的 Expo 模块,使 Expo 应用能够实现人脸和物体检测等设备端机器学习功能。

hujiecpp/PE3R

PE3R 是一种感知高效的 3D 重建系统,利用零样本泛化将 2D 图像转换为语义理解的 3D 场景。

dluvizon/deephar

一个用于实时2D和3D人体姿态估计及动作识别的多任务深度学习框架。

aparsoft/yolo-streamlit-detection-tracking

基于Streamlit的视觉工作室,使用YOLO26和YOLO World v2实现实时目标检测、分割、姿态估计和跟踪。

prov-gigatime/GigaTIME

一个从常规 H&E 病理切片生成肿瘤微环境建模用虚拟空间蛋白组学(mIF)特征的多模态 AI 项目。

AI4EPS/PhaseNet

一种基于深度神经网络的方法,可从原始地震数据中自动拾取地震到时(P波和S波)

ml-struct-bio/cryodrgn

一种基于神经网络的算法,用于对异质性冷冻电镜和冷冻电镜断层成像中的连续3D结构分布进行建模。

lartpang/PyIRSTDMetrics

一个轻量级的 Python 库,用于使用像素级、目标级和混合指标分析红外小目标检测模型的性能。

lingxitong/MIL_BASELINE

一个用于计算病理学中多重实例学习(MIL)的统一库,提供标准化框架,用于实现和比较多种MIL架构以分析全切片图像。

FaceAISDK/FaceAISDK_iOS

一款用于 iOS 的设备端全离线 SDK,提供人脸检测、识别和活体检测,无需网络即可实现安全的身份验证。

quickpose/quickpose-ios-sdk

用于实时姿态估计和骨骼追踪的 iOS SDK,提供运动计数和活动范围分析的预构建工具。

PozzettiAndrea/ComfyUI-SAM3DBody

Meta的SAM 3D Body的ComfyUI封装,可实现从单张图像中恢复全身体3D人体网格。

paninski-lab/lightning-pose

一个使用 Transformer 架构的端到端动物姿态估计包,可在单视角和多视角视频中稳健追踪运动,尤其在遮挡情况下表现优异。

rendeirolab/LazySlide

一个 Python 框架,用于全切片图像分析,与 scverse 生态系统集成,实现可互操作且可扩展的组织学工作流。

radekd91/inferno

用于野外环境下的3D面部重建与动画的深度学习库,提供音视频驱动虚拟形象和情绪识别工具。

NKI-AI/direct

一个用于加速 MRI 重建的 PyTorch 工具包,提供从采样、重建到验证的端到端深度学习流程。

BuntingLabs/mundi.ai

Mundi 是一个开源网络 GIS,利用 LLM 自动化矢量、栅格和点云数据的地理处理算法与符号化编辑。

mapillary/seamseg

一种基于CNN的全景分割架构,可为图像中每个像素预测类别和实例特定的标签。

RongLiu-Leo/beta-splatting

一项实时辐射场渲染项目,通过用可变形贝塔核替代高斯核,提升几何细节、色彩表现和内存效率。

RizwanMunawar/yolov7-object-tracking

一个集成 YOLOv7 和 YOLOv8,用于在各种来源的视频流中进行实时目标检测和跟踪的计算机视觉项目。

realsee-developer/RealSee3D

专为 3D 重建和语义分割 AI 模型训练设计的包含 10,000 个室内场景的大规模多视图 RGB-D 数据集。

Tobias-Fischer/rt_gene

使用 PyTorch 和 ROS 2 的实时眼动与眨眼估计系统,用于在自然环境中追踪视线方向和眨眼概率。

TIGER-AI-Lab/Pixel-Reasoner

Pixel Reasoner 是一个研究框架,为视觉-语言模型添加视觉操作(如缩放、选帧等),通过指令微调和好奇心驱动的强化学习进行训练。该仓库提供安装指南、SFT 和 RL 阶段的脚本、预训练的 7B 检查点、数据集以及图像和视频基准的评估流水线。

jabberjabberjabber/ImageIndexer

一款本地 AI 工具,可自动生成图像的说明文字和关键词,并将其直接写入图像元数据中,以便于索引和搜索。