MITK/MITK
一个开源的 C++ 工具包,通过结合 ITK 和 VTK,用于开发交互式医学图像处理软件。
NeoGeographyToolkit/StereoPipeline
NASA 开发的一套开源自动化地理测量与立体摄影测量工具,用于将立体图像处理为 3D 地形模型和制图产品。
savvasdalkitsis/uhuruphotos-android
一个开源的 Android 媒体画廊,提供隐私优先的 Google 相册替代方案,支持通过 LibrePhotos 服务器实现 AI 驱动的搜索与人脸识别。
soruly/trace.moe
使用图像向量搜索识别截图的具体动画、集数和时间戳的动画场景搜索引擎。
gowvp/owl
一个将 GB28181、ONVIF 和 RTSP 流统一到单一浏览器管理界面的开源网络视频平台,支持 AI 告警功能。
flatironinstitute/CaImAn
用于大规模钙成像和电压成像数据分析的可扩展 Python 工具箱,提供用于运动校正、源提取和脉冲去卷积的可扩展算法。
ros-perception/image_pipeline
一个将原始相机图像处理为机器人高级视觉处理可用格式的ROS 2包。
nguyenq/tess4j
Tess4J 是 Tesseract OCR API 的 Java JNA 包装器,可让开发者从各种图像格式和 PDF 文档中提取文本。
aws-samples/amazon-textract-textractor
一个简化使用 Amazon Textract 从文档中提取文本、表格、表单和身份数据的 Python 包。
yo-WASSUP/Good-GYM
一个使用 RTMPose 进行实时姿势检测,并通过网络摄像头自动计数运动次数的 AI 健身助理。
TissueImageAnalytics/tiatoolbox
基于 PyTorch 的计算病理学工具箱,提供从数据加载到可视化的端到端 API。
LSH9832/edgeyolo
EdgeYOLO 是一款无锚点的目标检测器,针对 Nvidia Jetson 等嵌入式边缘设备的实时性能进行优化,支持包括 TensorRT 与 RKNN 在内的多种部署格式。
deltacv/VisionGraph
一个用于创建和原型化 OpenCV 算法的可视化节点编辑器,支持实时管道预览。
apple-aiml-research/ml-fastvit
一种利用结构重参数化的快速混合视觉 Transformer,可在移动设备上实现低延迟图像分类。
shaoshengsong/DeepSORT
一个用 C++ 编写的实时多对象跟踪系统,使用 YOLO 和 ONNX Runtime 实现 ByteTrack、OC-SORT、Deep OC-SORT 和 DeepSORT。
apple-aiml-research/ml-mobileone
MobileOne 提供了五个超快速 CNN 主干网络(S0-S4)的 PyTorch 实现,可在 iPhone 12 Pro 上实现 ≤ 2 毫秒延迟下 71–79% 的 ImageNet Top-1 准确率。仓库包含训练就绪和推理就绪的检查点、用于设备部署的 CoreML 模型,以及一个 iOS 基准测试应用(ModelBench)。通过重参数化,训练时的分支在推理时被融合为单一快速网络。
apple-aiml-research/ml-matrix3d
Matrix3D 是一个统一的摄影测量模型,可执行姿态估计、深度预测和新视角合成,从而实现从单张或少量无姿态图像进行3D重建。
cvignac/DiGress
使用 Graph Transformer 架构的离散去噪扩散模型,用于生成合成图和分子结构。
EasyLive2D/relive2d
一个 Live2D 原生 SDK 的 Python 封装,允许无需 Web 引擎即可使用 OpenGL 直接加载和渲染 Live2D 模型。
HZAI-ZJNU/Mamba-YOLO
Mamba YOLO 是一种物体检测基线,通过用状态空间模型替代传统架构,为实时检测提供一种高效的替代方案。
fieldtrip/fieldtrip
支持多种硬件格式和源重建的 MEG、EEG 和 iEEG 数据高级分析 MATLAB 工具箱。
sgoldenlab/simba
SimBA是一款基于GUI的工具包,使研究人员无需编程技能即可训练监督式机器学习分类器,自动检测和量化从姿态估计视频数据中提取的动物行为。它将原始追踪数据转化为经过验证的行为分类和丰富的下游分析,助力行为神经科学研究。
ecmwf-lab/ai-models
一个用于运行基于 AI 的气象预测模型的命令行工具,提供统一的接口用于数据获取和模型执行。
isl-org/Open3D-ML
Open3D 的扩展,提供用于 3D 机器学习任务(如语义分割和对象检测)的工具、预训练模型和管道。
ANTsX/ANTs
一个用于高维医学图像配准与分割的 C++ 库,用于跨物种和器官系统分析脑结构与功能。
MiniAiLive/Android-FaceRecognition
用于安全和金融科技应用中防止欺骗的 Android SDK,支持面部识别与 3D 被动式活体检测。
supervisely/supervisely
Supervisely 是一个基于 Web 的计算机视觉平台,结合了数据标注、模型训练、推理和协作工具。它提供用于自动化的 Python SDK 和 REST API,以及一个开发者可以创建无界面脚本、交互式 UI 工具或标注工具扩展并一键部署的应用生态系统。
PozzettiAndrea/ComfyUI-DepthAnythingV3
集成 Depth Anything V3 的自定义 ComfyUI 节点,实现高质量深度估计、3D 点云重建和一致视频深度映射。
sh4den/Montscan
一个自动化文档处理器,通过 Ollama 使用本地 Vision AI 来分析扫描的 PDF,并自动以描述性文件名重命名它们。
cosanlab/py-feat
一个用于面部表情研究的 Python 工具箱,可从图像和视频中检测人脸并提取情绪、面部肌肉运动和关键点。
Zyphra/zuna
ZUNA1.1 是一个用于 EEG 的开源基础模型,利用 3D 头皮坐标实现信号去噪、缺失通道重建和稀疏电极布局的上采样。
Pixel-Talk/PEAR
PEAR 是一个实时框架,能够从图像或视频中以 100 FPS 预测富有表现力的 3D 人体网格参数。
scu-zjz/IMDLBenCo
提供图像篡改检测与定位的全面基准和模块化代码库,包含标准化组件和最先进模型实现。
Mengqi-Lei/count-anything
Count Anything 是一种基于自然语言查询在图像中计数对象的研究模型。它通过结合稀疏区域计数器和密集像素计数器,并使用无参数融合步骤,在六个领域(场景、卫星、医学等)中实现跨域工作。该仓库提供预训练检查点、训练/评估脚本,以及大型 CLOC 数据集的准备说明。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter 提供专为边缘设备优化的紧凑视觉变换器(ViTs),实现低延迟下的高性能目标检测、实例分割和姿态估计。
ultralytics/xview-yolov3
一种专为在 xView 卫星影像数据集上进行遥感应用的对象检测训练和运行而设计的 YOLOv3 特化实现。
mlmed/torchxrayvision
一个用于胸部 X 光数据集和模型的库,提供预训练模型以及统一接口,以便在多个公开胸部 X 光数据集上工作。
tschnz/Live-Video-Magnification
一种使用 Eulerian video magnification 技术实时放大微小运动和颜色变化的视频放大工具。
lightly-ai/lightly-studio
一个使用嵌入来帮助用户高效管理与标注图像和视频数据的本地优先数据整理与标注工具。
dog-qiuqiu/FastestDet
一种超轻量、无锚点的实时目标检测算法,针对 ARM CPU 与嵌入式设备的高速推理进行优化。
open-edge-platform/dlstreamer
一个基于 GStreamer 和 OpenVINO 的媒体分析框架,可在 Intel CPU、GPU 和 NPU 上实现硬件加速的视频和音频智能流水线。
xrdevrob/QuestCameraKit
一组适用于 Meta Quest 3/3S 的 Unity 示例,支持通过物体检测、QR 码追踪和多模态 AI 实现对周围环境的理解,打造混合现实体验。
torch-points3d/torch-points3d
一个用于3D分类、分割和检测的点云分析深度学习框架,提供高级API和一系列最先进的模型库。
BGU-CS-VIL/WTConv
一个实现小波卷积的库,为 CNN 提供大感受野,配备针对 CUDA、Metal 和 Triton 优化的后端。
reall3d-com/Reall3dViewer
基于 Three.js 的 Web 渲染器,支持大规模 3D 高斯点云的高性能流式传输与自适应 LOD。
cre185/InstantSfM
一种 GPU 原生的结构从运动(SfM)流水线,可加速从 2D 图像重建 3D 结构的过程,包括对 3D 高斯点云(3DGS)的集成支持。
ilastik/ilastik
用于分割、分类、追踪和计数细胞及其他实验图像数据的交互式机器学习工具包。
Ma-Zhuang/OmniNWM
OmniNWM是一个研究代码库,构建用于自动驾驶仿真的全景多模态世界模型。它从车辆轨迹联合生成RGB、语义、深度和3D占用图,使用归一化Plücker射线图实现精确控制,并提供基于占用的密集奖励以支持闭环策略评估。该仓库包含安装步骤(含对`transformers`的手动补丁)、nuScenes数据准备说明、预训练检查点下载链接,以及用于推理、分布外测试和分阶段训练的脚本。