MCG-NJU/MOTIP
MOTIP 是一个多目标跟踪框架,它将跟踪视为上下文内 ID 预测问题,从而直接解码当前检测结果的 ID 标签。
xiaobiaodu/Mobile-GS
Mobile-GS 是一个专为在移动设备上实现高质量 3D 场景渲染而设计的实时高斯点阵框架。
allenai/olmoearth_pretrain
一系列用于地球观测的跨模态、时空基础模型,为利用卫星数据进行行星智能提供可扩展的框架。
Tsinghua-MARS-Lab/SLAM-Former
一种基于 Transformer 的 SLAM 系统,将定位与建图统一为单一模型,用于从图像序列中实现 3D 重建和相机跟踪。
alicevision/CCTag
一个用于检测和精确精确定位由同心圆组成的圆形基准标记物的计算机视觉库。
81NewArk/AntiCAP-WebApi
使用模型推理解决 CAPTCHA 的 Web API 服务,支持本地和公共网络部署。
bhky/opennsfw2
一个基于 Keras 的 Yahoo Open-NSFW 模型实现,用于检测图像和视频中的色情内容。
RenderKit/oidn
一种基于深度学习的高性能去噪滤波器库,通过去除蒙特卡洛噪声,显著减少光线追踪应用的渲染时间。
myBoris/wzry_ai
一个开源AI模型项目,旨在通过机器学习和自定义屏幕坐标映射,实现《王者荣耀》游戏的自动化玩法。
LuisaGroup/LuisaRender
支持 CUDA、DirectX 和 Metal 等多种硬件后端的高性能跨平台蒙特卡洛渲染器,适用于流式架构。
henrywoo/kazam
一款包含 AI 驱动 OCR 功能的 Linux 屏幕录制与广播工具,可从屏幕截图中提取文本。
wenbowen123/BundleTrack
BundleTrack 是一个实时 6D 位姿跟踪框架,能够在不需要对象或其类别的 3D CAD 模型的情况下,跟踪新颖对象。
OpenStitching/stitching
一个使用 OpenCV 从重叠图像创建全景图的快速且稳健的 Python 包。
NativeSensors/EyeGestures
一个开源眼动追踪库,可使用标准网络摄像头和手机摄像头而非昂贵的专用硬件,实现眼控界面。
facebookresearch/projectaria_tools
一套用于处理和分析 Project Aria AR 眼镜传感器和机器感知数据的 C++/Python 工具,支持 AI 和机器感知研究。
FaceAISDK/FaceAISDK_Android
适用于 Android 的离线本地人脸识别 SDK,提供无需云连接的面部检测、识别和活体检测功能。
facebookresearch/Ego4d
一个面向 Ego4D 和 Ego-Exo4D 的工具箱与数据集基础设施,提供下载、处理以及在大规模第一人称和多视角视频数据集上训练模型的工具。
yuxumin/PoinTr
PoinTr 是一个基于 Transformer 的点云补全模型,通过几何感知编码器-解码器架构,从部分点云重建出完整的 3D 物件。
MeshInspector/MeshLib
一个跨多种编程语言的高性能 3D 网格处理 SDK,提供修复、优化和操作 3D 数据的工具。
hbb1/2d-gaussian-splatting
一种使用定向圆盘(surfels)的2D高斯溅射实现,可创建几何精确的辐射场并生成高质量3D网格。
nipreps/fmriprep
一个利用先进神经影像工具组合实现运动校正、归一化和脑提取自动化的 fMRI 数据稳健预处理管道。
lolishinshi/imsearch
一款使用特征点匹配,通过小裁剪截图在大规模数据集中查找完整图像的工具。
cdcseacave/openMVS
OpenMVS 是一个多视图立体重建库,可将稀疏点云和相机位姿转换为详细且带纹理的 3D 网格。
microsoft/BiomedParse
一种支持 2D 和 3D 体积推理的跨九种成像模态的生物医学对象联合分割、检测和识别的基础模型。
thiagotigaz/ocr-it
一款 Chrome 和 Firefox 扩展,使用本地 OCR 从禁止文本选择的分页网页文档和查看器中提取文本。
ohirose/bcpd
BCPD 是一个兼容 MATLAB 的命令行套件,用于点云和函数(DET)的贝叶斯非刚性配准,具有加速的“++”模式、多种核选项,以及用于 3D 重建、形状传输和空间组学数据的演示。
facebook/ThreatExchange
一组用于内容审核和安全威胁情报的工具和 API,包含用于相似性匹配的图像和视频哈希算法。
Linfeng-Tang/Image-Fusion
涵盖多模态、数字摄影和遥感图像融合技术的图像融合研究论文与代码实现的全面集合。
freesurfer/freesurfer
FreeSurfer 是一个开源软件套件,用于处理、分析和可视化来自结构和功能研究的人类脑部 MRI 数据。
dipy/dipy
DIPY 是一个专为 MR 扩散成像分析设计的 Python 库,为研究人员提供处理医学影像数据的工具。
NVIDIA-AI-IOT/Lidar_AI_Solution
针对 3D Lidar 感知的高度优化的 CUDA 和 TensorRT 实现集合,加速自动驾驶系统的稀疏卷积和传感器融合。
the-database/mpv-AnimeJaNai
一个定制的 mpv 视频播放器构建版本及一套 Real-ESRGAN 模型,能够使用 TensorRT 或 DirectML 实现动漫内容的实时 4K 放大。
naver/anny
Anny 是一个基于 PyTorch 的开源可微分人体网格模型,覆盖所有年龄段。它提供多种骨骼绑定(紧凑的 104 骨骼默认值、完整的 MakeHuman)、多种网格拓扑(包括 SMPL-X 和 SOMA),以及细粒度的形状、局部变化和面部动作参数。通过 pip 安装,运行简单的 Python 示例以输出 .ply 网格,或启动交互式 Gradio 演示。该库采用 Apache-2.0 许可证,基于 MakeHuman 资产构建,旨在用于姿态估计、动画和跨年龄身体建模等研究/生产任务。
arcships/light-ocr
适用于 Node.js 和 C++ 的快速离线 OCR 库,支持本地图像和 PDF 的文本识别,并具备内置硬件加速功能。
kha-white/manga-ocr
一款专为日式漫画优化的 OCR 工具,能够识别多行文字、振假名,以及垂直和水平布局。
open-edge-platform/geti
一个用于构建计算机视觉 AI 模型的端到端平台,提供标注、训练和优化工具,以便在边缘硬件上进行部署。
voxelmorph/voxelmorph
一个基于学习的图像配准库,使用神经网络对齐图像并模拟变形,其特点是通过 SynthMorph 实现与对比度无关的训练。
JEOresearch/EyeTracker
一种基于Python的轻量级3D眼动追踪算法,可从视频或图像数据中检测瞳孔椭圆。
hank-ai/darknet
用 C/C++ 和 CUDA 编写的开源神经网络框架,驱动 YOLO 实时物体检测系统。
hku-mars/GS-SDF
一种基于 LiDAR 增强的系统,结合高斯点阵与神经符号距离场(SDF),实现几何一致的照片级真实感渲染与三维表面重建。
stereolabs/zed-sdk
一个为 ZED 相机提供的跨平台空间感知 SDK,提供实时深度感测、物体检测和位置追踪。
shimat/opencvsharp
OpenCV 的跨平台.NET 封装库,为 C# 开发者提供全面的计算机视觉和图像处理功能。
leblancfg/autocrop
一个基于 Python 的工具,使用 YuNet 神经网络自动裁剪围绕最大检测到的脸部的图像,适合头像和身份证照片。
imagej/ImageJ
ImageJ 是一款用于处理和分析科学图像的公有领域软件,旨在通过 Java 在多个平台上运行。
kha-white/mokuro
一个对日语漫画执行文本检测和 OCR 的工具,可在浏览器中创建可选择的文本叠加层,便于语言学习者使用弹出式词典。
ngageoint/hootenanny
一个使用机器学习将多个地理空间数据集融合为单一无缝地图的开源地图数据融合工具。
facebookresearch/pytorch3d
一个基于 PyTorch 的 3D 计算机视觉研究库,提供可微渲染以及用于操作 3D 网格和点云的高效工具。
luxonis/depthai-core
用于与 Luxonis DepthAI 硬件接口以构建空间 AI 和计算机视觉应用的 C++ 和 Python 库。