imagej/imagej2

ImageJ2 是一个科学成像框架,它扩展了原始的 ImageJ,以支持多维图像数据以及跨多种编程语言的无头处理。

unrealcv/unrealcv

一个为 Unreal Engine 设计的插件,使计算机视觉研究人员能够使用 PyTorch 和 TensorFlow 等外部 AI 框架构建和交互虚拟世界。

microsoft/Cognitive-Samples-VideoFrameAnalysis

一个用于使用 Microsoft Cognitive Services Vision API 以近实时方式分析网络摄像头视频帧的 C# 库和示例应用程序。

zhanghang1989/PyTorch-Encoding

一个提供用于图像分类和语义分割的高级编码模块和模型库的 PyTorch 库。

apple-aiml-research/ml-aim

一组为多模态理解与图像识别提供高性能的大型自回归视觉编码器。

hzxie/GaussianCity

GaussianCity 是一个生成式 3D 城市合成工具,利用高斯泼溅技术创建无边界的大规模城市环境。

HarborYuan/ovsam

Segment Anything Model (SAM) 的一个开放式词汇扩展,能够同时进行交互式分割与数千种物体类别识别

hzxie/CityDreamer

CityDreamer 是一个研究级 PyTorch 框架,通过结合布局生成器、背景填充生成器和建筑实例生成器,可生成无限且逼真的 3D 城市景观。包含在大型 OSM/GoogleEarth 数据集上训练的代码、预训练检查点、Web 演示和 CLI 视频渲染功能。

cvg/DeepLSD

DeepLSD 是一种高精度线段检测器,结合深度学习与图像梯度,从真实世界图像中提取并精炼线段。

VCIP-RGBD/DFormer

DFormer 是一个用于 RGB‑D 语义分割的研究代码库,实现了 DFormer、DFormerv2(几何引导注意力)和 DFormer++(高效高精度变体)。包含预训练脚本、数据集助手、训练/评估流水线以及 NYU‑Depth v2 和 SUN‑RGBD 的预训练权重。该仓库是一个真实的 AI/ML 项目。

ria-com/nomeroff-net

一个使用 YOLOv8 和基于 RNN 的 OCR 的开源 Python 框架,可跨多个国家自动检测和读取车牌。

google-ar/arcore-unity-extensions

一套为 Unity AR Foundation 提供 Google ARCore 增强现实功能的原生 API 访问扩展包。

QuinnDamerell/OctoPrint-OctoEverywhere

一款为3D打印机提供远程访问和监控服务的系统,包含AI驱动的打印失败检测功能,可自动停止失败的打印。

half-potato/radiance_meshes

一个用于 Radiance Meshes 的训练框架,可从图像进行体积重建,并提供针对移动端网页浏览优化模型的选项。

tensorflow/graphics

一个为 TensorFlow 提供可微分图形与几何层 的 库,通过“分析与合成”进行分析,实现 3D 视觉模型的自我监督式训练。

HasnainRaz/Fast-SRGAN

基于 SR-GAN 的实时超分辨率实现,利用像素洗牌高效地将低分辨率视频上采样至高分辨率。

levyflux/AViD

AViD 是一个使用 LoRA 和 EMA 进行微调的框架,可高效地将开放词汇对象检测器 Grounding DINO 适配到自定义数据集。

lartpang/SAMs-CDConcepts-Eval

一个全面的评估框架,用于测试 SAM 和 SAM 2 在图像和视频中分割上下文相关概念(如医学病变和工业缺陷)的能力。

Luo-Yihao/FaithC

一种近乎无损的 3D 体素表示系统,通过 Faithful Contour Tokens (FCTs) 替代 SDF 和 Marching Cubes,以保留锐利边缘和内部结构。

google-ar/arcore-ios-sdk

一个将 Google 的跨平台 ARCore 功能(包括云锚点和地理空间 API)引入 iOS 应用的软件开发工具包。

arthurflor23/handwritten-text-recognition

基于 TensorFlow 的框架,支持广泛的数据增强和多种标准 HTR 数据集,用于手写文本识别与合成。

openMVG/openMVG

用于从图像(摄影测量)进行3D重建的C++框架,提供用于解决运动结构问题的库和流水线。

argoverse/argoverse-api

一个用于访问自动驾驶研究中 HD 地图、3D 跟踪数据和运动预测序列的 Python API。

ShenhanQian/VHAP

VHAP 是一个用于人头对齐的光度优化管道,利用自适应外观先验来追踪单目和多视角视频中无特征点的区域,如头发和耳朵。

lartpang/PySODMetrics

一个轻量级的 Python 库,用于计算显著对象检测(SOD)指标,提供比 Matlab 基础评估工具箱更快且可验证的替代方案。

naruya/gaussian-vrm

一个three.js实现,可让现实感强、可动画的3D角色在Web、移动和VR应用中渲染。

worldcoin/open-iris

利用计算机视觉和机器学习技术,实现安全生物识别验证与大规模唯一性确认的高级虹膜识别流水线。

MrGiovanni/SyntheticTumors

一种用于生成逼真合成肿瘤以训练AI分割模型的框架,减少对人工标注医学影像数据的依赖。

MrGiovanni/AbdomenAtlas

通过人机协同 AI,提供大规模多器官 CT 数据集和工具集,将腹部分割的标注时间从数十年缩短至数周。

foo123/FILTER.js

一个纯 JavaScript 图像和视频处理及计算机视觉库,支持通过 WebGL、WebAssembly 和 Web Workers 实现硬件加速。

Unity-Technologies/arfoundation-samples

一组官方 Unity 示例场景和代码,展示如何使用 AR Foundation 实现跨多平台的增强现实功能。

pyushkevich/itksnap

ITK-SNAP 是一款开源软件应用程序,用于在医学图像中对解剖结构进行用户引导的 3D 活性轮廓分割。

tudelft-iv/view-of-delft-dataset

一个包含同步LiDAR、相机和3+1D雷达数据的多传感器汽车数据集,附带城市交通中道路使用者检测的3D边界框标注。

dstndstn/astrometry.net

Astrometry.net 是一个用于自动识别天文图像的工具,为未知天空位置的图像提供天体坐标和校准元数据。

MouseLand/suite2p

一个用于处理双光子钙成像数据的流程,通过配准、ROI检测和峰检测提取大规模神经活动。

ducha-aiki/pydegensac

用于从稀疏图像对应关系中估计单应性和基础矩阵的 Python 封装,基于 LO-RANSAC 和 DEGENSAC

mapillary/OpenSfM

一个基于 Python 的结构从运动(SfM)库,可从多张图像重建 3D 场景和相机姿态,并整合传感器数据以实现地理对齐。

bcmi/Image-Harmonization-Dataset-iHarmony4

提供大规模图像调和数据集(iHarmony4)和 DoveNet 的 PyTorch 实现,帮助模型使插入对象在合成图像中看起来更自然。

Pointcept/Concerto

一种用于从 3D 点云中提取高质量空间表示的联合 2D-3D 自监督预训练 Point Transformer V3 模型。

hanna-xu/U2Fusion

一个统一的无监督图像融合网络,能将多模态、多重曝光和多焦点图像合并为单一高质量图像,且无需标记训练数据。

IvanDrokin/torch-conv-kan

TorchConv‑KAN 是一个 PyTorch 库,实现卷积层,其中每个核由一组可学习的一元函数(KAN、Fast‑KAN、Cheby‑KAN 等)构成。它包含多种层变体、CNN 风格模型家族(ResKANet、DenseKANet、VGG‑KAN、U‑Net‑KAN)、预训练的 ImageNet‑1k 检查点,以及使用 Accelerate、Hydra、WandB 和 Ray‑Tune 的训练脚本。该项目正在积极开发中,并配套发表了一篇关于柯尔莫哥洛夫-阿诺德卷积的研究论文。

MIC-DKFZ/nnDetection

一种用于医学图像中物体同时定位与分类的自配置框架,通过自动化配置流程,适应任意医学检测问题。

Mark12Ding/SAM2Long

SAM2Long 是一种无需训练的 SAM 2 增强技术,通过记忆树防止误差累积,提升长视频中的对象分割性能。

Altaheri/EEG-ATCNet

基于TensorFlow的注意力时序卷积网络(ATCNet)实现,用于分类运动想象EEG信号,以提升脑-计算机接口性能。

Sompote/DINOV3-YOLOV12

一种结合YOLOv12与DINOv3的混合物体检测框架,可在小规模或复杂数据集上提供更优精度和更快收敛速度。

schappim/macOCR

一款适用于 macOS 的命令行 OCR 工具,使用 Apple 的 Vision 框架从屏幕、图像或 PDF 中提取文本、QR 码和条形码。

EyeTrackVR/EyeTrackVR

一个开源且价格实惠的VR眼动追踪平台,可通过OSC和UDP协议在VRChat中实现眼动追踪。

nipy/nipype

一个 Python 项目,为神经影像软件提供统一接口,使用户能够将不同包的工具组合成单一、可复现的工作流。