ruvnet/RuView

一个将无线电波转化为空间智能的WiFi感知平台,实现无需摄像头的人员存在、生命体征和姿态估计。

roboflow/supervision

一个计算机视觉工具包,为数据加载、可视化、数据集管理提供与模型无关的构建模块,以加速视觉应用开发。

immich-app/immich

具备 AI 驱动人脸识别和 CLIP 基础搜索的高性能自托管照片和视频管理解决方案。

img2threejs/img2threejs

img2threejs 是一个由 Python 支持的技能,允许 LLM 将单张参考图转换为过程化 Three.js 模型。它构建一个规范,运行带门禁的视觉审查循环,并生成使用基元和着色器重建物体的 TypeScript 代码,可直接用于动画制作。该系统可通过领域插件(如 CS2 武器皮肤)进行扩展,并包含一个实时演示库。

baidu/Unlimited-OCR

用于复杂文档、PDF 和多页图像的一次完成长距离解析的多模态 OCR 模型。

PaddlePaddle/PaddleOCR

PaddleOCR 是一个开源 OCR 和文档 AI 工具包,可将图像或 PDF 转换为结构化、LLM 就绪的文本、表格和 Markdown/JSON。它提供多语言场景文本模型(PP-OCRv6)和轻量级视觉-语言模型(PaddleOCR-VL、PP-StructureV3),具备业界领先精度、快速 CPU/GPU 推理能力,并支持从 Docker 到浏览器 SDK 的多种部署方式。与 Dify、RAGFlow 等 RAG 平台集成,可作为构建 AI 代理和检索增强生成流水线的数据引擎。

om-ai-lab/VLX-Seek

VLX‑Seek 是一个开源视觉-语言模型,可为边缘设备代理执行细粒度感知。它生成区域提案,将每个区域编码为特殊令牌,并让语言模型通过选择这些令牌来回答问题——从而为检测、指代表达理解、OCR、计数和 VQA 生成紧凑、可解析的输出。该仓库包含推理代码、Python API 和 10 B 检查点(权重托管在 Hugging Face 上)。

huawei-bayerlab/marigold-v2

Marigold V2 是一个研究代码库,将预训练的扩散变换器(Qwen‑Image‑Edit‑2509)重新用于快速、单步预测单目深度、透视深度、表面法线和反照率。它提供低成本微调(单个 32 GB GPU 上约 5 天)、最先进基准测试结果、即用型推理/评估脚本,以及可扩展至新密集视觉任务的模块化 YAML 驱动训练框架。

playcanvas/supersplat

一个基于浏览器的开源工具,用于检查、编辑和优化 3D 高斯斑点。

ultralytics/ultralytics

一个全面的计算机视觉框架,提供用于实时目标检测、分割、分类和姿态估计的 YOLO 模型。

blakeblackshear/frigate

一个与 Home Assistant 紧密集成的本地 NVR,为 IP 摄像头提供实时 AI 物体检测。

julyx10/lap

适用于 macOS、Windows 和 Linux 的私有、本地优先照片管理器,利用本地 AI 实现搜索和人脸聚类,无需上传至云端。

viettranx/3dviz-pro-max

3Dviz Pro Max 是一个 AI 代理技能,使大型语言模型能够将自然语言描述转化为完整的 Three.js 场景。它提供十步工作流、223 个食谱目录、22 个经验证的 Three.js 套件蓝图、风格默认值,以及 Python 辅助工具,可在无头 Chromium 中渲染场景、捕获 PNG 帧,并将观察结果反馈给模型以优化。通过将 `skills/3dviz-pro-max/` 文件夹链接到 Claude Code 或 Codex 安装,然后使用 Vite 运行捆绑的 37 个可运行演示。该项目采用 MIT 许可证,专注于可复现、基于证据的 3D 可视化,而非声称每个食谱都已完全渲染。

wilsjo2/OptiScaler-DLSSNR-PreSR-Multipass

一款利用 NVIDIA AI 增强支持游戏中的光照、细节和色彩的游戏模组,提供可自定义的神经渲染效果。

ooolabdev/ooosplat

一个本地桌面应用程序,通过自动化的本地流程将环绕视图视频或图像序列转换为 3D 高斯点云模型。

amap-cvlab/ABot-Recon

ABot-Recon 是一个流式 3D 重建系统,利用固定的 12 帧局部上下文,从长视频流中构建全局轨迹和点云,无需持久的长距离记忆。

MaaAssistantArknights/MaaAssistantArknights

一款基于图像识别和 OCR 的明日方舟自动化助手,用于自动化日常任务、资源 farming 和基地管理。

gazijarin/itsgiving

一个实时网络摄像头应用,通过检测面部表情和手势来触发匹配的迷因叠加,支持在视频会议中使用的虚拟摄像头。

facebookresearch/vggt-omega

VGGT-Omega 是一个计算机视觉模型,能够从图像中预测相机位姿和深度,以实现3D场景重建。

ika-rwth-aachen/ros2-depth-anything-v3-trt

一个使用 Depth Anything V3 和 TensorRT 加速的 ROS 2 节点,用于实时度量深度估计和点云生成。

tesseract-ocr/tesseract

Tesseract 是一个开源的 OCR 引擎和命令行工具,可将图像中的文字转换为超过 100 种语言的机器可读文本。

StarTrail-org/PixelRAG

PixelRAG 将网页、PDF 和图像渲染为截图块,使用视觉-语言模型嵌入,并构建 FAISS/Qdrant 向量索引,提供可搜索的 API(或 Claude 插件),使 LLM 能够基于视觉布局而非纯文本检索信息。

harry7557558/spirula-studio

一个独立的 3D Gaussian Splatting 流程,无需 Python、PyTorch 或 COLMAP 即可将照片和视频转换为 3D 模型。

hacksider/Deep-Live-Cam

一款实时人脸交换和深度伪造工具,仅需一张源图像即可替换视频或实时网络摄像头画面中的人脸。

agamrossen/VolAnti

一种通过螺旋桨的谐波声音而非无线电信号来识别多旋翼无人机的开源声学无人机检测系统。

ace-trump-tech/DeltaForce-OBS-Locker

基于YOLOv14的实时对象检测与目标锁定系统,可过滤环境误报,精准识别Delta Force游戏中的角色

ocrmypdf/OCRmyPDF

一个命令行工具,为扫描 PDF 添加 OCR 文本层,使其可搜索且可复制粘贴,同时保持图像质量。

colmap/colmap

COLMAP 是一个开源的结构从运动(SfM)和多视图立体(MVS)管道,可自动将照片集合转换为 3D 模型。它提供 GUI、命令行工具、Python 绑定、GPU 加速特征提取以及跨平台二进制包,是计算机视觉、机器人、AR/VR 以及任何需要相机位姿和密集场景几何的流程中研究与应用的首选基础工具。

Robbyant/lingbot-map

LingBot‑Map 是一个前馈式 3D 重建模型,通过几何上下文变换器将视频帧流式传输,并使用分页 KV 缓存(FlashInfer)保持低内存占用。它在中等 GPU 上以约 20 fps 运行,支持通过关键帧间隔或窗口化推理处理极长序列,并附带可直接运行的演示、离线批处理渲染器以及 HuggingFace/ModelScope 上的预训练检查点。

opencv/opencv

OpenCV 是一个开源计算机视觉库,为 AI 和视觉感知开发提供工具和算法。

RapidAI/RapidOCR

一款将 PaddleOCR 模型转换为 ONNX 格式的开源 OCR 工具,可在多个平台和语言中实现快速、低资源消耗的离线部署。

roboflow/rf-detr

RF‑DETR 是一个基于 DINOv2 骨干网络的实时 Transformer 基础视觉模型套件(检测、分割、关键点),以 `rfdetr` Python 包形式发布,提供多种尺寸变体(Nano‑2XL),核心部分采用 Apache‑2.0 许可证,XL/2XL 采用 PML 1.0 许可证。包含在 COCO 和 RF100‑VL 上展示最先进精度-延迟权衡的基准测试表格。安装方式为 `pip install rfdetr`;使用方式为单行 `model.predict(...)`,并可选使用 `supervision` 库进行可视化。项目还提供 Roboflow 平台上的 NAS 流水线,用于自定义架构搜索。

facebookresearch/sam3

SAM 3(带概念的分割一切)是 Meta 的 8.48 亿参数基础模型,允许您使用自由形式文本(或视觉示例)提示图像或视频,并为所有匹配对象返回掩码、边界框和分数。它结合了 DETR 风格检测器和 SAM 2 风格跟踪器,引入了用于细粒度提示区分的存在性标记,并在超过 400 万个自动标注概念上进行训练。该仓库提供安装步骤、示例笔记本和用于评估的新 SA‑CO 基准(27 万个概念)

cvat-ai/cvat

一个用于为计算机视觉构建高质量视觉数据集的开源数据标注平台,支持图像、视频和 3D 标注。

aoguai/LiYing

一款使用 AI 处理人脸检测、背景替换和布局安排,以制作专业级证件照的自动化证件照处理工具。

jeremyipark/vision-demos

vision‑demos 是一组四个具体的 Python 演示,将最先进的姿态估计(`vitpose-plus-large`)和分割(`sam3.1`)模型应用于日常活动——舞蹈同步、引体向上计数、抱石路线分析和跑步步频测量。每个演示都包含 README、设置说明和视觉示例,整个仓库在 Apache‑2.0 许可下发布。

deepinsight/insightface

一个开源的 2D 和 3D 深度人脸分析工具箱,提供用于人脸识别、检测和对齐的最先进算法。

ultralytics/yolov5

YOLOv5 是由 Ultralytics 开发、基于 PyTorch 的开源目标检测/分割/分类模型套件,提供多种模型大小、简单的 Python/CLI 推理,以及单行指令训练和多种部署格式导出。

yakhyo/uniface

UniFace 是一个 Python 库,将 15 种人脸分析任务——检测、关键点、3D 网格、解析、遮罩、注视、头部姿态、人口统计、情绪、质量、防伪、识别、匿名化以及基于 FAISS 的相似度比对——整合进一个单一、易于安装的套件中(支持 CPU、Apple Silicon 或 CUDA)。它提供一致的 API、自动下载经验证的模型权重,并包含丰富的文档、Notebooks 以及社区 Discord。

oncologylab/histopia

一种用于连续切片组织学和蛋白质组学图像分析的计算研究工具,支持跨组织切片的三维重建与空间拓扑分析。

MrNeRF/LichtFeld-Studio

一个模块化的 3D Gaussian Splatting 工作站,将训练、实时可视化、编辑和导出整合到一个原生应用程序中。

jayin92/Skyfall-GS

Skyfall-GS 是一个框架,通过结合卫星影像提供的几何信息与 diffusion 模型生成高质量纹理,合成大规模、沉浸式的 3D 城市场景。

ArthurBrussee/brush

一个基于 WebGPU 和 Burn 框架的跨平台 3D 重建引擎,支持 macOS、Windows、Linux、Android 和浏览器。

serengil/deepface

一个轻量级的 Python 框架,用于人脸识别和人脸属性分析,整合多个先进模型,进行身份验证和人口统计预测。

pq-yang/MatAnyone2

一种在真实世界条件下具有高鲁棒性、能保留头发和边缘等精细细节的视频人物抠像框架,用于从视频中提取人物。

facebookresearch/boxer

Boxer 是一个利用带姿态图像和半稠密点云,将开放世界 2D 对象检测提升为室内场景 3D 方向边界框的系统。

ByteDance-Seed/Depth-Anything-3

一种使用统一深度-射线表示,从单张或多张图像中预测空间一致的 3D 几何、深度图和相机姿态的模型。

microsoft/OmniParser

一种将 GUI 截图转换为结构化元素的屏幕解析工具,使视觉基础 AI 代理能够准确识别并操作界面组件。