gazijarin/itsgiving

一个实时网络摄像头应用,通过检测面部表情和手势来触发匹配的迷因叠加,支持在视频会议中使用的虚拟摄像头。

img2threejs/img2threejs

img2threejs 是一个由 Python 支持的技能,允许 LLM 将单张参考图转换为过程化 Three.js 模型。它构建一个规范,运行带门禁的视觉审查循环,并生成使用基元和着色器重建物体的 TypeScript 代码,可直接用于动画制作。该系统可通过领域插件(如 CS2 武器皮肤)进行扩展,并包含一个实时演示库。

ruvnet/RuView

一个将无线电波转化为空间智能的WiFi感知平台,实现无需摄像头的人员存在、生命体征和姿态估计。

PaddlePaddle/PaddleOCR

PaddleOCR 是一个开源 OCR 和文档 AI 工具包,可将图像/PDF 转换为结构化、对 LLM 就绪的 JSON 或 Markdown。它提供多语言场景文本模型 (PP-OCRv6)、用于处理表格、公式和古籍的轻量级视觉语言解析器 (PaddleOCR-VL-1.6),以及结构感知流水线 (PP-StructureV3)。模型可运行在 CPU, GPU, XPU, NPU 或通过 ONNX/TensorRT 运行,并与 Dify 和 RAGFlow 等 RAG/智能体平台集成。

immich-app/immich

具备 AI 驱动人脸识别和 CLIP 基础搜索的高性能自托管照片和视频管理解决方案。

roboflow/rf-detr

RF-DETR 是一种基于 DINOv2 骨干的实时 Transformer 架构,用于目标检测、实例分割和关键点检测。

baidu/Unlimited-OCR

用于复杂文档、PDF 和多页图像的一次完成长距离解析的多模态 OCR 模型。

julyx10/lap

一款开源、本地优先的照片管理器,利用本地AI实现搜索和人脸识别,为云照片服务提供私密替代方案。

ultralytics/ultralytics

一个高性能的计算机视觉框架,实现 YOLO 模型,用于实时目标检测、分割、分类和姿态估计。

MaaAssistantArknights/MaaAssistantArknights

一款基于图像识别和 OCR 的明日方舟自动化助手,用于自动化日常任务、资源 farming 和基地管理。

amap-cvlab/ABot-Recon

ABot-Recon 是一种流式 3D 重建系统,利用固定的 12 帧局部上下文,高效地从长视频流中构建全局轨迹和点云,无需持久的长距离记忆。

om-ai-lab/VLX-Seek

VLX‑Seek 是一个开源视觉-语言模型,可为边缘设备代理执行细粒度感知。它生成区域提案,将每个区域编码为特殊令牌,并让语言模型通过选择这些令牌来回答问题——从而为检测、指代表达理解、OCR、计数和 VQA 生成紧凑、可解析的输出。该仓库包含推理代码、Python API 和 10 B 检查点(权重托管在 Hugging Face 上)。

blakeblackshear/frigate

一个与 Home Assistant 紧密集成的本地 NVR,为 IP 摄像头提供实时 AI 物体检测。

ooolabdev/ooosplat

一个本地桌面应用程序,通过自动化的本地流程将环绕视图视频或图像序列转换为 3D 高斯点云模型。

Faceplugin-ltd/Open-Source-Face-Recognition-SDK

一个开源的人脸识别 SDK,适用于 Windows 和 Linux,使用深度学习技术提供本地化的面部检测、关键点检测和相似度比较。

MaaXYZ/MaaFramework

一种基于图像识别的自动化黑盒测试低代码框架,允许开发者通过低代码管道协议创建软件助手和自动化工具。

hacksider/Deep-Live-Cam

一款实时人脸交换和深度伪造工具,仅需一张源图像即可替换视频或实时网络摄像头画面中的人脸。

tesseract-ocr/tesseract

Tesseract 是一个开源的 OCR 引擎和命令行工具,可将图像中的文字转换为超过 100 种语言的机器可读文本。

Yuliang-Liu/MonkeyOCRv2

MonkeyOCRv2 是一个用于 Document AI 的开源视觉文字基础模型。它搭载了基于 ViT 的视觉编码器,以及多语言解析与理解头(约 0.6-1.8 B 参数),在 17 种语言的 OCR、版面解析、VQA 和公式识别上达到了最先进的分数。模型可在 Hugging Face/ModelScope 上获取,可使用 Transformers 或 vLLM 运行(可选 CPU 支持与 DFlash 加速),并附带了大型 MonkeyDoc v2 预训练数据集。

facebookresearch/vggt-omega

VGGT-Omega 是一个计算机视觉模型,能够从图像中预测相机位姿和深度,以实现3D场景重建。

Robbyant/lingbot-map

一种从视频实时生成点云和相机轨迹的前馈式3D基础模型。

roboflow/supervision

一个计算机视觉工具包,提供用于数据加载、可视化和数据集管理的模型无关构建模块,以加速视觉应用的开发。

opencv/opencv

OpenCV 是一个开源计算机视觉库,为 AI 和视觉感知开发提供工具和算法。

ace-trump-tech/DeltaForce-OBS-Locker

基于YOLOv14的实时对象检测与目标锁定系统,可过滤环境误报,精准识别Delta Force游戏中的角色

MaaEnd/MaaEnd

一款专为游戏 Endfield 设计的自动化助手,利用屏幕识别技术自动完成战斗、资源采集和日常管理任务。

RapidAI/RapidOCR

一款将 PaddleOCR 模型转换为 ONNX 格式的开源 OCR 工具,可在多个平台和语言中实现快速、低资源消耗的离线部署。

deepinsight/insightface

一个开源的 2D 和 3D 深度人脸分析工具箱,提供用于人脸识别、检测和对齐的最先进算法。

playcanvas/supersplat

一个基于浏览器的开源编辑器,用于检查、编辑、优化和发布 3D Gaussian Splats。

duy-phamduc68/TrafficLab-3D

一个端到端的交通分析套件,利用计算机视觉和自定义校准流程,从 CCTV 视频和卫星地图生成 3D 数字孪生。

BigBodyCobain/Shadowbroker

一个去中心化的地理空间情报平台,将 60 多个实时 OSINT 信息源聚合至单一地图界面,用于全球威胁监控。

harry7557558/spirula-studio

一个无需 Python 或 PyTorch 的自包含 3D 高斯点云渲染管道,可将照片和视频转换为 3D 点云和网格。

oncologylab/histopia

一种用于连续切片组织学和蛋白质组学图像分析的计算研究工具,支持跨组织切片的三维重建与空间拓扑分析。

facebookresearch/sam3

SAM 3(带概念的分割一切)是 Meta 的 8.48 亿参数基础模型,允许您使用自由形式文本(或视觉示例)提示图像或视频,并为所有匹配对象返回掩码、边界框和分数。它结合了 DETR 风格检测器和 SAM 2 风格跟踪器,引入了用于细粒度提示区分的存在性标记,并在超过 400 万个自动标注概念上进行训练。该仓库提供安装步骤、示例笔记本和用于评估的新 SA‑CO 基准(27 万个概念)

ByteDance-Seed/Depth-Anything-3

一种使用统一深度-射线表示,从单张或多张图像中预测空间一致的 3D 几何、深度图和相机姿态的模型。

roflcoopter/viseron

专为家庭和办公室监控设计的自托管、仅限本地运行的 NVR 和 AI 计算机视觉软件,支持对象和人脸识别。

ocrmypdf/OCRmyPDF

一个命令行工具,为扫描 PDF 添加 OCR 文本层,使其可搜索且可复制粘贴,同时保持图像质量。

freemocap/freemocap

一种无需昂贵专有硬件即可提供研究级追踪的免费开源运动捕捉平台。

colmap/colmap

一个通用的运动恢复结构 (SfM) 和多视图立体视觉 (MVS) 流水线,用于从图像集合中重建 3D 结构。

suzuran0y/CCTV-Smartphone-AI-Monitoring

Sentinel 是一个开源的仅限局域网系统,可将 Android 手机变为实时摄像头节点,将 Python/Flask PC 服务器变为实时预览、分段录制和 AI 触发监控仪表板。它通过运动检测调用外部视觉模型,输出结构化 JSON 事件,并将所有数据本地化,适用于注重隐私的监控或数据收集研究。

nerfstudio-project/gsplat

用于 3D 高斯光栅化的 CUDA 加速库,提供比官方实现更快、更节省内存的辐射场渲染方式。

cvat-ai/cvat

一个用于为计算机视觉构建高质量视觉数据集的开源数据标注平台,支持图像、视频和 3D 标注。

beixiaocai/rebucca

一个结合 YOLO 检测与 LLM 验证的多通道视频分析平台,可提供结构化告警,用于安全与监控。

microsoft/MoGe

MoGe 是一个从单张开放域图像中恢复精确 3D 几何结构(包括度量深度图和点图)的模型。

datalab-to/surya

一个 650M 参数的 OCR 模型,用于文档智能,可在 91 种语言中提供高精度的文本识别、布局分析和表格提取。

open-edge-platform/anomalib

一个用于基准测试、开发和部署视觉异常检测算法的深度学习库,用于识别和定位图像和视频中的缺陷。

mkturkcan/DART

一个无需训练的框架,通过 TensorRT 优化和蒸馏主干网络,将 SAM3 转换为实时多类别开放词汇检测器。

sparkjsdev/spark

一款高级的 3D 高斯泼溅渲染器,适用于 THREE.js,能在广泛的设备支持下,于网络上实现高性能、逼真的 3D 场景。

ZhengPeng7/BiRefNet

BiRefNet 是一种高分辨率二值图像分割模型,可为不同分辨率的图像提供最先进的背景移除和物体分割效果。