liustack/modlens

ModLens 是 DeepSeek Harness(和其他本地 AI 助手)的插件,为纯文本 LLM 添加视觉能力。用户将图像直接粘贴到聊天中;插件将其转发到可配置的视觉引擎(Gemini、OpenAI 兼容、Anthropic、Antigravity CLI、Claude/Kimi CLI 或本地代理),并返回模型可引用的结构化转录。安装只需一条 `npx` 命令或通过 `skills.sh`,具有零配置默认值和自动密钥轮换/故障转移。该项目采用 MIT 许可证,专注于轻量级集成而非重型包装器。

royshil/obs-backgroundremoval

一款 OBS Studio 插件,利用神经网络在无需物理绿幕的情况下,实时去除人像背景并增强低照度视频。

lyuwenyu/RT-DETR

基于检测 Transformer(DETR)架构的实时对象检测框架,旨在速度和准确率方面超越 YOLO 模型。

MaaEnd/MaaEnd

一款使用屏幕识别技术自动化战斗、资源采集和日常管理任务的游戏Endfield自动化助手。

microsoft/MoGe

MoGe 是一个从单张开放域图像中恢复精确 3D 几何结构(包括度量深度图和点图)的模型。

sparkjsdev/spark

一个用于 THREE.js 的高级 3D 高斯溅射渲染器,可实现基于溅射的 3D 场景的高性能、跨设备渲染。

MaaXYZ/MaaFramework

一种基于图像识别的自动化黑盒测试低代码框架,允许开发者通过低代码管道协议创建软件助手和自动化工具。

beixiaocai/rebucca

一个结合 YOLO 检测与 LLM 验证的多通道视频分析平台,可提供结构化告警,用于安全与监控。

davidakpele/wifi-densepose

一个注重隐私的人体姿态估计系统,利用WiFi信道状态信息(CSI)和机器学习,在无需摄像头的情况下检测姿态。

nerfstudio-project/gsplat

用于 3D 高斯光栅化的 CUDA 加速库,提供比官方实现更快、更节省内存的辐射场渲染方式。

aloshdenny/reverse-SynthID

一个通过谱系分析与多阶段对抗性管线,检测并移除 Google Gemini 生成图像中不可见 SynthID 水印的逆向工程项目。

wasserth/TotalSegmentator

一个用于自动分割 CT 和 MR 图像中主要解剖结构的工具,可提供详细的解剖掩码和身体统计数据。

valkia/aramgg_client

一款为《英雄联盟》ARAM模式设计的Windows桌面助手,提供英雄选择建议,并通过OCR识别游戏内哈克科技增益,推荐最优出装。

google-deepmind/alphafold3

用于准确预测生物分子相互作用 3D 结构的 AlphaFold 3 推理流水线实现。

isl-org/Open3D

Open3D 是一个现代的 3D 数据处理库,为点云和网格操作、可视化以及 3D 机器学习提供优化的工具。

open-edge-platform/anomalib

一个用于基准测试和部署异常检测算法的深度学习库,重点专注于图像和视频中的视觉异常检测。

pynicolas/FairScan

一款使用本地机器学习实现自动文档检测和透视校正,以创建私有 PDF 的开源 Android 文档扫描器。

freemocap/freemocap

一种无需昂贵专有硬件即可提供研究级追踪的免费开源运动捕捉平台。

lightly-ai/lightly-train

一个用于预训练、微调和蒸馏 DINOv3 和 LTDETRv2 等最先进模型的计算机视觉框架,适用于目标检测和分割等任务。

huggingface/pytorch-image-models

一个全面的 PyTorch 库,提供大量的尖端计算机视觉骨干网络(backbones)和预训练权重,方便集成到 AI 项目中。

WebODM/WebODM

一款商用级软件,用于将无人机图像处理为地理参考地图、点云、3D模型和高斯点阵。

ZhengPeng7/BiRefNet

BiRefNet 是一种高分辨率二值图像分割模型,可为不同分辨率的图像提供最先进的背景移除和物体分割效果。

vllm-project/llm-compressor

LLM Compressor 是一个 Python 库,可将大型语言模型量化并剪枝为 `compressed-tensors` 格式,实现 vLLM 的内存高效部署。支持多种低精度格式(NVFP4、FP8、INT4 等)、多种 PTQ/GPTQ 算法、DDP 和磁盘卸载以处理超大模型,并提供多个热门 LLM 的预量化检查点。

NVIDIA/DLSS

NVIDIA DLSS SDK 为游戏提供高性能图像缩放和锐化工具,支持与 DX11、DX12 和 Vulkan 的集成。

opengeos/geoai

一个将 AI 框架与地理空间数据分析相结合的 Python 包,提供卫星图像处理、模型训练和推理工具。

realsenseai/librealsense

一个用于 RealSense 深度摄像头的不跨平台 SDK,可实现深度和色彩流,并为计算机视觉和机器人技术提供校准数据。

voxel51/fiftyone

通过提供视觉数据探索、标注和模型评估,帮助构建高质量计算机视觉数据集和模型的开源工具。

NVlabs/Fast-FoundationStereo

通过知识蒸馏、神经架构搜索和结构化剪枝,实现强大零样本泛化的实时立体匹配架构家族。

opendatalab/OmniDocBench

一个用于评估真实场景中文档解析的综合性基准,包含布局检测、OCR、表格和公式识别的丰富标注。

apple-aiml-research/ml-sharp

SHARP 是一个快速的单目视图合成工具,使用神经网络在不到一秒内从单张图像生成度量 3D 高斯表示。

Pointcept/Pointcept

用于点云感知研究的强大且灵活的代码库,集成了多种 3D 主干网络和自监督预训练框架。

prs-eth/Marigold

一个利用 Stable Diffusion 等预训练扩散模型,实现高分辨率单目深度、表面法线和内在图像分析的条件生成模型家族。

roboflow/trackers

一个即插即用的 Python 库,为任意检测模型提供多种目标跟踪算法的基准实现。

alicevision/Meshroom

一个基于节点的可视化编程框架,用于 3D 重建和计算机视觉,支持用户使用 AI 和摄影测量构建复杂的数据处理流水线。

roryclear/clearcam

一个为任意 RTSP 安全摄像头添加物体检测、追踪和 AI 生成事件摘要功能的 AI 驱动 NVR 系统。

Tencent/YOLO-Master

一种基于 YOLO 风格的实时物体检测框架,利用混合专家(MoE)根据场景复杂性自适应分配计算,实现更高精度与更低延迟。

vietanhdev/anylabeling

一款基于人工智能的图像标注工具,集成 YOLOv8 和 Segment Anything,为计算机视觉数据集提供自动标注功能。

facebookresearch/map-anything

一个开源研究框架,通过单个 Transformer 模型处理来自各种输入组合的多种 3D 任务,实现通用的度量 3D 重建。

Breakthrough/PySceneDetect

一个自动识别场景变化以拆分视频或提取帧的视频剪辑检测与分析工具。

google/GNM

以 GNM Head 为开端的参数化统计 3D 人体模型系列,用于高保真地表示人体几何形状和外观。

kornia/kornia

一个用于 PyTorch 的可微分计算机视觉库,将经典图像处理和几何视觉算法集成到深度学习流水线中。

Audiveris/audiveris

一款开源的光学乐谱识别(OMR)应用程序,可将乐谱图像转换为可播放和编辑的符号化数字格式。

datalab-to/surya

一个 650M 参数的 OCR 模型,用于文档智能,可在 91 种语言中提供高精度的文本识别、布局分析和表格提取。

torinmb/mediapipe-touchdesigner

无需外部安装即可在 TouchDesigner 中实现姿态和手部追踪等实时计算机视觉任务的 GPU 加速 MediaPipe 插件。

Faceplugin-ltd/Open-Source-Face-Recognition-SDK

一个开源的人脸识别 SDK,适用于 Windows 和 Linux,使用深度学习技术提供本地化的面部检测、关键点检测和相似度比较。

1bananachicken/MaaNTE

一款基于图像和音频识别的自动化工具,用于简化游戏 *異環* (The Ring) 中的重复性玩法和小游戏。

pixpark/gpupixel

使用 OpenGL/ES 的高性能、跨平台 C++ 库,用于图像和视频美颜滤镜。

ucam-eo/tessera

TESSERA 是一个开源地理空间基础模型,可将受云层干扰的卫星时序数据转换为用于全球地球表示和分析的紧凑型 128 维嵌入。