graniet/llm

一个 Rust 库,提供统一的 API 与多个 LLM 后端交互,支持多步骤链、代理工作流以及标准化的 REST API。

Farzad-R/LLM-Zero-to-Hundred

一个涵盖 RAG、智能体工作流、多模态聊天机器人和微调流水线的 LLM 项目和教程集合,旨在从基础迈向高级 AI 应用开发。

maze-agent/Maze

支持异构资源调度与自动模型服务的 LLM 代理分布式框架,可将代理程序转化为可观测的工作流。

suyoumo/ClawProBench

一个用于在 OpenClaw 运行时中评估 AI 代理能力与性能的透明实时基准测试框架,支持决定性评分。

OpenManus/OpenManus-RL

一个开源框架,使用强化学习优化 LLM 代理人的推理、工具使用与决策能力。

mkalten/reacTIVision

一个跨平台的计算机视觉框架,用于跟踪基准标记和多点触控手指,以实现有形用户界面的创建。

frgfm/holocron

一个提供近期深度学习技巧与计算机视觉任务模型架构的高质量 PyTorch 实现库。

rapidsai/cucim

cuCIM 是一个 GPU 加速的计算机视觉和图像处理库,专为生物医学、地理空间和遥感应用中使用的大型多维图像而设计。

commaai/rednose

一个用于传感器融合、视觉里程计和 SLAM 的 Kalman filter 框架,可自动实现 Jacobian 计算并支持 ESKF 和 MSCKF 等高级滤波器。

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

一个结构光扫描工具,可从受图案光照射的物体图像中重建 3D 点云,支持 CPU 与 GPU 加速。

alicevision/popsift

一个使用 CUDA 加速的 SIFT 算法实现,可实时进行图像特征提取。

thp/psmoveapi

一个开源库,支持 Linux、macOS 和 Windows,使 PC 能访问 Sony Move 动作控制器,用于 AR/VR 应用的 3D 跟踪和传感器融合。

rgeirhos/Stylized-ImageNet

一个用于创建 Stylized-ImageNet 的工具,该版本的 ImageNet 会扭曲纹理,以鼓励 CNN 更优先考虑对象形状而非纹理,从而提升鲁棒性。

Fabric-Project/Fabric

一个基于视觉节点的创意编码环境,用于在 macOS 上快速原型设计交互式 3D 图形、图像/视频处理和 AI 增强视觉。

VSLAM-LAB/VSLAM-LAB

通过统一配置和基准测试,简化视觉 SLAM 系统的开发、评估和应用的综合性框架。

askui/python-sdk

一个 Python SDK,让 AI agent 可以通过基于视觉的自动化,而非脆弱的 UI selector,来控制桌面和移动端设备。

l3p-cv/lost

一个灵活的、基于网页的协作图像标注框架,支持半自动化流水线以加速机器学习数据集的标注。

roboflow/roboflow-python

Roboflow 的官方 Python 包,使开发者能够以程序化方式与模型、数据集和项目交互,从而自动构建和部署计算机视觉模型。

genicam/harvesters

一个用于简化计算机视觉应用中图像采集的 Python 库,通过提供符合 GenICam 标准的设备统一接口来实现。

zju3dv/Diffuman4D

Diffuman4D 是一款用于高保真度 4D 一致性人体视图合成的空时扩散模型,能够从稀疏视图的视频中实现自由视角渲染。

open-edge-platform/datumaro

一个用于构建、转换和分析 AI 数据集的数据集管理框架和 CLI 工具,特别专注于各种标注格式之间的转换。

basler/pypylon

Basler pylon C++ API 的官方 Python 绑定,使 Python 应用程序能够控制 Basler 机器视觉相机并执行图像处理任务。

10up/classifai

一个 WordPress 插件,整合云端和本地 AI 服务,实现内容生成、图像处理和站点管理任务的自动化。

cyrusbehr/YOLOv8-TensorRT-CPP

一个使用 TensorRT 的 C++ 实现 YOLOv8,以高性能 GPU 推理为目标,支持目标检测、语义分割和姿态估计。

insight-platform/Savant

一个高层框架,用于在 Nvidia 硬件上构建实时、高性能的计算机视觉和视频分析管道,抽象化 DeepStream 的复杂性。

luispedro/mahotas

一个以 C++ 实现的快速 Python 计算机视觉库,提供超过 100 种在 NumPy 数组上运行的图像处理算法。

FORTH-ModelBasedTracker/MocapNET

实时 2D‑to‑3D 人体姿态估计器,将 RGB 视频流转换为标准 BVH 动作捕捉文件,用于 3D 动画。

imagej/imagej2

ImageJ2 是一个科学成像框架,它扩展了原始的 ImageJ,以支持多维图像数据以及跨多种编程语言的无头处理。

IliasHad/edit-mind

一个本地视频知识库,通过转录和视觉分析为视频建立索引,以实现对视频内容的自然语言语义搜索。

opendatacam/opendatacam

一个开源的计算机视觉工具,能够检测、跟踪并计数视频流中的移动物体,以量化现实世界的运动,常用于交通研究。

MRPT/mrpt

一个为移动机器人提供 SLAM、导航、建图和传感器集成所需工具的稳健、模块化 C++ 框架。

ARM-software/ComputeLibrary

一套针对 Arm Cortex-A、Neoverse 与 Mali GPU 架构优化的低层机器学习函数库,提供高性能的 ML 推理。

shimat/opencvsharp

OpenCV 的跨平台.NET 封装库,为 C# 开发者提供全面的计算机视觉和图像处理功能。

deepgram/deepgram-python-sdk

Deepgram 官方 Python SDK,提供自动语音识别、文本转语音和语言理解 API 的便捷集成。

vargHQ/sdk

一个开源的 TypeScript SDK,允许开发者和 AI 代理使用声明式 JSX 语法以及统一的 API,为多家 AI 提供商创建 AI 生成视频。

sdv-dev/SDGym

一个用于建模和生成合成数据的基准框架,允许用户比较不同机器学习技术的性能、内存使用和质量。

digital-go-jp/genai-ai-api

由日本数字庁开发的系列生成式 AI 微服务与云端模板,旨在帮助政府官员部署特定任务的 AI 应用。

inseq-team/inseq

一个基于 PyTorch 的工具包,用于序列生成模型的事后可解释性,提供多种特征归因方法来解释模型输出。

aws-samples/bedrock-engineer

一款由 Amazon Bedrock 驱动的自主软件开发代理应用,可创建文件、执行命令,并通过可定制的代理界面管理项目。

aws-samples/well-architected-iac-analyzer

一款 AI 驱动的工具,用于分析基础设施即代码(IaC)和架构图是否符合 AWS Well-Architected 最佳实践,并提供优先排序的修复建议。

eidolon-ai/eidolon

一个开源 SDK,用于将 AI 代理构建并部署为具备内建 HTTP 服务器与动态代理间通信的模块化、可扩展服务。

GoogleCloudPlatform/genai-for-marketing

一个基于 Google Cloud 的解决方案,利用 Vertex AI 与 Google Workspace 集成,自动化营销内容生成、趋势分析和数据查询。

digital-go-jp/genai-web

...

nv-tlabs/XCube

XCube 是一款用于高分辨率稀疏 3D 体素网格的生成模型,它利用分层潜在扩散和 VDB 数据结构来创建精细的 3D 物件和大规模场景。

alexiglad/EBT

一个针对能量基础变换器(EBTs)的框架,能够在文本、图像和视频等多模态上实现可扩展的推理与 System 2 思考。

FoundationVision/Liquid

Liquid 是一个统一的自回归多模态生成器,将视觉理解和图像生成整合到单一 LLM 中,无需外部视觉嵌入。

sdv-dev/Copulas

一个用于建模多元分布并使用 copula 函数生成合成数值数据的 Python 库。

SomeOddCodeGuy/WilmerAI

一个用于高级语义提示路由和多 LLM 协调的节点式工作流引擎,使用户能够创建复杂且上下文感知的 AI 代理。