graniet/llm
一个 Rust 库,提供统一的 API 与多个 LLM 后端交互,支持多步骤链、代理工作流以及标准化的 REST API。
Farzad-R/LLM-Zero-to-Hundred
一个涵盖 RAG、智能体工作流、多模态聊天机器人和微调流水线的 LLM 项目和教程集合,旨在从基础迈向高级 AI 应用开发。
maze-agent/Maze
支持异构资源调度与自动模型服务的 LLM 代理分布式框架,可将代理程序转化为可观测的工作流。
suyoumo/ClawProBench
一个用于在 OpenClaw 运行时中评估 AI 代理能力与性能的透明实时基准测试框架,支持决定性评分。
OpenManus/OpenManus-RL
一个开源框架,使用强化学习优化 LLM 代理人的推理、工具使用与决策能力。
mkalten/reacTIVision
一个跨平台的计算机视觉框架,用于跟踪基准标记和多点触控手指,以实现有形用户界面的创建。
frgfm/holocron
一个提供近期深度学习技巧与计算机视觉任务模型架构的高质量 PyTorch 实现库。
rapidsai/cucim
cuCIM 是一个 GPU 加速的计算机视觉和图像处理库,专为生物医学、地理空间和遥感应用中使用的大型多维图像而设计。
commaai/rednose
一个用于传感器融合、视觉里程计和 SLAM 的 Kalman filter 框架,可自动实现 Jacobian 计算并支持 ESKF 和 MSCKF 等高级滤波器。
theICTlab/3DUNDERWORLD-SLS-GPU_CPU
一个结构光扫描工具,可从受图案光照射的物体图像中重建 3D 点云,支持 CPU 与 GPU 加速。
alicevision/popsift
一个使用 CUDA 加速的 SIFT 算法实现,可实时进行图像特征提取。
thp/psmoveapi
一个开源库,支持 Linux、macOS 和 Windows,使 PC 能访问 Sony Move 动作控制器,用于 AR/VR 应用的 3D 跟踪和传感器融合。
rgeirhos/Stylized-ImageNet
一个用于创建 Stylized-ImageNet 的工具,该版本的 ImageNet 会扭曲纹理,以鼓励 CNN 更优先考虑对象形状而非纹理,从而提升鲁棒性。
Fabric-Project/Fabric
一个基于视觉节点的创意编码环境,用于在 macOS 上快速原型设计交互式 3D 图形、图像/视频处理和 AI 增强视觉。
VSLAM-LAB/VSLAM-LAB
通过统一配置和基准测试,简化视觉 SLAM 系统的开发、评估和应用的综合性框架。
askui/python-sdk
一个 Python SDK,让 AI agent 可以通过基于视觉的自动化,而非脆弱的 UI selector,来控制桌面和移动端设备。
l3p-cv/lost
一个灵活的、基于网页的协作图像标注框架,支持半自动化流水线以加速机器学习数据集的标注。
roboflow/roboflow-python
Roboflow 的官方 Python 包,使开发者能够以程序化方式与模型、数据集和项目交互,从而自动构建和部署计算机视觉模型。
genicam/harvesters
一个用于简化计算机视觉应用中图像采集的 Python 库,通过提供符合 GenICam 标准的设备统一接口来实现。
zju3dv/Diffuman4D
Diffuman4D 是一款用于高保真度 4D 一致性人体视图合成的空时扩散模型,能够从稀疏视图的视频中实现自由视角渲染。
open-edge-platform/datumaro
一个用于构建、转换和分析 AI 数据集的数据集管理框架和 CLI 工具,特别专注于各种标注格式之间的转换。
basler/pypylon
Basler pylon C++ API 的官方 Python 绑定,使 Python 应用程序能够控制 Basler 机器视觉相机并执行图像处理任务。
10up/classifai
一个 WordPress 插件,整合云端和本地 AI 服务,实现内容生成、图像处理和站点管理任务的自动化。
cyrusbehr/YOLOv8-TensorRT-CPP
一个使用 TensorRT 的 C++ 实现 YOLOv8,以高性能 GPU 推理为目标,支持目标检测、语义分割和姿态估计。
insight-platform/Savant
一个高层框架,用于在 Nvidia 硬件上构建实时、高性能的计算机视觉和视频分析管道,抽象化 DeepStream 的复杂性。
luispedro/mahotas
一个以 C++ 实现的快速 Python 计算机视觉库,提供超过 100 种在 NumPy 数组上运行的图像处理算法。
FORTH-ModelBasedTracker/MocapNET
实时 2D‑to‑3D 人体姿态估计器,将 RGB 视频流转换为标准 BVH 动作捕捉文件,用于 3D 动画。
imagej/imagej2
ImageJ2 是一个科学成像框架,它扩展了原始的 ImageJ,以支持多维图像数据以及跨多种编程语言的无头处理。
IliasHad/edit-mind
一个本地视频知识库,通过转录和视觉分析为视频建立索引,以实现对视频内容的自然语言语义搜索。
opendatacam/opendatacam
一个开源的计算机视觉工具,能够检测、跟踪并计数视频流中的移动物体,以量化现实世界的运动,常用于交通研究。
MRPT/mrpt
一个为移动机器人提供 SLAM、导航、建图和传感器集成所需工具的稳健、模块化 C++ 框架。
ARM-software/ComputeLibrary
一套针对 Arm Cortex-A、Neoverse 与 Mali GPU 架构优化的低层机器学习函数库,提供高性能的 ML 推理。
shimat/opencvsharp
OpenCV 的跨平台.NET 封装库,为 C# 开发者提供全面的计算机视觉和图像处理功能。
deepgram/deepgram-python-sdk
Deepgram 官方 Python SDK,提供自动语音识别、文本转语音和语言理解 API 的便捷集成。
vargHQ/sdk
一个开源的 TypeScript SDK,允许开发者和 AI 代理使用声明式 JSX 语法以及统一的 API,为多家 AI 提供商创建 AI 生成视频。
sdv-dev/SDGym
一个用于建模和生成合成数据的基准框架,允许用户比较不同机器学习技术的性能、内存使用和质量。
digital-go-jp/genai-ai-api
由日本数字庁开发的系列生成式 AI 微服务与云端模板,旨在帮助政府官员部署特定任务的 AI 应用。
inseq-team/inseq
一个基于 PyTorch 的工具包,用于序列生成模型的事后可解释性,提供多种特征归因方法来解释模型输出。
aws-samples/bedrock-engineer
一款由 Amazon Bedrock 驱动的自主软件开发代理应用,可创建文件、执行命令,并通过可定制的代理界面管理项目。
aws-samples/well-architected-iac-analyzer
一款 AI 驱动的工具,用于分析基础设施即代码(IaC)和架构图是否符合 AWS Well-Architected 最佳实践,并提供优先排序的修复建议。
eidolon-ai/eidolon
一个开源 SDK,用于将 AI 代理构建并部署为具备内建 HTTP 服务器与动态代理间通信的模块化、可扩展服务。
GoogleCloudPlatform/genai-for-marketing
一个基于 Google Cloud 的解决方案,利用 Vertex AI 与 Google Workspace 集成,自动化营销内容生成、趋势分析和数据查询。
digital-go-jp/genai-web
...
nv-tlabs/XCube
XCube 是一款用于高分辨率稀疏 3D 体素网格的生成模型,它利用分层潜在扩散和 VDB 数据结构来创建精细的 3D 物件和大规模场景。
alexiglad/EBT
一个针对能量基础变换器(EBTs)的框架,能够在文本、图像和视频等多模态上实现可扩展的推理与 System 2 思考。
FoundationVision/Liquid
Liquid 是一个统一的自回归多模态生成器,将视觉理解和图像生成整合到单一 LLM 中,无需外部视觉嵌入。
sdv-dev/Copulas
一个用于建模多元分布并使用 copula 函数生成合成数值数据的 Python 库。
SomeOddCodeGuy/WilmerAI
一个用于高级语义提示路由和多 LLM 协调的节点式工作流引擎,使用户能够创建复杂且上下文感知的 AI 代理。