OpenManus-RL:用于提升 LLM 推理与决策的基于 RL 的智能体调优框架
一个开源框架,利用强化学习优化 LLM 智能体,提升其推理、工具使用和决策能力。
llm-beginner: 通过从零开始的实现来掌握 LLM 和 AI agent 的循序渐进式动手实践课程
一套全面的、动手实践的教程系列,供初学者通过六个循序渐进的实现任务来学习 LLMs 和 AI agents,从构建 mini-GPT 到创建 coding agent。
SkillOpt: 一种使用深度学习风格优化循环实现智能体技能自我进化的执行策略
SkillOpt 是一个将智能体技能文档视为可训练状态的框架,它使用深度学习风格的优化循环来进化并提高智能体性能,而无需修改模型权重。
unrealcv: 连接 Unreal Engine 与 AI 框架以创建合成计算机视觉环境的桥梁
UnrealCV 是 Unreal Engine 的一个插件,允许计算机视觉研究人员通过编程方式与虚拟世界交互以生成合成数据,并集成了 PyTorch/Tensorflow。
paperlib: 一个具有 AI 驱动摘要和语义库搜索功能的开源学术论文管理器
一款开源学术论文管理工具,简化了元数据抓取和组织,具有 LLM 驱动的摘要和语义搜索功能。
bgslibrary: 一个用于视频流中前景-背景分离的全面 C++ 框架
一个用于计算机视觉中背景减除的全面 C++ 框架,提供超过 40 种算法来检测视频流中的移动对象。
emgucv:跨平台 .NET 包装器,用于 OpenCV 图像处理库
跨平台 .NET 包装器,用于 OpenCV 图像处理库,使 .NET 兼容语言能够在多个操作系统上使用 OpenCV 功能。
MaaNTE: 一个基于图像识别和音频识别的自动化工具,用于简化游戏 *異環* 中的重复性任务
一款针对游戏 *異環* (The Ring) 的自动化工具,通过图像和音频识别来模拟用户交互,从而简化重复性的游戏玩法。
stitching: 一个用于快速且鲁棒的图像拼接与全景图创建的 Python 包
一个用于快速且鲁棒的图像拼接的 Python 包,它使用 OpenCV 将多张重叠的图像组合成单一的全景图。
CV-CUDA:用于 AI 预处理流水线的高吞吐量 GPU 加速计算机视觉库
NVIDIA 提供的 GPU 加速计算机视觉库,为 AI 流水线提供高吞吐量、低延迟的图像和视频处理。
comic-translate:一款利用 LLM 和图像修复技术在漫画面板内翻译文字的 AI 漫画翻译器
一款利用 LLM、OCR 与图像修复技术,将多语言漫画翻译并保留原始画面的 AI 漫画翻译器。
habitat-lab:用于在室内环境中训练和评估具身 AI 代理的模块化框架
一个用于具身 AI 端到端开发的模块化高级库,可用于训练和评估在室内环境中执行任务的代理。
WebPlotDigitizer: 一款用于从数据可视化图像中提取数值数据的计算机视觉辅助工具
WebPlotDigitizer 是一款为研究人员和科学家提供的、通过计算机视觉辅助从数据可视化图像中提取数值数据的工具。
ComputeLibrary: 为 Arm 硬件优化的低层机器学习函数集合
针对 Arm Cortex-A、Neoverse 和 Mali GPU 架构优化的低层机器学习函数集合,旨在提供高性能的 ML 推理。
LichtFeld-Studio: 用于训练、编辑和自动化 3D Gaussian Splatting 场景的模块化工作站
一个用于 3D Gaussian Splatting 的模块化工作站,在单个原生应用程序中集成了训练、实时可视化、编辑和导出功能。
anylabeling: 一个通过 YOLOv8 和 Segment Anything 实现自动标注的 AI 辅助图像标注工具
一款 AI 驱动的图像标注工具,集成了 YOLOv8 和 Segment Anything Model (SAM) 系列,旨在为计算机视觉实现数据标注的自动化和加速。
AliceVision: 用于 3D 重建和相机追踪的光影测量计算机视觉框架
一个光影测量计算机视觉框架,通过照片或视频提供 3D 重建和相机追踪算法。
habitat-sim: 用于具身智能研究的高性能、支持物理特性的 3D 模拟器
一个用于具身智能研究的高性能、支持物理特性的 3D 模拟器,为在真实 3D 环境中训练智能体提供快速渲染和刚体动力学。
scenic: 一个基于 JAX 的研究库,用于原型设计大规模基于注意力机制的计算机视觉模型
一个基于 JAX 和 Flax 的计算机视觉研究库,为开发跨图像、视频和音频的基于注意力机制的模型提供可扩展的库和项目模板。
torchgeo:用于多光谱地理空间和遥感数据深度学习的 PyTorch 领域库
一个 PyTorch 领域库,提供专为地理空间和遥感数据设计的数据集、采样器和预训练模型。
VLMEvalKit: 一个支持 70+ 基准测试的大型视觉语言模型统一评估工具包
一个用于大型视觉语言模型的开源评估工具包,支持在 70+ 个基准测试和 200+ 个模型上进行一键式评估。
MaaFramework: 一个用于构建低代码黑盒自动化工具的跨平台图像识别框架
一种基于图像识别的黑盒测试自动化框架,使开发者能够通过低代码 Pipeline 创建视觉驱动的自动化工具。
obs-backgroundremoval: 一个用于 OBS Studio 的虚拟绿幕和低光增强插件
一个使用神经网络为人物视频和图像提供虚拟绿幕背景移除和低光增强功能的 OBS Studio 插件。
webots: 一个用于机械系统建模和编程的开源机器人模拟器
一个开源机器人模拟器,提供完整的开发环境,用于对机器人、车辆和机械系统进行建模、编程和模拟。
ceres-solver: 一个用于解决大规模非线性最小二乘法和通用优化问题的成熟 C++ 库
Ceres Solver 是一个用于建模和解决大型、复杂非线性最小二乘法和通用无约束优化问题的 C++ 库。
sparrow: 一个面向 API 的文档智能平台,用于结构化数据提取和智能体工作流
一个面向 API 的企业级文档智能平台,利用 Vision LLMs 和智能体工作流将发票、收据和对账单转换为结构化 JSON。
Chinese-CLIP:面向跨模态检索和零样本图像分类的大规模中文视觉语言模型
一个在 2 亿图文对上训练的中文 CLIP 模型,用于跨模态检索和零样本图像分类。
scikit-image: 一个用于科学图像处理与分析的全面 Python 库
scikit-image 是一个用于图像处理的 Python 库,它提供了一套用于分析和操作图像的算法集合。
Final2x: 一个支持自定义模型和 Nvidia 50 系列 GPU 的跨平台图像超分辨率工具
一个使用 AI 模型来放大图像并提高其分辨率的跨平台图像超分辨率工具。
gocv: Go 语言绑定 OpenCV 4 计算机视觉库
GoCV 为 OpenCV 4 提供 Go 语言绑定,使 Go 开发者能够在其应用中集成先进的计算机视觉和硬件加速的图像处理。
librealsense:用于从 RealSense 相机流式传输深度和颜色数据的跨平台库
一个跨平台的 RealSense 深度相机 SDK,能够实现深度和颜色流式传输,并提供用于计算机视觉和机器人领域的校准数据。
rerun: 物理 AI 和机器人技术的多模态数据层与可视化调试器
一个用于物理 AI 的多模态数据层和可视化调试器,使开发者能够实时记录、查询和可视化多速率传感器数据。
pcl:用于 2D 和 3D 图像及点云处理的大规模开源库
用于 2D/3D 图像及点云处理的大规模开源库,广泛应用于机器人和 3D 感知领域。
segmentation_models.pytorch:一个高层次的 PyTorch 库,用于图像语义分割,拥有超过 800 个预训练编码器
一个 PyTorch 库,提供高层 API,能够轻松创建和训练使用多种预训练编码器和架构的图像语义分割模型。
colmap: 一个通用的 Structure-from-Motion 和 Multi-View Stereo 流水线,用于 3D 重建
一个通用的 Structure-from-Motion 和 Multi-View Stereo 流水线,用于从图像集合重建三维结构。
Meshroom: 一个用于 3D 重建和计算机视觉流水线的基于节点的视觉编程框架
一个用于 3D 重建和计算机视觉的基于节点的视觉编程框架,使用户能够利用 AI 和摄影测量技术构建复杂的数据处理流水线。
open_clip: 一个用于训练和部署大规模对比语言-图像及音频-文本模型的开源框架"} <|file_separator|> <|thought|> <|thought|> {
OpenAI CLIP 的开源实现,支持训练和使用大规模对比语言-图像模型,用于零样本分类和检索。
carla: 一个用于训练和验证自动驾驶系统的开源城市驾驶模拟器
一个用于自动驾驶研究的开源模拟器,用于在模拟的城市环境中开发、训练和验证自动驾驶系统。
labelme:一个带 AI 辅助掩码和多格式数据集导出的图形图像标注工具
一个图形图像标注工具,允许用户使用各种形状和 AI 辅助工具对图像进行标注,以创建计算机视觉模型的数据集。
cvat: 一个用于构建高质量计算机视觉数据集的专业数据标注平台
一个用于为计算机视觉构建高质量视觉数据集的开源数据标注平台,支持图像、视频和 3D 标注。
AirSim: 用于自动驾驶车辆和 AI 研究的高保真视觉与物理模拟器
一个基于 Unreal Engine 构建的无人机和汽车开源模拟器,旨在作为深度学习、计算机视觉和强化学习领域 AI 研究的平台。
MaaAssistantArknights: 一个基于图像识别的《明日方舟》自动化助手,可自动完成日常任务和基建管理
一个基于图像识别和深度学习的《明日方舟》自动化助手,用于自动化日常任务、基建管理和资源采集。
vit-pytorch: 一个使用 PyTorch 实现的 Vision Transformer (ViT) 及其变体的全面集合
一个全面的 PyTorch 库,实现了原始的 Vision Transformer (ViT) 及其数十种用于图像分类的高级变体。
label-studio: 一个具有 ML 辅助预标注和主动学习功能的多模态开源数据标注工具
一款开源数据标注工具,允许用户标注音频、文本、图像和视频,以准备或改进机器学习模型的训练数据。
espnet:面向 ASR、TTS 与口语语言理解的全方位端到端语音处理工具包
一个基于 PyTorch 的端到端语音处理工具包,提供统一框架,支持 ASR、TTS、语音翻译和增强等任务。
leon: 一个具有代理执行能力和本地优先隐私保护的开源个人 AI 助手
一个开源的个人 AI 助手,通过使用工具、记忆和代理执行来执行任务,同时支持本地 AI 模型以保护隐私。
HunyuanVideo-1.5: 一个适用于消费级 GPU 进行高质量合成的 8.3B 参数轻量级视频生成模型
一个 8.3B 参数的轻量级视频生成模型,能够在消费级 GPU 上实现高质量的文本到视频和图像到视频合成。
OpenMontage: 一个将研究、剧本编写和编辑编排进完整制作流水线的智能体视频制作系统
一个开源的、智能体驱动的视频制作系统,通过编排研究、剧本编写、素材生成和编辑,根据自然语言提示词创建专业的视频。
genai-processors: 一个用于构建异步且可组合的多模态 AI 流水线的模块化框架
一个轻量级的 Python 库,用于构建模块化、异步且可组合的 AI 流水线,统一了多模态内容处理和流式传输。
instill-core: 一个用于数据处理、流水线编排和模型托管的端到端 AI 基础设施平台
一个端到端的 AI 平台,简化了非结构化数据、AI 流水线和模型部署的编排,用于构建 RAG 和 AI 优先的应用。