graspnet/graspnetAPI
一个用于 GraspNet-1Billion 数据集的 Python API,提供加载、处理和验证机器人抓取研究所需的抓取标签和点云数据。
google-research/language-table
一套用于开放词汇视觉-语言-运动学习的人类采集数据集及基准测试,使机器人能够执行大量的自然语言指令。
ClemensElflein/xESC
专为机器人设计的开源、低成本无刷直流电机电子调速器 (ESC),支持 FOC 和多种控制模式。
Tobias-Fischer/rt_gene
使用 PyTorch 和 ROS 2 的实时眼动与眨眼估计系统,用于在自然环境中追踪视线方向和眨眼概率。
PX4/PX4-SITL_gazebo-classic
使用Gazebo插件为PX4自动驾驶仪提供SITL和HITL模拟的,适用于探测车、船只和飞行器的飞行模拟器。
napframework/nap
一个低开销、实时的控制与可视化平台,用于创建与硬件、传感器和媒体交互的响应式应用程序。
RoboStack/ros-noetic
一个使用 Conda 包管理器的跨平台 ROS Noetic 发行版,可简化在 Linux、macOS 和 Windows 上的安装和依赖管理。
Le0nX/ModernRoboticsCpp
一个与《Modern Robotics: Mechanics, Planning, and Control》教科书配套的 C++ 库,提供机器人学、规划和控制算法的教育性实现。
Simple-Robotics/proxsuite
专为高性能机器人学和优化任务设计的、数值上稳健且高效的线性与二次规划问题数值求解器集合。
openrr/urdf-viz
基于 Rust 的 URDF 和 Xacro 机器人描述文件可视化工具,支持通过 JSON API 进行交互式关节操作和远程控制。
robotology/yarp
YARP 是一个用于机器人的通信库和工具包,提供软件组件之间的标准化设备接口和消息传递。
makeecat/Peng
用 Rust 编写的最小化多旋翼自主框架,提供实时动力学仿真、轨迹规划和控制。
Stable-Baselines-Team/stable-baselines3-contrib
一个为 Stable-Baselines3 提供的贡献包,包含实验性强化学习算法和研究人员与开发者所需的特殊工具。
gkjohnson/urdf-loaders
一个用于 Unity 和 THREE.js 的 URDF 加载库集合,使开发者能够在 3D 环境中导入和可视化机器人模型。
UniversalRobots/Universal_Robots_ROS2_Driver
这是一个为 Universal Robots 机械臂开发的 ROS2 驱动程序,可实现硬件通信、通过 MoveIt2 进行运动规划,并将其 ROS2 行为整合到工业协作机器人中。
RobotWebTools/roslibjs
一组 JavaScript 客户端库,使 Web 应用程序能够与 ROS (Robot Operating System) 系统通信,从而构建机器人界面。
UniversalRobots/Universal_Robots_ROS_Driver
用于 Universal Robots CB3 和 e-Series 機械臂的 ROS 驱动程序,提供稳定用于实时控制、校标定和与 ROS-control 集成的接口。
hungpham2511/toppra
用于计算机器人时间最优路径参数化的库,使其能够在遵守运动学和动力学约束的同时,尽可能快地沿几何路径移动。
Phylliade/ikpy
一个支持 URDF 和 MuJoCo MJCF 导入、并具有加速 JAX 后端的纯 Python 逆运动学计算库。
neka-nat/cupoch
用于机器人领域快速 3D 数据处理的 GPU 加速库,提供高性能点云算法、碰撞避免和路径规划。
RoboVerseOrg/RoboVerse
一个用于可扩展机器人学习的统一平台与基准,将多个仿真框架和数据集整合到单一界面中。
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasoner 是一个研究框架,为视觉-语言模型添加视觉操作(如缩放、选帧等),通过指令微调和好奇心驱动的强化学习进行训练。该仓库提供安装指南、SFT 和 RL 阶段的脚本、预训练的 7B 检查点、数据集以及图像和视频基准的评估流水线。
jabberjabberjabber/ImageIndexer
一款本地 AI 工具,可自动生成图像的说明文字和关键词,并将其直接写入图像元数据中,以便于索引和搜索。
yuanze-lin/Olympus
一个计算机视觉的通用任务路由器,可将单一自然语言指令转换为一系列专业模型调用,以生成图像、视频和3D模型。
facebookresearch/mmf
MMF 是一个基于 PyTorch 的模块化视觉与语言多模态研究框架,提供最先进模型的参考实现以及分布式训练工具。
om-ai-lab/VLM-FO1
VLM-FO1 是一个用于视觉语言模型(Vision-Language Models)的即插即用模块,能够在不损害通用推理能力的情况下,增强细粒度感知和空间意识。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling 是一个社区维护的“awesome-list”,全面调查多模态 AI 模型。它定义了四个清晰的类别——Traditional、MLLMs、Unified 和 Native——解释其架构差异,并链接到 Hugging Face 上的开源模型集合。该仓库为需要结构化视角来理解快速演进的多模态领域的研究人员和工程师提供支持。
OpenBMB/UltraEval-Audio
一个用于评估大型音频基础模型(large audio foundation models)的统一开源框架,支持跨 34 个基准测试(benchmarks)的语音理解与生成。
Sharrnah/whispering-ui
Whispering Tiger 应用程序的原生 Windows UI,可实现音频流和游戏内图像的实时转录与翻译。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar 是 Kaldi 语音识别引擎的 Python 包装器,可编译多个小型语法,并在每个语音输入中仅激活所需部分。支持所有主流操作系统二进制 wheel,包含预训练英语模型,并为 Dragonfly 和 Caster 语音控制框架提供后端。通过 pip 安装,下载模型,定义规则,即可动态启用上下文感知的命令控制。
cubist38/mlx-openai-server
一个用于在 Apple Silicon 上本地运行 MLX 模型的 OpenAI 兼容 API 服务器,支持文本、多模态、图像和音频模型。
filippogiruzzi/voice_activity_detection
一种基于深度学习的语音活动检测(VAD)系统,使用 1D-ResNet 和 MFCC 特征将音频信号分类为语音或噪声。
dictation-toolbox/dragonfly
一个允许用户创建自定义语音命令以自动化计算机操作和通过语音编程的 Python 语音识别框架。
algolia/voice-overlay-ios
一个提供精致的语音转文字覆盖层 UI 的 iOS 库,使用 Apple 的原生 `SFSpeechRecognizer` 处理权限和语音识别。
judahpaul16/gpt-home
一个基于 Raspberry Pi 的自托管 AI 家庭助手,使用 LiteLLM 和 LangGraph 将 LLM 与家庭自动化和个人生产力工具集成。
sveinbjornt/hear
macOS 的命令行接口,可使用系统内置语音识别功能对实时麦克风输入和音频文件进行转录。
Picovoice/rhino
Rhino 是 Picovoice 的本地设备语音转意图引擎,可实时将语音命令转换为结构化的意图和槽位。它可在从微控制器到手机、浏览器和桌面设备的各类设备上本地运行,支持多种语言,并提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。
openspeech-team/openspeech
一个用于构建端到端自动语音识别系统的框架,提供 20 多种 ASR 模型的参考实现以及多种语言的配方。
yeyupiaoling/MASR
一个基于 PyTorch 的自动语音识别框架,支持多种模型架构和语言的流式与非流式推理。
mybigday/whisper.rn
设备端 Whisper(及 NVIDIA Parakeet)语音转文本的 React Native 绑定,支持 GPU/Core ML 加速、语音活动检测(VAD)和实时流式传输。
TheStageAI/TheWhisper
基于微调的 Whisper 模型,专为 NVIDIA GPU 和 Apple Silicon 上的低延迟流式传输和设备内推理优化的高性能语音转文本解决方案。
TensorSpeech/TensorFlowASR
一个基于 TensorFlow 的自动语音识别 (ASR) 框架,实现了多种 ASR 架构,并支持 TFLite 转换以进行高效部署。
ardha27/AI-Waifu-Vtuber
一款集成了语音识别、LLM 和文本转语音技术的 AI 驱动 VTuber 助手,用于创建用于直播和个人使用的交互式虚拟角色。
sooftware/conformer
Conformer 架构的 PyTorch 实现,通过结合 CNN 和 Transformer 来捕捉局部和全局音频依赖关系,从而提高语音识别性能。
modal-labs/quillman
一个由 Moshi 语音对语音模型驱动的语音聊天应用,提供低延迟、双向音频流,实现类人交互。
tensorflow/lingvo
一个专为构建和扩展序列到序列模型及巨型语言模型而设计的模块化 TensorFlow 框架。
HeyWillow/willow
Willow 是一个可自托管的推理服务器,用于快速执行包括语音转文本、文本转语音和 LLM 处理在内的语言任务。
flashlight/wav2letter
wav2letter++ 是一个端到端自动语音识别框架,它提供实现最先进语音转文本架构的方案(recipes)和预训练模型。