alesaccoia/VoiceStreamAI
使用 WebSockets、语音活动检测 (VAD) 和 Faster Whisper 实现近实时音频流传输与转写的 Python 和 JavaScript 解决方案。
liangnjupt/VisTouch
用于材料识别和跨模态学习的机器人滑动接触的大型同步视频、音频和触觉力数据集。
RoboDK/RoboDK-API
用于工业机器人仿真和离线编程的多语言 API,允许开发人员使用通用语言而非特定厂商语言来对任何工业机械臂进行编程。
graspnet/graspnetAPI
一个用于 GraspNet-1Billion 数据集的 Python API,提供加载、处理和验证机器人抓取研究所需的抓取标签和点云数据。
google-research/language-table
一套用于开放词汇视觉-语言-运动学习的人类采集数据集及基准测试,使机器人能够执行大量的自然语言指令。
ClemensElflein/xESC
专为机器人设计的开源、低成本无刷直流电机电子调速器 (ESC),支持 FOC 和多种控制模式。
PeterFWS/Structure-PLP-SLAM
一种利用点、线和平面实现高效稀疏建图与定位的视觉 SLAM 系统,适用于单目、RGB-D 和立体相机。
livekit/rust-sdks
LiveKit 的 Rust 客户端 SDK,支持跨桌面与移动端的实时视频/音频/数据流串流、房间管理以及硬件加速编码。
cyberbotics/webots_ros2
该软件包提供接口,通过使用 ROS2 消息、服务和动作,在 Webots 3D 仿真器中模拟机器人。
vikashplus/robohive
一个统一的机器人学习框架,提供通过 OpenAI-Gym API 暴露的 MuJoCo 模拟环境和任务集合。
Firmament-Autopilot/FMT-Firmware
一种基于模型设计的高性能嵌入式自动驾驶系统,可实现快速控制系统的开发与自动代码生成。
UM-ARM-Lab/pytorch_kinematics
用于 PyTorch 的并行且可微的机器人运动学库,提供快速的正向运动学、逆运动学及 Jacobian 计算。
rsasaki0109/lidar_slam_ros2
一个将传感器数据包转换为 Autoware 兼容地图包(包含点云和自动生成的 lanelet2 文件)的 ROS 2 LiDAR SLAM 系统。
snape/RVO2
一个 C++ 库,实现了最优相互碰撞避免(ORCA),使数千个独立的机器人或智能体能够在共享空间中无碰撞、无需通信地导航。
Phylliade/ikpy
一个支持 URDF 和 MuJoCo MJCF 导入、并具有加速 JAX 后端的纯 Python 逆运动学计算库。
IDEA-CCNL/Fengshenbang-LM
一个开源的中文预训练基础模型生态系统,以及用于自然语言理解、生成和多模态任务的支持框架。
gokayfem/ComfyUI_VLM_nodes
面向视觉语言模型的生产级 ComfyUI 节点套件,提供结构化检测、分割和自适应视频推理,并优化 VRAM 使用。
jim60105/docker-whisperX
一组为 WhisperX 优化的 Docker 镜像,提供预打包的 ASR 模型,支持单词级时间戳,实现快速高效的语音转文字转录。
TalAter/annyang
一个轻量级的 JavaScript 库,使用语音识别技术使用户能够通过语音命令控制网站。
MatteoFasulo/Whisper-TikTok
一款利用 OpenAI-Whisper 和 Edge TTS 自动生成带有自然语音旁白的字幕 TikTok 视频的 AI 工具。
wildminder/ComfyUI-VoxCPM
VoxCPM 的 ComfyUI 自定义节点集成。VoxCPM 是一个无需分词器(tokenizer-free)的 TTS 系统,能够实现富有表现力的语音生成、自然语言语音设计以及高级语音克隆。
thiswillbeyourgithub/AnkiAIUtils
一套AI驱动的工具,可自动为Anki闪卡添加AI生成的图像、记忆术和解释,以提升学习效率。
microsoft/ai-dev-gallery
为 Windows 开发者提供的交互式 AI 示例库,可探索本地 AI 模型并将其导出为 C# Visual Studio 项目。
MochiDiffusion/MochiDiffusion
专为 Apple Silicon 设计的 macOS 原生应用程序,用于在本地运行 Stable Diffusion 和 FLUX.2 Klein,通过 Core ML 优化了高性能和低内存占用。
1ay1/agentty
一个由 C++26 驱动的极速终端编码代理,使用本地 RAG 和多模型编排器,提供轻量级、与供应商无关的 Claude Code 替代方案。
Faceplugin-ltd/FaceRecognition-Android
适用于 Android 的本地设备人脸识别与活体检测 SDK,支持私密、离线生物识别身份验证和属性分析。
yixuantt/MultiHop-RAG
一个 QA 数据集和基准测试工具,旨在评估 RAG 流程在跨多篇文档与元数据检索与推理的能力。
aayoawoyemi/Ori-Mnemos
一个为 AI 代理设计的开源持久化内存基础设施,利用 Markdown 文件知识图谱来实现认知遗忘与递归检索。
Dana-Farber-AIOS/pathml
PathML 是一个开源的 Python 库(也提供 Docker 镜像),可简化全片病理工作流:加载多种切片格式、执行可扩展的预处理(染色归一化、切块、GPU 转换)、将数据转换为 PyTorch 张量、构建细胞层级图,并运行深度学习或 ONNX 模型。它旨在降低 AI 驱动的计算病理门槛,已在多篇高影响力的生物医学出版物中使用。
langchain-ai/langchain-google
Google 生成式 AI、Gemini API 和 Vertex AI 服务的 LangChain 集成的中央集合。
goat-sdk/goat
一个具备代理功能的金融工具套件,使 AI 代理能够管理钱包、执行付款,并使用区块链基础设施执行投资策略。
aallan/vera
一种专为 LLM 编写而设计的编程语言,使用结构化引用替代变量名,并强制要求 SMT 证明契约以确保正确性。
MeetKai/functionary
Functionary is a language model specialized in interpreting and executing functions and plugins, supporting parallel tool calls and a built-in code interpreter.
meta-pytorch/torchx
TorchX 是一个适用于 PyTorch 应用程序的通用作业启动器,可让用户在 Kubernetes、Slurm、Docker 和本地环境中启动作业。
apocas/restai
一个 AI 即服务(AIaaS)平台,通过 REST API 创建和部署 RAG 系统、智能体和推理端点,并配备完整的管理仪表板。
stereolabs/zed-unity
一个 Unity 插件,将 ZED 相机的深度感知、空间映射和目标检测功能集成到 Unity 引擎,用于 AR/MR 开发。
deepfates/memery
利用 OpenAI 的 CLIP 技术,通过文本或图像查询在本地文件夹中查找特定图像的自然语言图像搜索工具。
xavierpuigf/virtualhome
一个交互式的家庭活动模拟平台,允许研究人员通过 Python API 训练具身 AI 代理并生成合成视频数据。
nachifur/MulimgViewer
专为高效比较、过滤和拼接大规模图像数据集而设计的多图查看器,具有并行缩放和自动图表生成功能。
GoogleCloudPlatform/genai-for-marketing
一个基于 Google Cloud 的解决方案,利用 Vertex AI 与 Google Workspace 集成,自动化营销内容生成、趋势分析和数据查询。
unbody-io/unbody
Unbody 是一个为 AI 应用程序设计的开源后端基础设施项目,旨在提供全面的数据管理和索引系统。
awslabs/generative-ai-cdk-constructs
一个开源的 AWS CDK 扩展,提供良好架构的基础设施模式,帮助快速在 AWS 上部署生成式 AI 解决方案。
linzhiqiu/t2v_metrics
一个自动化评估文本到图像和文本到视频模型的框架,使用多模态大型语言模型(LLM)对视觉‑文本对齐度进行打分。
pinellolab/DNA-Diffusion
一种基于扩散模型的生成式模型,用于创建 200bp 的细胞类型特异性合成调控 DNA 序列。
adobe-research/custom-diffusion
一种快速且高效的方法,用于微调文本到图像扩散模型,从少量图像中学习新概念,且仅需极少的存储空间。
hitsz-ids/synthetic-data-generator
A specialized framework for generating high-quality, privacy-preserving synthetic tabular data using statistical models, GANs, and LLMs.
haifengl/smile
一个为 JVM 提供全面且高效能的机器学习框架,提供传统机器学习、深度学习、大语言模型 (LLM) 以及代理式数据科学 IDE 的工具。
tensorchord/envd
一个命令行工具,通过简单的 Python 声明,而非复杂的 Dockerfile,来创建基于容器的 AI/ML 开发环境。