browser-use/jev-ultrafast

Jev Ultrafast 是一个开源浏览器代理,使用小型 LLM 从动态生成的索引化页面控件列表中选择单一操作(点击、输入、选择等)和单一 UI 元素。每次决策仅需一次网络往返,可在约 7 秒内完成 Google Flights 搜索,无需站点特定脚本,并具备防止任意代码执行的安全检查。

Tencent/WeKnora

WeKnora 是一个开源、企业级的框架,能将文档转化为可搜索、具备推理能力的知识库。它提供 RAG 问答、ReAct 代理、自动生成的 Wiki 页面、沙盒自定义技能、跨会话记忆,以及可插拔的 LLM/向量数据库后端,并支持本地部署、细粒度 RBAC 与可观测性。

google/artemis

一个由 AI 驱动的 Android 自动化框架,使 AI 助手和测试套件能够使用自然语言和多模态感知来导航真实设备。

dexmal/opendm

OpenDM 是一个用于开放世界机器人控制的视觉-语言-动作 (VLA) 框架与模型集合 (DM0.5),支持多具身训练、微调及高性能推理。

dexmal/dexbotic

基于 PyTorch 的视觉-语言-动作(VLA)模型开发工具箱,简化具身智能的预训练、微调和评估流程。

amagine-ai/Amagine3D

一个开源的 3D 能力层,可根据文本描述、图像和尺寸生成可编辑、可打印的硬件外壳和组装结构。

dexmal/opendw

DW05是一个用于具身智能的多模态世界模型,统一了未来视频预测、动作生成和状态价值估计,帮助机器人预测其动作的结果。

earthtojake/text-to-cad

一个用于CAD、CAE和CAM的代理技能库,使AI代理能够从自然语言请求生成3D模型、机器人描述文件和可制造的G代码。

enactic/openarm

专为物理 AI 研究、模仿学习和安全的机器人-人交互而设计的开源 7 自由度 (7DOF) 类人机器人手臂及标准化环境。

v-modal/vmodal_sdk_robotics

一个具备崩溃恢复能力的机器人数据上传 SDK,确保 LeRobot 数据集工件在网络不稳定或电源故障时仍能持久暂存并上传。

browserbase/stagehand

Stagehand 是一个开源 SDK(TS/Python/Go),让 LLM 驱动的代理通过自然语言命令(`act`、`observe`、`extract`)控制真实浏览器。它能为 token 效率裁剪页面上下文,自动修复网站变更,返回经过模式验证的数据。专为代理设计,可在本地或 Browserbase 上实现更快、缓存执行。

pollen-robotics/microduck

Microduck 是小型双足机器人的控制软件,利用强化学习策略实现行走、翻滚以及与环境的交互。

makerspet/oomwoo

一个开源的 DIY 扫地机器人,使用 Raspberry Pi 和 ROS2 构建,利用 2D LiDAR 进行自主本地导航,无需依赖云端。

neka-nat/freecad-mcp

一个 Model Context Protocol 服务器,使 AI 助手能够控制 FreeCAD 进行 3D 建模、Python 脚本编写和 FEM 分析。

AI-FanGe/Microduck-build-tutorial

一个紧凑型双足机器人项目,提供从基于 MuJoCo 的强化学习训练到在 Raspberry Pi Zero 2 W 上使用 ONNX 策略进行现实世界部署的完整流水线。

eonsystemspbc/fly-brain

基于 FlyWire 连接组的成年果蝇全脑漏电积分-放电模型,可模拟和分析神经尖峰传播。

PhyAgentOS/PhyAgentOS-core

一个用于具身智能 AI 的代理框架,使用统一的 API 网关和基于证据的验证,确保物理任务成功完成并可递归改进。

anonymous-report-421/GPT-as-Policy

一个评估框架和技术报告,探讨将 GPT-6 Astra 用作具身机器人策略,比较直接控制与修正基础策略动作的混合方法。

OpenWAM-Official/OpenWAM

一个用于开发世界-动作模型(WAMs)的开源研究栈,提供模块化基础设施,支持结合世界知识与动作学习的机器人策略的预训练和微调。

fanhao375/microduck-replica

Microduck 双足机器人的第三方硬件重建,将仿真模型逆向工程为可打印的 CAD 文件、BOM 和电子原理图。

air-embodied-brain/Zetta-Embodiment

一种高效的闭合回路具身框架,通过进化代码化恢复技能和批评者来提升机器人任务成功率,无需重新训练基础策略。

78/xiaozhi-esp32

一个为 ESP32 微控制器设计的开源 AI 聊天机器人框架,支持通过 MCP 协议实现与 LLM 的语音交互和硬件控制。

huggingface/lerobot

一个基于 PyTorch 的现实世界机器人技术库,提供硬件控制的标准化接口、可扩展的数据集格式以及最先进的 AI 策略。

kevinzakka/mjbatch

mjbatch 是一个 Python 库,使用 C++ 线程池在 CPU 上并行运行数千个 MuJoCo 物理模拟。它提供对模拟状态的实时 NumPy 风格绑定,支持每模拟模型参数变化,适用于强化学习、MPC、系统辨识和机器人协同设计。可通过 pip 安装;示例包括小车摆起、Go1 四足控制和机械臂协同设计。

VectifyAI/PageIndex

PageIndex 是一个开源 RAG 系统,用从文档布局构建的层次树索引替代向量存储检索。LLM 在此树上推理以定位相关部分,生成可解释、可引用的答案,无需任何向量数据库或分块。SDK 可本地运行(约 $0.001/页索引成本)或通过 PageIndex Cloud 处理 OCR 密集型、大规模语料库。基准测试显示在 FinanceBench 上准确率达 98.7%,查询成本比将整份 PDF 输入模型低至 16 倍。

google-deepmind/mujoco

用于快速、准确地模拟关节结构的高性能物理引擎,广泛应用于机器人技术和机器学习研究。

DenisSergeevitch/desktop-fly

一款由 FlyWire 和 MaleCNS 的真实神经连接组数据驱动的 3D 桌面宠物果蝇,通过脉冲神经网络模拟生物行为。

Rhoban/microban

一款紧凑、可3D打印的开源人形机器人,专为机器人学习与实验设计,价格亲民。

RLinf/RLinf

RLinf 是一个开源、PyTorch 兼容的强化学习基础设施,专为大规模具身与自主智能 AI 设计。它整合了多种模拟器与真实机器人平台,支持广泛的加速器,并提供针对 PPO、GRPO、SAC 等强化学习算法,以及新型流变换方法的即用型管道,用于微调大型视觉-语言、扩散和 MoE 模型。该库包含丰富的系统优化(如 FUSCO)和数十个示例配方,适用于需要统一、可扩展的训练与部署骨干的科研人员和工程师,可在仿真环境与真实世界中高效运行强化学习智能体。

showlab/Show-Harness

Show-Harness 是一种具身无关的 harness,为视觉-语言模型提供统一的语义接口,实现对各类机器人的零样本控制或高效微调。

pollen-robotics/microduck_rl

为 Microduck 双足机器人提供强化学习训练环境,通过高保真执行器建模和领域随机化,实现复杂步态与技巧的仿真到现实迁移。

jnz/INSLIB

一种用于自动驾驶车辆和机器人领域的便携式 C 语言库,通过鲁棒卡尔曼滤波融合 IMU、GNSS 及其他传感器数据,实现 3D 导航状态估计。

nftechie/doomfly

一个将生物学重建的果蝇连接组与 ViZDoom 竞技场连接的模拟,旨在测试生物神经布线是否能通过多巴胺门控记忆规则实现生存训练。

RoboDojo-Benchmark/RoboDojo

一个用于在 60 个多样化任务中全面评估通用型机器人机器人操作策略的统一模拟与现实基准测试。

datawhalechina/every-embodied

一个全面的具身人工智能学习库,提供从基础机器人模拟到复现最先进 VLA 模型和世界模型的结构化路径。

hanyang9/UMR

一个为人形机器人设计的统一运动重定向框架,利用学习到的点云对应关系,在无需手动关节映射的情况下,将人类动作转移到机器人身上。

ShawnPana/phone-harness

Phone Harness 是一个开源桥接工具,让 LLM 代理可以通过 macOS 镜像控制真实 iPhone,或通过 ADB 控制真实 Android 设备。它捕获屏幕,对可见文本进行 OCR,注入 HID 事件,使代理能够打开应用、点击文本、输入内容并读取结果,而无需在手机上安装任何东西。

robocurve/inspect-robots

一个开源的物理 AI 评估框架,可让你在任何兼容的机器人或模拟器上运行任意机器人策略,同时提供可审计的日志和实时可视化。

google-deepmind/mujoco_menagerie

专为 MuJoCo 物理引擎设计的高质量机器人模型精选集合,旨在确保仿真具有真实性和准确性。

LiteReality/LiteReality-Agent

一个端到端工具包,可将现实世界的房间扫描转换为机器人仿真用的交互式、物理启用的3D环境。

RLinf/RPent

RPent 是一个开源框架,用于构建具身智能体,通过递归交互和记忆来演化其能力,并在长周期物理操作任务中提升成功率。

TheRobotStudio/SO-ARM100

一个专为与 LeRobot 库无缝集成而设计的开源低成本机器人臂(SO-100 和 SO-101)硬件设计,使 AI 机器人技术对开发者和研究人员更加可及。

NVlabs/GR00T-WholeBodyControl

一个用于人形机器人全身控制的框架,包含 SONIC 基础模型,该模型通过大规模运动数据学习,使机器人能够执行广泛自然的人类动作。

nvidia-isaac/video_to_data

一个端到端的管道,可将人类演示视频转换为模拟就绪的资产,以及用于强化学习策略训练的物理基础机器人训练数据。

Robbyant/lingbot-vla-v2

LingBot-VLA 2.0 是一个视觉-语言-动作(VLA)基础模型,通过统一动作表示并使用 MoE 专家进行跨具身泛化,使各种配置的机器人能够执行复杂任务。

QwenLM/Qwen-Drive-1.0

一个用于自动驾驶的视觉语言基础模型,将 3D 感知、视觉问答和运动规划集成到统一框架中。

FoloToy/ai-passport

一个开源的穿戴式 AI 硬件开发基线,提供稳定的 API 和参考实现,用于构建 AI 驱动的穿戴式应用程序。

espressif/esp-claw

面向 ESP32 系列 IoT 设备的 AI 代理框架,允许用户通过聊天定义设备行为,并在边缘本地执行决策。