browser-use/jev-ultrafast

Jev Ultrafast 是一個開源瀏覽器代理,使用小型 LLM 從動態生成的索引化頁面控制項清單中選擇單一操作(點擊、輸入、選擇等)和單一 UI 元素。每次決策僅需一次網路往返,可在約 7 秒內完成 Google Flights 搜尋,無需網站特定腳本,並具備防止任意程式碼執行的安全檢查。

Tencent/WeKnora

WeKnora 是一個開源、企業級的框架,能將文件轉化為可搜尋、具備推理能力的知識庫。它提供 RAG 問答、ReAct 代理、自動生成的 Wiki 頁面、沙盒自定義技能、跨會話記憶,以及可插拔的 LLM/向量資料庫後端,並支援地端部署、細粒度 RBAC 與可觀測性。

google/artemis

一個由 AI 驅動的 Android 自動化框架,讓 AI 助手和測試套件能夠使用自然語言和多模態感知來操作實體裝置。

dexmal/opendm

OpenDM 是一個用於開放世界機器人控制的視覺-語言-動作 (VLA) 框架與模型集合 (DM0.5),支援多具身訓練、微調及高效能推論。

dexmal/dexbotic

基於 PyTorch 的視覺-語言-行動(VLA)模型開發工具箱,簡化具身智能的預訓練、微調與評估流程。

amagine-ai/Amagine3D

一個開源的 3D 能力層,可從文字描述、圖片與尺寸生成可編輯、可列印的硬體外殼與組裝結構。

dexmal/opendw

DW05是一個用於具身智能的多模態世界模型,統一了未來影片預測、動作生成和狀態價值估計,幫助機器人預測其動作的結果。

earthtojake/text-to-cad

一個用於CAD、CAE和CAM的代理技能庫,使AI代理能夠從自然語言請求生成3D模型、機器人描述檔案和可製造的G程式碼。

enactic/openarm

專為物理 AI 研究、模仿學習及安全的機器人-人互動而設計的開源 7 自由度 (7DOF) 類人機器人手臂及標準化環境。

v-modal/vmodal_sdk_robotics

一個具備崩潰恢復能力的機器人數據上傳 SDK,確保 LeRobot 數據集工件在網路不穩定或電源故障時仍能持久暫存並上傳。

browserbase/stagehand

Stagehand 是一個開源 SDK(TS/Python/Go),讓 LLM 驅動的代理透過自然語言指令(`act`、`observe`、`extract`)控制真實瀏覽器。它能為 token 效率裁剪頁面上下文,自動修復網站變更,並返回經過模式驗證的資料。專為代理設計,可在本地或 Browserbase 上實現更快、快取執行。

pollen-robotics/microduck

Microduck 是小型雙足機器人的控制軟體,利用強化學習策略實現行走、翻滾以及與環境的互動。

makerspet/oomwoo

一個開源的 DIY 掃地機器人,使用 Raspberry Pi 和 ROS2 打造,利用 2D LiDAR 進行自主本地導航,無需依賴雲端。

neka-nat/freecad-mcp

一個 Model Context Protocol 伺服器,讓 AI 助手能控制 FreeCAD 進行 3D 建模、Python 程式碼撰寫與 FEM 分析。

AI-FanGe/Microduck-build-tutorial

一個緊湊型雙足機器人專案,提供從基於 MuJoCo 的強化學習訓練到在 Raspberry Pi Zero 2 W 上使用 ONNX 策略進行現實世界部署的完整流程。

eonsystemspbc/fly-brain

基於 FlyWire 連接組的成蟲果蠅全腦漏電積分-放電模型,可模擬與分析神經尖峰傳播。

PhyAgentOS/PhyAgentOS-core

一個用於具身智能 AI 的代理框架,使用統一的 API 閘道和基於證據的驗證,確保物理任務成功完成並可遞歸改進。

anonymous-report-421/GPT-as-Policy

一個評估框架和技術報告,探討將 GPT-6 Astra 用作具身機器人策略,比較直接控制與修正基礎策略動作的混合方法。

OpenWAM-Official/OpenWAM

一個用於開發世界-動作模型(WAMs)的開源研究堆疊,提供模組化基礎設施,支援結合世界知識與動作學習的機器人策略之預訓練與微調。

fanhao375/microduck-replica

Microduck 雙足機器人的第三方硬體重建,將模擬模型逆向工程為可列印的 CAD 檔案、BOM 和電子電路圖。

air-embodied-brain/Zetta-Embodiment

一種高效的閉迴路具身框架,透過進化程式碼化恢復技能與評論者來提升機器人任務成功率,無需重新訓練基礎策略。

78/xiaozhi-esp32

一個為 ESP32 微控制器設計的開源 AI 聊天機器人框架,支援透過 MCP 協定實現與 LLM 的語音互動與硬體控制。

huggingface/lerobot

一個基於 PyTorch 的現實世界機器人技術庫,提供硬體控制的標準化介面、可擴展的資料集格式以及最先進的 AI 策略。

kevinzakka/mjbatch

mjbatch 是一個 Python 庫,使用 C++ 線程池在 CPU 上並行執行數千個 MuJoCo 物理模擬。它提供對模擬狀態的即時 NumPy 風格綁定,支援每模擬模型參數變動,適用於強化學習、MPC、系統辨識與機器人共設計。可透過 pip 安裝;範例包括小車擺起、Go1 四足控制與手臂共設計。

VectifyAI/PageIndex

PageIndex 是一個開源 RAG 系統,以從文件佈局建立的階層樹索引取代向量儲存檢索。LLM 在此樹上推理以定位相關部分,生成可解釋、可引用的答案,無需任何向量資料庫或分塊。SDK 可本地運行(約 $0.001/頁索引成本)或透過 PageIndex Cloud 處理 OCR 資料密集型、大規模語料庫。基準測試顯示在 FinanceBench 上準確率達 98.7%,查詢成本比將整份 PDF 輸入模型低至 16 倍。

google-deepmind/mujoco

用於快速、準確地模擬關節結構的高性能物理引擎,廣泛應用於機器人技術和機器學習研究。

DenisSergeevitch/desktop-fly

一款由 FlyWire 和 MaleCNS 的真實神經連接組資料驅動的 3D 桌面寵物果蠅,透過脈衝神經網路模擬生物行為。

Rhoban/microban

一款緊湊、可3D列印的開源人形機器人,專為機器人學習與實驗設計,價格親民。

RLinf/RLinf

RLinf 是一個開源、PyTorch 兼容的強化學習基礎設施,專為大規模具身與自主智能 AI 設計。它整合了多種模擬器與真實機器人平台,支援廣泛的加速器,並提供針對 PPO、GRPO、SAC 等強化學習演算法,以及新型流變換方法的即用型管道,用於微調大型視覺-語言、擴散與 MoE 模型。該庫包含豐富的系統優化(如 FUSCO)與數十個範例配方,適用於需要統一、可擴展訓練與部署骨幹的科研人員與工程師,可在模擬環境與真實世界中高效運行強化學習代理。

showlab/Show-Harness

Show-Harness 是一種具身無關的 harness,為視覺-語言模型提供統一的語義介面,實現對各類機器人的零樣本控制或高效微調。

pollen-robotics/microduck_rl

為 Microduck 雙足機器人提供強化學習訓練環境,透過高保真執行器建模與領域隨機化,實現複雜步態與技巧的模擬到現實遷移。

jnz/INSLIB

一種用於自動駕駛車輛與機器人的可攜式 C 語言函式庫,透過強健卡爾曼濾波融合 IMU、GNSS 及其他感測器資料,實現 3D 導航狀態估計。

nftechie/doomfly

一個將生物學重建的果蠅連接組與 ViZDoom 競技場連接的模擬,旨在測試生物神經布線是否能透過多巴胺門控記憶規則實現生存訓練。

RoboDojo-Benchmark/RoboDojo

一個用於在 60 個多樣化任務中全面評估通用型機器人操作策略的統一模擬與現實基準測試。

datawhalechina/every-embodied

一個全面的具身人工智慧學習程式庫,提供從基礎機器人模擬到重現最前沿 VLA 與世界模型的結構化路徑。

hanyang9/UMR

一個為人型機器人設計的統一運動重定向框架,利用學習到的點雲對應關係,在無需手動關節映射的情況下,將人類動作轉移到機器人身上。

ShawnPana/phone-harness

Phone Harness 是一個開源橋接工具,讓 LLM 代理能透過 macOS 鏡像控制真實 iPhone,或透過 ADB 控制真實 Android 裝置。它擷取螢幕,對可見文字進行 OCR,並注入 HID 事件,使代理能開啟應用程式、點擊文字、輸入內容並讀取結果,完全無需在手機上安裝任何東西。

robocurve/inspect-robots

一個開源的物理 AI 評估框架,可讓你在任何相容的機器人或模擬器上執行任意機器人策略,並提供可審計的日誌與即時可視化。

google-deepmind/mujoco_menagerie

專為 MuJoCo 物理引擎設計的高品質機器人模型精選集合,旨在確保模擬具備真實性與忠實度。

LiteReality/LiteReality-Agent

一個端到端工具包,可將現實世界的房間掃描轉換為機器人模擬用的互動式、物理啟用的3D環境。

RLinf/RPent

RPent 是一個開放式框架,用於構建使用遞歸互動與記憶來演化其能力並提高長程物理操作任務成功率的具身智能體。

TheRobotStudio/SO-ARM100

專為與 LeRobot 庫無縫整合而設計的開源低成本機器人臂(SO-100 與 SO-101)硬體設計,使 AI 機器人技術對開發者與研究人員更易取得。

NVlabs/GR00T-WholeBodyControl

一個用於人形機器人全身控制的框架,包含 SONIC 基礎模型,該模型透過大規模運動資料學習,使機器人能夠執行廣泛自然的人類動作。

nvidia-isaac/video_to_data

一個端到端的管線,可將人類示範影片轉換為模擬就緒的資產,以及用於強化學習策略訓練的物理基礎機器人訓練資料。

Robbyant/lingbot-vla-v2

LingBot-VLA 2.0 是一個視覺-語言-動作(VLA)基礎模型,通過統一動作表示並使用 MoE 專家進行跨具身泛化,使各種配置的機器人能夠執行複雜任務。

QwenLM/Qwen-Drive-1.0

一個用於自動駕駛的視覺語言基礎模型,將 3D 感知、視覺問答和運動規劃整合到統一框架中。

FoloToy/ai-passport

一個開源的穿戴式 AI 硬體開發基準,提供穩定的 API 和參考實作,用於構建 AI 驅動的穿戴式應用程式。

espressif/esp-claw

針對 ESP32 系列 IoT 裝置的 AI 代理框架,允許使用者透過聊天定義裝置行為,並在邊緣本地執行決策。