browser-use/jev-ultrafast
Jev Ultrafast는 작은 LLM을 사용하여 동적으로 생성된 인덱싱된 페이지 컨트롤 목록에서 단일 작업(클릭, 입력, 선택 등)과 단일 UI 요소를 선택하는 오픈소스 브라우저 에이전트입니다. 결정당 1회의 네트워크 라운드트립으로 Google Flights 검색과 같은 작업을 약 7초 내에 완료할 수 있으며, 사이트 전용 스크립트가 필요 없고, 임의의 코드 실행을 방지하는 안전 검사 기능을 갖추고 있습니다.
Tencent/WeKnora
WeKnora는 문서를 검색 가능하고 추론 능력을 갖춘 지식 베이스로 변환하는 오픈소스 엔터프라이즈급 프레임워크입니다. RAG Q&A, ReAct 에이전트, 자동 생성 Wiki 페이지, 샌드박스형 커스텀 스킬, 세션 간 메모리, 플러그인 가능한 LLM/벡터 저장소 백엔드를 제공하며, 온프레미스 배포, 세밀한 RBAC 및 관측 가능성을 지원합니다.
google/artemis
AI 어시스턴트와 테스트 스위트가 자연어와 멀티모달 인식을 사용하여 실제 기기를 탐색할 수 있도록 하는 AI 기반 Android 자동화 프레임워크입니다.
dexmal/opendm
OpenDM은 오픈 월드 로봇 제어를 위한 Vision-Language-Action (VLA) 프레임워크 및 모델 컬렉션(DM0.5)으로, 다중 신체(multi-embodiment) 학습, 파인튜닝 및 고성능 추론을 지원합니다.
dexmal/dexbotic
신체적 지능 모델의 사전 학습 및 배포를 위한 PyTorch 기반 통합 개발 도구 상자입니다.
amagine-ai/Amagine3D
텍스트 설명, 이미지 및 치수를 사용하여 편집 가능한 출력 가능한 하드웨어 인클로저와 조립 구조를 생성하는 오픈 소스 3D 기능 레이어.
dexmal/opendw
DW05는 미래 비디오 예측, 행동 생성, 상태 가치 추정을 통합하여 로봇이 행동의 결과를 예측하도록 돕는 구현 지능을 위한 멀티모달 세계 모델입니다.
earthtojake/text-to-cad
CAD, CAE, CAM용 에이전트 스킬 라이브러리로, AI 에이전트가 일반 언어 요청에서 3D 모델, 로봇 설명 파일, 제조 준비된 G-code를 생성할 수 있게 합니다.
enactic/openarm
물리적 AI 연구, 모방 학습 및 안전한 인간-로봇 상호작용을 위해 설계된 오픈 소스 7자유도(7DOF) 휴머노이드 팔 및 표준화된 환경.
v-modal/vmodal_sdk_robotics
로봇 공학용 크래시 복원력 있는 데이터 업링크 SDK로, 네트워크 불안정이나 전원 장애에도 LeRobot 데이터셋 아티팩트를 안정적으로 스풀링하고 업로드합니다.
browserbase/stagehand
Stagehand는 LLM 기반 에이전트가 자연어 명령(`act`, `observe`, `extract`)으로 실제 브라우저를 제어할 수 있도록 해주는 오픈소스 SDK(타입스크립트/파이썬/고)입니다. 페이지 컨텍스트를 토큰 효율적으로 줄이고, 사이트 변경 시 자가 복구하며, 스키마 검증된 데이터를 반환합니다. 에이전트를 위한 설계로, 로컬 또는 Browserbase에서 더 빠르고 캐시된 실행이 가능합니다.
pollen-robotics/microduck
Microduck은 강화 학습 정책을 사용하여 걷고, 구르고, 환경과 상호 작용하는 소형 이족 로봇의 제어 소프트웨어입니다.
makerspet/oomwoo
Raspberry Pi와 ROS2로 구축된 오픈소스 DIY 로봇 청소기로, 2D LiDAR를 사용하여 클라우드 의존 없이 자율적인 로컬 내비게이션을 수행합니다.
neka-nat/freecad-mcp
AI 어시스턴트가 FreeCAD에서 3D 모델링, Python 스크립팅, FEM 분석을 제어할 수 있도록 해주는 Model Context Protocol 서버입니다.
AI-FanGe/Microduck-build-tutorial
MuJoCo 기반의 강화학습 훈련에서부터 Raspberry Pi Zero 2 W에서 ONNX 정책을 사용한 실제 세계 배포까지 완전한 파이프라인을 제공하는 컴팩트한 이족 보행 로봇 프로젝트입니다.
eonsystemspbc/fly-brain
FlyWire 연결망 기반의 성체 곤충 전체 뇌 누설 적분-방출 모델로, 신경 스파이크 전파를 시뮬레이션하고 분석할 수 있음.
PhyAgentOS/PhyAgentOS-core
통합 API 게이트웨이와 증거 기반 검증을 사용하여 물리적 작업이 성공적으로 완료되고 재귀적으로 개선될 수 있도록 보장하는 엔보디드 AI를 위한 에이전트 프레임워크.
anonymous-report-421/GPT-as-Policy
GPT-6 Astra를 엔보디드 로봇 정책으로 사용하는 것을 탐구하는 평가 프레임워크 및 기술 보고서입니다. 직접 제어와 베이스 정책의 동작을 수정하는 하이브리드 접근법을 비교합니다.
OpenWAM-Official/OpenWAM
세계 지식과 행동 학습을 통합하는 월드-액션 모델(WAMs) 개발을 위한 오픈 소스 연구 스택으로, 세계 지식과 행동 학습을 결합한 로봇 정책의 사전 훈련 및 미세 조정을 위한 모듈식 인프라를 제공합니다.
fanhao375/microduck-replica
Microduck 이족 보행 로봇의 서드파티 하드웨어 재구성. 시뮬레이션 모델을 역공학하여 인쇄 가능한 CAD 파일, BOM, 전자 회로도를 생성합니다.
air-embodied-brain/Zetta-Embodiment
기본 정책 재학습 없이 코드 기반 회복 기술과 비평가를 진화시켜 로봇 작업 성공률을 향상시키는 효율적인 폐쇄 루프 하네스
78/xiaozhi-esp32
LLM과 하드웨어 제어를 MCP 프로토콜로 통합한 ESP32 마이크로컨트롤러용 오픈소스 AI 챗봇 프레임워크
huggingface/lerobot
실제 로봇 공학을 위한 PyTorch 기반 라이브러리로, 하드웨어 제어를 위한 표준화된 인터페이스, 확장 가능한 데이터셋 형식, 최첨단 AI 정책을 제공합니다.
kevinzakka/mjbatch
mjbatch는 C++ 스레드 풀을 사용하여 CPU에서 수천 개의 MuJoCo 물리 시뮬레이션을 병렬로 실행하는 Python 라이브러리입니다. 실시간 NumPy 스타일 바인딩을 제공하며, 시뮬레이션 상태와 각 시뮬레이션의 모델 매개변수를 조정할 수 있어 강화학습, MPC, 시스템 식별, 로봇 공설계에 적합합니다. pip로 설치 가능하며, 카트폴 스윙업, Go1 사족 제어, 팔 공설계 등의 예제가 포함되어 있습니다.
VectifyAI/PageIndex
PageIndex는 문서의 레이아웃에서 생성된 계층적 트리 인덱스를 사용해 벡터 스토어 검색을 대체하는 오픈소스 RAG 시스템입니다. LLM이 이 트리를 탐색하여 관련 섹션을 추론하고, 벡터 DB나 청크 없이 설명 가능하고 인용 가능한 답변을 생성합니다. SDK는 로컬(약 $0.001/페이지 인덱싱 비용) 또는 PageIndex Cloud에서 사용 가능하며, FinanceBench에서 98.7% 정확도를 달성하고, 전체 PDF를 모델에 입력하는 경우보다 최대 16배 낮은 쿼리 비용을 제공합니다.
google-deepmind/mujoco
로봇 공학 및 머신러닝 연구에서 널리 사용되는, 관절 구조의 빠르고 정확한 시뮬레이션을 위한 고성능 물리 엔진.
DenisSergeevitch/desktop-fly
FlyWire 및 MaleCNS의 실제 신경 연결체 데이터로 구동되는 3D 데스크톱 애완용 초파리로, 스파이킹 신경망을 통해 생물학적 행동을 시뮬레이션합니다.
Rhoban/microban
로봇 공학 학습과 실험을 위한 저렴한 플랫폼으로, 컴팩트하고 3D 프린팅 가능한 오픈소스 인공지능 로봇입니다.
RLinf/RLinf
RLinf는 대규모 신체적 및 자율형 AI를 위한 오픈소스이며 PyTorch 호환 강화학습 인프라입니다. 다양한 시뮬레이터와 실제 로봇 플랫폼을 통합하고, 다양한 가속기 지원을 제공하며, PPO, GRPO, SAC 및 최신 흐름 변환 방법을 포함한 RL 알고리즘을 사용해 거대한 시각-언어, 확산 및 MoE 모델의 파인튜닝을 위한 즉시 사용 가능한 파이프라인을 제공합니다. FUSCO와 같은 고도의 시스템 최적화와 수십 개의 예제 레시피를 포함하여, 시뮬레이션과 실제 세계 양쪽에서 RL 에이전트의 훈련 및 배포에 통합적이고 확장 가능한 백본이 필요한 연구자 및 엔지니어에게 적합합니다.
showlab/Show-Harness
Show-Harness는 다양한 로봇을 제로샷 또는 효율적인 파인튜닝으로 제어할 수 있는 통합된 의미적 인터페이스를 제공하는 신체에 의존하지 않는 하서스입니다.
pollen-robotics/microduck_rl
고정밀 액추에이터 모델과 도메인 랜덤화를 사용하여 복잡한 보행 패턴과 기술의 시뮬레이션에서 실제 로봇으로의 전이를 가능하게 하는 마이크로덕 이족 보행 로봇용 강화학습 학습 환경.
jnz/INSLIB
자율주행차 및 로봇을 위한 IMU, GNSS 및 기타 센서 데이터를 강건한 칼만 필터로 융합하는 포터블 C 라이브러리입니다.
nftechie/doomfly
생물학적으로 재구성된 과일파리 연결도를 ViZDoom 아레나에 연결하여 도파민 게이트 메모리 규칙을 사용해 생존을 위한 훈련이 가능한지 테스트하는 시뮬레이션.
RoboDojo-Benchmark/RoboDojo
60개의 다양한 태스크를 통해 범용 로봇 조작 정책을 포괄적으로 평가하기 위한 통합 sim-and-real 벤치마크.
datawhalechina/every-embodied
기초적인 로보틱스 시뮬레이션부터 최첨단 VLA 및 월드 모델의 재현까지 구조화된 경로를 제공하는 Embodied AI를 위한 종합 학습 라이브러리입니다.
hanyang9/UMR
학습된 포인트 클라우드 대응 관계를 사용하여 수동식 관절 매핑 없이 인간의 동작을 로봇으로 전달하는 휴머노이드 로봇용 통합 모션 리타겟팅 프레임워크입니다.
ShawnPana/phone-harness
Phone Harness는 LLM 에이전트가 macOS 미러링을 통해 실제 iPhone 또는 ADB를 통해 실제 안드로이드 기기를 제어할 수 있도록 해주는 오픈소스 브리지입니다. 화면을 캡처하고, 보이는 텍스트를 OCR로 인식하며, HID 이벤트를 주입함으로써 에이전트는 앱을 열고, 텍스트를 탭하고, 입력하고, 결과를 읽을 수 있습니다. 스마트폰에 아무것도 설치할 필요가 없습니다.
robocurve/inspect-robots
물리 AI를 위한 오픈소스 평가 프레임워크로, 어떤 로봇이나 시뮬레이터와도 호환되는 로봇 정책을 실행할 수 있으며, 감사 가능한 로그와 실시간 시각화를 제공합니다.
google-deepmind/mujoco_menagerie
MuJoCo 물리 엔진용으로 실감나고 충실한 시뮬레이션을 보장하도록 설계된 고품질 로봇 모델의 큐레이션된 컬렉션입니다.
LiteReality/LiteReality-Agent
로봇 공학 시뮬레이션을 위한 고정밀도 물리 기반 3D 환경으로 현실 세계의 방 스캔을 종단 간 툴킷으로 변환합니다.
RLinf/RPent
RPent는 재귀적 상호작용과 메모리를 사용하여 능력을 진화시키고 장기적인 물리적 조작 작업의 성공률을 높이는 구체화된 에이전트(embodied agents)를 구축하기 위한 오픈 프레임워크입니다.
TheRobotStudio/SO-ARM100
LeRobot 라이브러리와 원활하게 통합되는 저비용 로봇 팔(SO-100 및 SO-101)의 오픈소스 하드웨어 설계로, AI 로보틱스에 대한 접근성을 높입니다.
NVlabs/GR00T-WholeBodyControl
대규모 움직임 데이터에서 학습된 기초 모델 SONIC을 갖춘 인체형 전신 제어 프레임워크로, 다양한 자연스러운 인간과 유사한 움직임을 수행할 수 있습니다.
nvidia-isaac/video_to_data
인간 시연 비디오를 시뮬레이션 준비 자산과 RL 정책 훈련을 위한 물리 기반 로봇 훈련 데이터로 변환하는 엔드투엔드 파이프라인입니다.
Robbyant/lingbot-vla-v2
LingBot-VLA 2.0은 액션 표현을 통합하고 MoE 전문가를 사용하여 크로스 에ม보디먼트 일반화를 수행함으로써 다양한 구성의 로봇이 복잡한 작업을 수행할 수 있도록 하는 비전-언어-액션(VLA) 기반 모델입니다.
QwenLM/Qwen-Drive-1.0
3D 인식, 시각 질의 응답, 모션 플래닝을 통합 프레임워크로 결합한 자율 주행용 비전-언어 기반 모델.
FoloToy/ai-passport
AI 기반 웨어러블 애플리케이션 구축을 위한 안정적인 API와 참조 구현을 제공하는 오픈소스 웨어러블 AI 하드웨어 개발 기준선.
espressif/esp-claw
ESP32 시리즈 IoT 장치를 위한 AI 에이전트 프레임워크로, 사용자가 채팅을 통해 장치 행동을 정의하고 엣지에서 로컬로 의사결정을 실행할 수 있도록 합니다.