RizwanMunawar/yolov7-object-tracking
다양한 소스의 비디오 스트림에서 실시간 객체 탐지 및 추적을 위해 YOLOv7과 YOLOv8을 통합한 컴퓨터 비전 프로젝트입니다.
bentoml/BentoDiffusion
BentoML 프레임워크를 사용하여 다양한 Stable Diffusion 계열 모델을 셀프 호스팅하고 배포하기 위한 예제 프로젝트 모음입니다.
xArm-Developer/xarm_ros
xArm 시리즈 로봇 팔을 위한 ROS 기반 개발 및 시뮬레이션 프레임워크로, 하드웨어 인터페이스, MoveIt 모션 플래닝 및 Gazebo 시뮬레이션을 제공합니다.
lucidrains/q-transformer
Q‑Transformer는 비디오 관측과 언어 지시를 결합한 로봇 작업을 위한 확장 가능한 오프라인 강화학습을 위한 PyTorch 라이브러리입니다. 비전 트랜스포머 모델, 데이터 수집 에이전트, 리플레이 메모리 데이터셋, Q-학습 트레이너를 포함하며, `pip install q-transformer`로 설치할 수 있습니다.
LongxingTan/Time-series-prediction
TFTS는 시계열 예측, 분류, 이상 탐지를 위한 최첨단 딥러닝 모델을 통합 인터페이스로 구현할 수 있는 TensorFlow 기반 라이브러리입니다.
BobMcDear/attorch
커스텀 딥러닝 연산을 개발하기 위해 읽기 쉽고 수정이 용이한 신경망 레이어 컬렉션을 제공하는 PyTorch nn 모듈의 Triton 기반 서브셋입니다.
relari-ai/continuous-eval
continuous-eval은 LLM 기반 파이프라인의 모듈화되고 데이터 기반 평가를 위한 Python 라이브러리입니다. 검색, 생성, 코드, 에이전트 메트릭 카탈로그를 제공하며, 개별 파이프라인 모듈에 메트릭을 연결하고 데이터셋에서 실행할 수 있으며, 리그레션 테스트를 강제할 수 있습니다. 커스텀 LLM-as-a-judge 메트릭도 지원합니다.
hgneng/ekho
Ekho는 작성된 텍스트를 음성으로 변환하는 중국어 텍스트 음성 변환 엔진으로, 사용자 정의 음성 데이터 통합을 지원합니다.
jasonppy/VoiceCraft
몇 초의 참조 음성만으로 고품질의 제로샷 텍스트-to-음성 및 음성 편집을 가능하게 하는 토큰 보완 신경 코덱 언어 모델입니다.
realsee-developer/RealSee3D
3D 재구성 및 시맨틱 세그멘테이션 AI 모델 학습을 위해 설계된 10,000개의 실내 장면을 포함하는 대규모 멀티뷰 RGB-D 데이터셋.
Open-X-Humanoid/HEX
이종 로봇 간 기술 전이와 장기 조작을 가능하게 하는 인체형 로봇을 위한 전신 시각-언어-행동 프레임워크.
stack-of-tasks/tsid
휴머노이드 및 사족 보행 로봇과 같은 강체 다체 로봇의 최적화 기반 역동학 제어를 위한 C++ 라이브러리입니다.
ihmcrobotics/ihmc-open-robotics-software
휴머노이드 로봇의 제어 및 시뮬레이션을 위한 포괄적인 소프트웨어 스택으로, 역학, 인지 및 실시간 통신을 위한 도구를 제공합니다.
graspnet/graspnetAPI
GraspNet-1Billion 데이터셋을 위한 Python API로, 로봇 파지(grasping) 연구를 위한 파지 레이블과 포인트 클라우드 데이터를 로드, 처리 및 검증하는 도구를 제공합니다.
google-research/language-table
로봇이 방대한 양의 자연어 지시를 실행할 수 있도록 하는 오픈 보캐블러리 시각-언어-운동 학습을 위한 인간 수집 데이터셋 세트 및 벤치마크입니다.
ClemensElflein/xESC
로봇 공학을 위해 특별히 설계되었으며, FOC 및 다양한 제어 모드를 지원하는 브러시리스 DC 모터용 오픈 소스 저비용 전자 속도 컨트롤러(ESC)입니다.
Tobias-Fischer/rt_gene
PyTorch와 ROS 2를 사용한 실시간 눈의 시선 및 깜빡임 추정 시스템. 자연 환경에서 시선 방향과 깜빡임 확률을 추적.
PX4/PX4-SITL_gazebo-classic
PX4 오토파일럿을 위한 SITL 및 HITL 시뮬레이션을 제공하는 Gazebo 플러그인을 사용한 로버, 보트, 항공기용 비행 시뮬레이터.
napframework/nap
하드웨어, 센서 및 미디어와 상호작용하는 반응형 애플리케이션을 제작하기 위한 저부하, 실시간 제어 및 시각화 플랫폼입니다.
RoboStack/ros-noetic
Conda 패키지 매니저를 사용하여 Linux, macOS, Windows에서 설치 및 종속성 관리가 간편한 ROS Noetic의 크로스플랫폼 배포판입니다.
Le0nX/ModernRoboticsCpp
『Modern Robotics: Mechanics, Planning, and Control』 교과서와 함께 사용되는 C++ 라이브러리로, 로보틱스 기계학, 계획, 제어 알고리즘의 교육용 구현을 제공합니다.
Simple-Robotics/proxsuite
로봇공학 및 최적화 작업에 적합한 고성능을 실현하는, 수치적으로 안정적이고 효율적인 선형 및 이차 계획 문제용 수치 해법기 모음.
openrr/urdf-viz
URDF 및 Xacro 로봇 기술 파일을 시각화하고 JSON API를 통해 대화형 관절 조작 및 원격 제어를 가능하게 하는 Rust 기반 시각화 도구입니다.
robotology/yarp
YARP는 로봇용 통신 라이브러리 및 툴킷으로, 소프트웨어 구성 요소 간의 표준화된 장치 인터페이스와 메시징을 제공합니다.
makeecat/Peng
Rust로 작성된 최소한의 멀티로터 자율 주행 프레임워크로, 실시간 동역학 시뮬레이션, 경로 계획 및 제어를 제공합니다.
Stable-Baselines-Team/stable-baselines3-contrib
연구자와 개발자를 위한 실험적 강화학습 알고리즘과 특수 도구를 제공하는 Stable-Baselines3 기여 패키지입니다.
gkjohnson/urdf-loaders
Unity와 THREE.js용 URDF 로딩 라이브러리 모음으로, 개발자가 3D 환경에서 로봇 모델을 가져오고 시각화할 수 있도록 합니다.
UniversalRobots/Universal_Robots_ROS2_Driver
Universal Robots 매니퓰레이터용 ROS2 드라이버로, 하드웨어 통신, MoveIt2를 통한 모션 플래닝, 그리고 ROS2 동작을 산업용 협동 로봇에 통합할 수 있게 합니다.
RobotWebTools/roslibjs
웹 애플리케이션이 ROS (Robot Operating System) 시스템과 통신하여 로봇 인터페이스를 구축할 수 있도록 지원하는 JavaScript 클라이언트 라이브러리 모음입니다.
UniversalRobots/Universal_Robots_ROS_Driver
Universal Robots CB3 및 e-Series 매니퓰레이터용 ROS 드라이버로, 실시간 제어, 교정 및 ROS-control과의 통합을 위한 안정적인 인터페이스를 제공합니다.
hungpham2511/toppra
로봇이 운동학적 및 동적 제약 조건을 준수하면서 기하학적 경로를 따라 가능한 한 빨리 이동할 수 있도록 시간 최적 경로 매개변수화를 계산하는 라이브러리입니다.
Phylliade/ikpy
URDF 및 MuJoCo MJCF 임포트를 지원하고, 가속화된 JAX 백엔드를 갖춘 순수한 Python 기반 로봇 역운동학 계산 라이브러리입니다.
neka-nat/cupoch
로봇 공학에서 빠른 3D 데이터 처리를 위한 GPU 가속 라이브러리로, 고성능 점군 알고리즘, 충돌 회피, 경로 계획을 제공합니다.
RoboVerseOrg/RoboVerse
여러 시뮬레이션 프레임워크와 데이터셋을 단일 인터페이스로 통합하는 확장 가능한 로봇 학습용 통합 플랫폼 및 벤치마크.
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasoner는 시각-언어 모델에 시각 조작(줌인, 프레임 선택 등)을 추가하는 연구 프레임워크로, 지시어 튜닝과 호기심 기반 강화학습을 통해 훈련됩니다. 리포지토리는 설치 가이드, SFT 및 RL 스크립트, 사전 훈련된 7B 체크포인트, 데이터셋, 이미지 및 동영상 벤치마크용 평가 파이프라인을 제공합니다.
jabberjabberjabber/ImageIndexer
이미지의 캡션과 키워드를 자동으로 생성하여 이미지 메타데이터에 직접 기록함으로써 쉬운 인덱싱과 검색을 가능하게 하는 로컬 AI 도구입니다.
yuanze-lin/Olympus
단일 자연어 지시를 이미지, 동영상, 3D 모델 생성을 위한 전문 모델 호출 시퀀스로 변환하는 컴퓨터 비전용 유니버설 태스크 라우터입니다.
facebookresearch/mmf
MMF는 시각 및 언어 멀티모달 연구를 위한 모듈형 PyTorch 기반 프레임워크로, 최첨단 모델의 참조 구현과 분산 학습을 위한 도구를 제공합니다.
om-ai-lab/VLM-FO1
VLM-FO1은 일반적인 추론 능력을 저하시키지 않으면서 세밀한 인지 및 공간 인식을 강화하는 Vision-Language Model용 플러그 앤 플레이 모듈입니다.
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling은 커뮤니티가 큐레이팅한 "아워소 리스트"로, 다중 모달 AI 모델을 조사합니다. Traditional, MLLMs, Unified, Native의 네 가지 명확한 패밀리를 정의하고, 아키텍처적 차이를 설명하며, Hugging Face의 오픈소스 모델 컬렉션에 링크합니다. 급속도로 변화하는 다중 모달 환경을 구조적으로 이해해야 하는 연구자와 엔지니어를 위한 리포지토리입니다.
OpenBMB/UltraEval-Audio
34개의 벤치마크에 걸쳐 음성 이해와 생성을 모두 지원하는 대규모 오디오 파운데이션 모델 평가를 위한 통합 오픈소스 프레임워크.
Sharrnah/whispering-ui
오디오 스트림 및 게임 내 이미지의 실시간 전사 및 번역을 가능하게 하는 Whispering Tiger 애플리케이션용 네이티브 Windows UI입니다.
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar은 Kaldi 음성 인식 엔진을 위한 Python 래퍼로, 여러 작은 문법을 컴파일하고 각 발화마다 필요한 것만 활성화할 수 있습니다. 주요 OS용 바이너리 웨일을 포함하고, 사전 학습된 영어 모델을 제공하며, Dragonfly 및 Caster 음성 제어 프레임워크의 백엔드를 지원합니다. pip로 설치하고, 모델을 다운로드하며, 규칙을 정의한 후 문맥에 맞는 명령 제어를 동적으로 활성화할 수 있습니다.
cubist38/mlx-openai-server
Apple Silicon에서 로컬 MLX 모델을 실행하기 위한 OpenAI 호환 API 서버로, 텍스트, 멀티모달, 이미지 및 오디오 모델을 지원합니다.
filippogiruzzi/voice_activity_detection
1D-ResNet과 MFCC 특징을 사용하여 오디오 신호를 음성 또는 노이즈로 분류하는 딥러닝 기반 음성 활동 감지(VAD) 시스템입니다.
dictation-toolbox/dragonfly
사용자가 사용자 정의 음성 명령을 만들어 컴퓨터 작업을 자동화하거나 음성으로 프로그래밍할 수 있도록 도와주는 Python 음성 인식 프레임워크입니다.
algolia/voice-overlay-ios
Apple의 네이티브 `SFSpeechRecognizer`를 사용하여 권한 및 음성 인식을 처리하는 세련된 음성-텍스트 변환 오버레이 UI를 제공하는 iOS 라이브러리입니다.
judahpaul16/gpt-home
Raspberry Pi에서 작동하는 자체 호스팅 AI 홈 어시스턴트로, LiteLLM와 LangGraph를 사용해 LLM을 홈 오토메이션 및 개인 생산성 도구와 통합합니다.