10x-Engineers/Infinite-ISP

RAW 센서 이미지를 RGB로 변환하기 위한 Python 기반 알고리즘 설계에서부터 RTL 및 FPGA 구현까지를 아우르는 풀스택 ISP 개발 플랫폼입니다.

scier/MetalSplatter

iOS, macOS, visionOS에서 실시간 3D 장면 시각화를 가능하게 하는 Swift/Metal 기반 라이브러리입니다.

google-ar/arcore-android-sdk

ARCore SDK for Android는 모션 트래킹, 환경 이해 및 조명 추정을 위한 API를 제공하여 증강현실 경험을 구축할 수 있도록 합니다.

Smorodov/Multitarget-tracker

SOTA 딥러닝 검출기를, 매칭 알고리즘 및 Kalman filters와 결합하여 비디오 내의 여러 객체를 추적하는 포괄적인 멀티 타겟 트래킹 프레임워크입니다.

VisionDepth/VisionDepth3D

VisionDepth 3D는 AI 깊이 모델, 깊이 맵 블렌딩, RIFE 프레임 보간 및 AI 초해상도를 사용하여 2D 이미지 또는 비디오를 입체 3D로 변환하는 Windows 데스크톱 앱입니다. 무료 티어(길이 제한, 1080p, 워터마크)와 일회성 $59.99 Pro 티어(제한 없음, 4K+, 일괄 처리, 고급 컨트롤)를 제공합니다. 설치는 CUDA(NVIDIA) 또는 DirectML(AMD/Intel) 빌드를 제공하는 Itch.io의 “Setup Hub”를 통해 이루어집니다. 이 소프트웨어는 독점적이지만 다운로드하는 AI 모델은 자체 라이선스에 따라 오픈 소스로 제공됩니다.

rdk/p2rank

단백질 구조에서 리간드 결합 부위를 빠르고 정확하게 예측할 수 있는 머신러닝 기반의 명령줄 도구입니다.

illuin-tech/colpali

ColPali는 시각 문서 검색을 위한 연구용 라이브러리입니다. PaliGemma, Qwen‑VL 등 비전-언어 모델(VLM)을 사용해 문서 이미지를 다중 벡터 임베딩으로 인코딩하고, ColBERT 스타일의 라이트 인터랙션 방식으로 쿼리 임베딩과 스코어링합니다. 원래의 `colpali-engine` 패키지(현재 비추천)는 모델 클래스, 프로세서, 선택적 병합 커널, 빠른 Plaid 인덱싱, 토큰 풀링, 해석성 도구를 제공했습니다. 새로운 프로젝트는 Sentence‑Transformers v6의 `MultiVectorEncoder`를 사용해야 합니다.

zju3dv/MatchAnything

MatchAnything은 RGB, 적외선, 스케치 등 어떤 시각 모달리티의 이미지 간에도 대응 관계를 찾을 수 있는 단일 신경망을 훈련하는 연구 프로젝트입니다. 사전 훈련된 가중치는 Hugging Face에 호스팅되어 있으며, 온라인 데모를 통해 즉시 크로스모달 매칭을 시도할 수 있습니다. 이 접근법은 로봇공학, 원격 탐사, 의료 영상, AR 등 다양한 분야에서 전용 매칭 파이프라인을 하나의 유니버설 모델로 대체할 수 있도록 도와줍니다.

weecology/DeepForest

딥러닝 객체 탐지를 사용하여 공중 RGB 영상에서 나무 우산과 새와 같은 생태적 대상을 학습하고 예측하는 Python 패키지.

nianticlabs/map-free-reloc

A reference implementation for map-free visual relocalization that enables metric pose estimation relative to a single image, removing the need for large 3D maps.

alephpi/Texo

수학 공식 이미지를 LaTeX 코드로 변환하는 파라미터 20M 규모의 미니멀한 오픈 소스 LaTeX OCR 모델입니다.

sgoldenlab/simba

SimBA는 프로그래밍 기술이 필요 없는 GUI 기반 툴킷으로, 포즈 추정 영상 데이터에서 동물 행동을 자동으로 탐지하고 정량화할 수 있는 지도 학습 분류기를 연구자가 훈련할 수 있게 해줍니다. 원시 추적 데이터를 검증된 행동 분류와 풍부한 후속 분석으로 전환하여 행동 신경과학 연구를 지원합니다.

xg-chu/GAGAvatar

GAGAvatar은 3D 가우시안 스플래터링을 사용하여 단일 이미지에서 3D 헤드 아바타를 재구성하고 실시간 재현을 가능하게 하는 프레임워크입니다.

mgonzs13/yolo_ros

로봇을 위한 객체 탐지, 추적, 인스턴스 세그멘테이션 및 3D 객체 위치 추정을 가능하게 하는 Ultralytics YOLO 모델용 ROS 2 래퍼입니다.

microsoft/farmvibes-ai

농업 및 지속 가능성 분야를 위한 다중 모달 지리공간 기계학습 프레임워크로, 위성 이미지, 기상 데이터, 고도 지도를 융합하여 견고한 농업 인사이트를 생성합니다.

TechyNilesh/DeepImageSearch

다중 모달 임베딩과 벡터 인덱싱을 사용하여 텍스트, 이미지, 하이브리드 검색을 지원하는 AI 기반 이미지 검색 시스템을 구축하기 위한 Python 라이브러리입니다.

jianboqi/CSF

공중 포인트 클라우드에서 지표면 점과 비지표면 점을 분리하기 위한 천 시뮬레이션 기반 LiDAR 필터링 방법.

sentinel-hub/eo-learn

지구 관측 데이터와 기계학습 생태계를 연결하는 파이썬 라이브러리로, 시공간 위성 영상에서 정보를 추출하는 과정을 간소화합니다.

zibo-chen/ocr-rs

PaddleOCR 모델과 MNN 추론 런타임 기반의 경량 Rust OCR 라이브러리로, 50개 이상의 언어에서 텍스트 검출 및 인식을 제공합니다.

apple-aiml-research/ml-cvnets

분류, 탐지, 세로매틱 세그멘테이션과 같은 작업을 위해 표준 및 신규 모바일 및 비모바일 모델을 훈련하고 평가하는 컴퓨터 비전 툴킷입니다.

vietanhdev/samexporter

휴대 가능하고 효율적인 배포를 위해 ONNX Runtime에서 SAM, SAM 2, SAM 3, MobileSAM 및 EfficientSAM 모델을 내보내고 실행하는 도구입니다.

NativeSensors/EyeGestures

고가의 전용 하드웨어 대신 표준 웹캠과 스마트폰 카메라를 사용하여 눈 제어 인터페이스를 구현할 수 있는 오픈소스 눈 추적 라이브러리.

Jianghanxiao/PhysTwin

PhysTwin은 RGB-D 비디오로부터 변형 가능한 객체의 물리 정보 기반 디지털 트윈을 재구성하고, 대화형 시뮬레이션, 분석 도구, 로봇 계획 및 배치 시뮬레이션을 위한 예제 파이프라인을 제공하는 연구 코드베이스입니다.

drivelineresearch/openbiomechanics

야구 투구 및 타격 분석을 위한 정제된 모션 캡처 파일, 시계열 생체역학, 신체 평가 메트릭을 제공하는 공개 연구 데이터셋입니다.

ANTsX/ANTsPy

ANTs C++ 프레임워크용 파이썬 래퍼로, 생물의학 영상 등록, 세그멘테이션 및 처리에 고성능 도구를 제공합니다.

facebookresearch/pytorch3d

3D 컴퓨터 비전 연구를 위한 PyTorch 기반 라이브러리로, 미분 가능한 렌더링과 3D 메쉬 및 포인트 클라우드 조작을 위한 효율적인 도구를 제공합니다.

Yuliang-Liu/MultimodalOCR

다양한 언어와 실제 세계 시나리오에서 대규모 다중모달 모델의 OCR 및 문서 파싱 능력을 평가하기 위해 설계된 벤치마크(MDPBench, OCRBench v2, OCRBench)의 모음입니다.

yehonathanlitman/Lift4D

Lift4D는 각 프레임의 3D 추정을 변형 가능한 모델에 융합하여 단일 시점의 '실제 환경' 영상에서 시간적으로 일관된 4D 자산을 재구성합니다.

NVIDIA-RTX/RTXNS

기계학습을 그래픽스 애플리케이션에 통합할 수 있도록 해주는 개발자 프레임워크로, 신경망을 쉐이더와 텍스처로 표현할 수 있게 합니다.

ultralytics/yolo-flutter-app

iOS 및 Android에서 실시간 YOLO 모델 추론(객체 탐지, 세그멘테이션, 자세 추정)을 가능하게 하는 공식 Ultralytics 플러그인입니다.

agentmorris/MegaDetector

카메라 트랩 이미지 내의 동물, 사람, 차량을 식별하는 AI 모델로, 보존 생물학자가 빈 이미지를 효율적으로 제거할 수 있도록 도와줍니다.

alexandremendoncaalvaro/CorridorKey-Runtime

DaVinci Resolve와 Foundry Nuke용 네이티브 AI 키잉 런타임 및 OFX 플러그인으로, 비디오 편집자를 위해 자동화된 머신러닝 가속 배경 제거 기능을 제공합니다.

torchgeo/terratorch

PyTorch 기반 도메인 라이브러리로, 이미지 분할 및 분류와 같은 작업을 위해 사전 학습된 지리공간 기반 모델을 미세 조정하고 사용할 수 있습니다.

kornia/kornia-rs

실시간 ML 파이프라인을 위해 CPU 및 NVIDIA GPU에서 빠르고 zero-copy 이미지 처리를 제공하는 Rust 기반의 저수준 컴퓨터 비전 라이브러리.

raphaelvallat/yasa

다도체수면도 및 EEG 데이터에서 자동 수면 단계 분류 및 이벤트 탐지를 위한 Python 기반 수면 분석 도구상자입니다.

MrGiovanni/UNetPlusPlus

원래 U-Net을 개선하기 위해 스킵 연결을 재설계하고 네트워크 깊이를 유연하게 조정할 수 있는 의료 영상 세그멘테이션을 위한 중첩 U-Net 아키텍처입니다.

allenai/olmoearth_pretrain

지구 관측을 위한 멀티모달 시공간 기초 모델 제품군, 위성 데이터를 사용하여 데모스피어 플래닛 인텔리전스를 위한 확장 가능한 프레임워크를 제공합니다.

Linfeng-Tang/Image-Fusion

다중 모달, 디지털 사진, 원격 탐사 이미지 조합 기술을 포함하는, 이미지 융합에 대한 연구 논문과 코드 구현의 포괄적 컬렉션.

dipy/dipy

DIPY는 MR 확산 영상 분석을 위한 Python 라이브러리로, 연구자들이 의료 영상 데이터를 처리할 수 있도록 도구를 제공합니다.

ultralytics/yolo-ios-app

Core ML과 Apple Neural Engine를 사용하여 iOS 기기에서 실시간, 온디바이스 YOLO 추론을 가능하게 하는 네이티브 iOS 앱과 Swift SDK. 객체 탐지, 세그멘테이션, 포즈 추정을 지원합니다.

next-state/open-dreamer

Open Dreamer는 JAX/Flax 기반의 Dreamer 4 세계 모델 파이프라인 구현으로, Minecraft 플레이 데이터에서 동영상 토크나이저와 행동 조건부 잠재 역학 모델의 학습 코드를 제공하며, 로울아웃 생성 및 FVD 평가 도구도 포함합니다. 라이브 브라우저 데모와 학습된 체크포인트를 실행할 수 있는 별도의 추론 리포지토리도 제공합니다.

noahcao/OC_SORT

순수 모션 모델 기반의 다중 객체 트래커로, SORT 알고리즘을 재고하여 혼잡한 장면과 비선형 움직임에서 견고성을 향상시킵니다.

zju3dv/manhattan_sdf

Manhattan‑SDF는 CVPR‑2022 연구 코드로, 실내 3‑D 재구성용 신경 부호 거리 함수(SDF)를 학습하며, 기하학적 품질을 향상시키기 위해 맨하탄 월드(축에 정렬된) 정규화를 추가합니다. conda 기반 설치, ScanNet(또는 사용자 정의 데이터)에서의 학습 스크립트, 메시 추출, 다양한 베이스라인과의 평가를 제공합니다.

StanfordVL/taskonomy

컴퓨터 비전에서 작업 전이 학습을 분리하는 데 사용할 수 있는 프레임워크와 데이터셋. 사전 학습된 작업 은행과 작업 유사성 분석을 위한 도구를 제공.

qaz812345/TrackNetV3

배경 추정과 인페인팅 기반 보정 모듈을 사용하여 가림을 처리하는 배드민턴 영상 내 샷 추적을 강화하는 컴퓨터 비전 프로젝트.

EthanH3514/AL_Yolo

게임 시나리오에서 저지연 화면 캡처와 GPU 추론에 최적화된 YOLOv5 기반 실시간 시각적 타겟 탐지 및 추적 시스템입니다.

Faceplugin-ltd/FaceRecognition-Android

Android용 온디바이스 얼굴 인식 및 라이브니스 검출 SDK로, 개인 정보 보호를 우선시하는 오프라인 생체인식 신원 확인 및 속성 분석을 가능하게 합니다.

stereolabs/zed-unity

ZED 카메라의 깊이 감지, 공간 매핑 및 객체 감지 기능을 Unity 엔진에 통합하여 AR/MR 개발을 지원하는 Unity 플러그인입니다.