kevinhughes27/TensorKart

인간의 게임 플레이 녹화본으로부터 학습하여 마리오 카트 64를 운전하도록 AI 에이전트를 훈련하는 TensorFlow 기반 프로젝트입니다.

spytensor/prepare_detection_dataset

CSV, COCO, Pascal VOC, Labelme 형식 간에 객체 탐지 데이터셋 어노테이션을 변환하기 위한 Python 스크립트 모음입니다.

XieZhiFa/IdCardOCR

인터넷 연결 없이도 중국 신분증, 운전면허증, 여권의 고속 인식이 가능한 안드로이드 오프라인 OCR 라이브러리입니다.

kadirnar/segment-anything-video

Segment Anything Model (SAM)의 패키지화된 버전으로, pip를 통한 간편한 설치와 동영상 세그멘테이션, 클라우드 GPU 통합을 지원합니다.

neka-nat/probreg

확률적 모델을 사용한 점군 등록 라이브러리로, 강체 및 비강체 변환에 대해 ICP의 더 견고한 대안을 제공합니다.

facebookresearch/mobile-vision

FBNet과 ChamNet을 포함한 하드웨어 인식 효율적인 ConvNet 모델과 도구 모음으로, 모바일 장치에서 컴퓨터 비전 성능과 지연 시간을 최적화하기 위해 설계되었습니다.

XiandaGuo/OpenStereo

17개의 데이터셋과 여러 최신 모델을 통합한 깊이 추정을 위한 포괄적인 벤치마크 및 프레임워크.

JoHof/lungmask

심각한 병변을 포함한 CT 스캔에서 폐 자동 세그멘테이션을 가능하게 하는, 훈련된 U-net 모델 패키지로, 폐엽별 마스크도 지원합니다.

TechStark/opencv-js

Node.js와 웹 브라우저에서 OpenCV 컴퓨터 비전 라이브러리를 제공하는 NPM 패키지로, 자바스크립트에서 실시간 얼굴 인식과 같은 작업을 수행할 수 있습니다.

oarriaga/paz

TensorFlow 및 Keras를 사용하여 컴퓨터 비전 파이프라인을 구축하기 위한 모듈형 API를 제공하는 자율 시스템용 계층적 인지 라이브러리.

Deep-MI/FastSurfer

체적 및 표면 기반 두께 분석을 위한 빠르고 딥러닝 기반의 뇌 MRI 이미지 신경영상 처리 파이프라인. FreeSurfer의 고속 대안으로 사용 가능.

yzfzzz/depth-detect

YOLO 객체 탐지와 단안/이안 깊이 추정을 융합하여 객체를 추적하고 운동 상태를 추정하는 고성능 C++ 및 TensorRT 프레임워크입니다.

prov-gigapath/prov-gigapath

거대한 병리 이미지를 분석하기 위한 전체 슬라이드 기초 모델로, 타일 및 슬라이드 인코더 아키텍처를 사용합니다.

david8862/keras-YOLOv3-model-set

다양한 백본, 고급 훈련 기법, 그리고 디바이스 내 배포를 지원하는 TensorFlow Keras 기반의 YOLOv2, v3, v4 객체 탐지 파이프라인입니다.

talmolab/sleap

사람이 참여하는 GUI를 활용해 동물 행동을 빠르게 라벨링하고 정량화할 수 있는 다중 동물 자세 추적을 위한 딥러닝 프레임워크.

francescofugazzi/3dgsconverter

GPU 가속 필터링과 압축을 갖춘 고성능 도구로, 여러 형식 간에 3D 가우시안 스플래터링 파일을 변환합니다.

matiasdelellis/facerecognition

로컬에서 이미지 내 얼굴을 감지하고 분석, 그룹화하여 개인정보 보호를 보장하는 Nextcloud용 얼굴 인식 앱입니다.

FaceAISDK/FaceRecognition_ReactNative

iOS 및 Android에서 1:1 인증과 라이브니스 검출을 지원하는 오프라인 얼굴 인식 SDK의 React Native 데모 및 통합 가이드입니다.

kanadeblisst00/wechat_ocr

WeChat Windows 클라이언트에 내장된 로컬 OCR 모델을 호출하여 이미지에서 텍스트 인식을 수행할 수 있는 Python 라이브러리입니다.

kyegomez/VisionMamba

Vision Mamba는 전통적인 Vision Transformer보다 훨씬 빠르고 메모리 효율적인 이중 방향 상태 공간 모델로, 효율적인 시각 표현 학습을 위한 구현입니다.

facebookresearch/pixio

Pixio는 강화된 픽셀 재구성 사전 훈련을 통해 깊이 추정 및 세분적 세그멘테이션과 같은 밀집 예측 작업에 최적화된 비전 인코더입니다.

microblink/blinkid-android

머신러닝과 네이티브 C++ 라이브러리를 사용한 안전한 신분증 문서 스캔 및 데이터 추출을 위한 Android SDK입니다.

jiafeng5513/Evision

ELAS 및 ADCensus와 같은 알고리즘을 사용하여 카메라 캘리브레이션, 디스패리티 매핑, 3D 재구성에 대응하는 이중 시각 시스템.

infinitered/react-native-mlkit

Google의 MLKit 네이티브 라이브러리를 래핑하는 Expo 모듈 세트로, Expo 앱에서 얼굴 및 객체 검출과 같은 디바이스 내 기계학습 기능을 가능하게 합니다.

hujiecpp/PE3R

PE3R은 제로샷 일반화를 활용하여 2D 이미지를 의미적으로 이해 가능한 3D 장면으로 변환하는 지각 효율적인 3D 재구성 시스템입니다.

dluvizon/deephar

실시간 2D 및 3D 인간 자세 추정과 행동 인식을 위한 다중 작업 딥러닝 프레임워크.

aparsoft/yolo-streamlit-detection-tracking

YOLO26 및 YOLO World v2를 사용한 실시간 객체 탐지, 세그멘테이션, 포즈 추정 및 추적을 지원하는 Streamlit 기반 비전 스튜디오입니다.

prov-gigatime/GigaTIME

일반적인 H&E 병리 슬라이드에서 종양 미세환경 모델링을 위한 가상 공간 단백질체(mIF) 프로파일을 생성하는 다모달 AI 프로젝트입니다.

AI4EPS/PhaseNet

원시 지진 데이터에서 P파와 S파의 도착 시각을 자동으로 추출하는 딥 뉴럴 네트워크 기반 방법.

ml-struct-bio/cryodrgn

생물학적 3차원 구조의 연속적인 분포를 모델링하는 뉴럴 네트워크 기반 알고리즘. 이질적인 저온EM 및 저온ET 재구성에 적합합니다.

lartpang/PyIRSTDMetrics

피크셀 수준, 타겟 수준, 하이브리드 지표를 사용하여 적외선 소형 타겟 탐지 모델의 성능을 분석하는 가벼운 파이썬 라이브러리입니다.

lingxitong/MIL_BASELINE

계산 기반 병리학에서 다중 인스턴스 학습(MIL)을 위한 통합 라이브러리로, 전체 슬라이드 이미지 분석을 위한 다양한 MIL 아키텍처를 구현하고 비교할 수 있는 표준화된 프레임워크를 제공합니다.

FaceAISDK/FaceAISDK_iOS

네트워크 접속 없이도 안전한 신원 확인을 가능하게 하는 얼굴 감지, 인식 및 라이브니스 감지 기능을 제공하는 iOS용 온디바이스 완전 오프라인 SDK.

quickpose/quickpose-ios-sdk

실시간 자세 추정 및 스켈레톤 추적을 위한 iOS SDK로, 운동 카운팅과 가동 범위 분석을 위한 사전 구축 도구 제공.

PozzettiAndrea/ComfyUI-SAM3DBody

Meta의 SAM 3D Body용 ComfyUI 래퍼로, 단일 이미지에서 전체 신체 3D 인간 메시를 복원할 수 있습니다.

paninski-lab/lightning-pose

단일 및 다중 시점 영상에서 특히 가림 상황에서도 강건하게 움직임을 추적할 수 있는 에ンド투엔드 동물 자세 추정 패키지로, 트랜스포머 아키텍처를 활용합니다.

rendeirolab/LazySlide

scverse 생태계와 통합된 Python 프레임워크로, 상호 운용성과 확장성을 갖춘 조직학적 워크플로우를 가능하게 합니다.

radekd91/inferno

실외 환경에서의 3D 얼굴 재구성 및 애니메이션을 위한 딥러닝 라이브러리로, 음성 기반 아바타 및 감정 인식 도구를 제공합니다.

NKI-AI/direct

딥러닝을 활용한 MRI 재구성의 샘플링, 재구성, 검증을 위한 엔드투엔드 파이프라인을 제공하는 PyTorch 툴킷입니다.

BuntingLabs/mundi.ai

Mundi는 LLM을 사용하여 벡터, 래스터, 포인트 클라우드 데이터의 지오프로세싱 알고리즘과 심볼화 편집을 자동화하는 오픈소스 웹 GIS입니다.

mapillary/seamseg

이미지 내 모든 픽셀에 대해 클래스 및 인스턴스별 레이블을 예측하는 CNN 기반 아키텍처입니다.

RongLiu-Leo/beta-splatting

가우시안 커널을 가변적인 베타 커널로 대체하여 기하학적 세부 정보, 색상 표현, 메모리 효율성을 향상시키는 실시간 레디언스 필드 렌더링 프로젝트입니다.

RizwanMunawar/yolov7-object-tracking

다양한 소스의 비디오 스트림에서 실시간 객체 탐지 및 추적을 위해 YOLOv7과 YOLOv8을 통합한 컴퓨터 비전 프로젝트입니다.

realsee-developer/RealSee3D

3D 재구성 및 시맨틱 세그멘테이션 AI 모델 학습을 위해 설계된 10,000개의 실내 장면을 포함하는 대규모 멀티뷰 RGB-D 데이터셋.

Tobias-Fischer/rt_gene

PyTorch와 ROS 2를 사용한 실시간 눈의 시선 및 깜빡임 추정 시스템. 자연 환경에서 시선 방향과 깜빡임 확률을 추적.

TIGER-AI-Lab/Pixel-Reasoner

Pixel Reasoner는 시각-언어 모델에 시각 조작(줌인, 프레임 선택 등)을 추가하는 연구 프레임워크로, 지시어 튜닝과 호기심 기반 강화학습을 통해 훈련됩니다. 리포지토리는 설치 가이드, SFT 및 RL 스크립트, 사전 훈련된 7B 체크포인트, 데이터셋, 이미지 및 동영상 벤치마크용 평가 파이프라인을 제공합니다.

jabberjabberjabber/ImageIndexer

이미지의 캡션과 키워드를 자동으로 생성하여 이미지 메타데이터에 직접 기록함으로써 쉬운 인덱싱과 검색을 가능하게 하는 로컬 AI 도구입니다.

yuanze-lin/Olympus

단일 자연어 지시를 이미지, 동영상, 3D 모델 생성을 위한 전문 모델 호출 시퀀스로 변환하는 컴퓨터 비전용 유니버설 태스크 라우터입니다.