StanfordVL/taskonomy
컴퓨터 비전에서 작업 전이 학습을 분리하는 데 사용할 수 있는 프레임워크와 데이터셋. 사전 학습된 작업 은행과 작업 유사성 분석을 위한 도구를 제공.
qaz812345/TrackNetV3
배경 추정과 인페인팅 기반 보정 모듈을 사용하여 가림을 처리하는 배드민턴 영상 내 샷 추적을 강화하는 컴퓨터 비전 프로젝트.
EthanH3514/AL_Yolo
게임 시나리오에서 저지연 화면 캡처와 GPU 추론에 최적화된 YOLOv5 기반 실시간 시각적 타겟 탐지 및 추적 시스템입니다.
Breakthrough/DVR-Scan
동영상 파일 내의 움직임 이벤트를 자동으로 감지하고 각 이벤트를 별도의 클립으로 저장하는 명령줄 및 GUI 애플리케이션입니다.
soruly/trace.moe-telegram-bot
trace.moe 서비스를 사용하여 스크린샷이나 비디오에서 애니메이션 제목, 에피소드, 타임스탬프를 식별하는 Telegram 봇입니다.
pupil-labs/pupil
눈동자 추적 데이터의 캡처, 재생, 분석을 위한 소프트웨어 인프라를 제공하는 오픈소스 눈동자 추적 플랫폼입니다.
ermig1979/Simd
x86, ARM, Hexagon 아키텍처에서 알고리즘을 가속화하기 위해 SIMD CPU 확장 기능을 사용하는 고성능 C/C++ 이미지 처리 및 머신러닝 라이브러리입니다.
iago-suarez/ELSED
ELSED는 드론과 스마트폰과 같은 자원 제약이 있는 장치를 위한 고속 선분 검출기입니다.
Faceplugin-ltd/FaceRecognition-Android
Android용 온디바이스 얼굴 인식 및 라이브니스 검출 SDK로, 개인 정보 보호를 우선시하는 오프라인 생체인식 신원 확인 및 속성 분석을 가능하게 합니다.
stereolabs/zed-unity
ZED 카메라의 깊이 감지, 공간 매핑 및 객체 감지 기능을 Unity 엔진에 통합하여 AR/MR 개발을 지원하는 Unity 플러그인입니다.
deepfates/memery
OpenAI의 CLIP를 사용하여 텍스트 또는 이미지 쿼리로 로컬 폴더에서 특정 이미지를 찾을 수 있는 자연어 이미지 검색 도구입니다.
nachifur/MulimgViewer
대규모 이미지 데이터셋의 효율적인 비교, 필터링 및 스티칭을 위해 설계되었으며, 병렬 줌 및 자동 피규어 생성 기능을 특징으로 하는 멀티 이미지 뷰어입니다.
VicenteVivan/geo-clip
GeoCLIP은 이미지를 지리적 위치와 연결하여 고정확도의 세계적 이미지 지오로컬라이제이션과 GPS 벡터 임베딩을 가능하게 하는 CLIP 영감 모델입니다.
lartpang/PySODEvalToolkit
그레이스케일 및 이진 이미지 세그멘테이션 모델을 평가하기 위한 Python 툴박스로, 포괄적인 지표와 자동화된 곡선 플로팅을 제공합니다.
OSU-NLP-Group/UGround
UGround는 텍스트 설명을 기반으로 스크린샷에서 UI 요소를 탐지하는 오픈소스 시각-언어 모델(2B/7B/72B)입니다. 리포지토리에는 사전 학습된 가중치, 100만 장 이상의 GUI 기준화 데이터셋, 4개 벤치마크용 평가 스크립트, Hugging Face 데모가 포함되어 있습니다. 추론은 vLLM을 통해 간단한 프롬프트로 (x, y) 좌표를 반환하며, 72B 모델은 ScreenSpot 벤치마크에서 최고 성능을 기록했으며 ICLR 2025 구두 발표 논문으로 채택되었습니다.
juliansteenbakker/mobile_scanner
Android, iOS, macOS, 웹을 지원하는 빠르고 가벼운 Flutter 플러그인으로, 장치 카메라를 사용해 실시간으로 바코드와 QR 코드를 스캔하고, 사용자 정의 가능한 카메라 동작을 제공합니다.
bopen/sarsen
Sentinel-1 위성 데이터의 기하학적 및 방사능적 지형 보정을 제공하는 클라우드 네이티브 Python 라이브러리입니다.
leomariga/pyRANSAC-3D
3D 점군에 기본적인 기하학적 형태를 적합시키기 위한 파이썬 구현. 3D 재구성 및 SLAM에 유용합니다.
ouster-lidar/ouster-sdk
Ouster Lidar 센서 데이터 연결, 구성, 시각화를 위한 크로스 플랫폼 C++/Python 개발 툴킷입니다.
opencv/opencv_extra
OpenCV 컴퓨터 비전 라이브러리의 핵심 기능을 보완하는 추가 데이터 및 리소스 저장소입니다.
Thinklab-SJTU/ThinkMatch
그래프 간 노드-노드 대응을 찾기 위한 깊은 그래프 매칭 알고리즘의 개발 및 벤치마킹을 위한 연구 프레임워크입니다.
nghorbani/human_body_prior
VPoser는 유효한 3D 인간 자세의 저차원 표현을 제공하는 변분 인간 자세 사전으로, 역운동학과 신체 모델 적합을 개선합니다.
liuliu/ccv
얼굴, 객체 및 텍스트 탐지를 위한 최첨단 알고리즘을 제공하는 미니멀하고 휴대 가능한 C 기반 컴퓨터 비전 라이브러리.
PaddlePaddle/PaddleClas
고성능 비전 애플리케이션을 위해 초경량 모델과 산업급 백본을 제공하는 포괄적인 이미지 인식 및 분류 툴킷입니다.
SegmentationBLWX/sssegmentation
PyTorch 기반의 감독형 세그멘테이션 도구상자로, 훈련 및 테스트를 위한 통합 프레임워크와 광범위한 모델 저지를 제공합니다.
LAION-AI/CLIP_benchmark
다양한 데이터셋에서 제로샷 분류, 검색, 캡션 생성 및 선형 프로빙 성능을 측정하기 위한 CLIP 유사 모델을 위한 표준화된 평가 프레임워크.
facebookresearch/mvdust3r
사전 카메라 포즈 정보 없이도 희소한 RGB 뷰로부터 약 2초 만에 3D 포인트 클라우드와 카메라 포즈를 생성하는 단일 단계 3D 장면 재구성 도구입니다.
zsylvester/segmenteverygrain
지형학 및 퇴적지질학 연구를 위한 목적을 가진, 하이브리드 U-Net과 SAM 2.1 접근법을 사용하여 이미지 내 입자를 탐지하고 세그멘테이션하는 Python 패키지입니다.
phamquiluan/ResidualMaskingNetwork
이미지 및 실시간 영상 스트림에서 인간의 감정을 탐지하기 위한 Residual Masking Network를 사용하는 얼굴 표정 인식 시스템.
NVlabs/nvdiffrecmc
몬테카를로 렌더링과 노이즈 제거를 사용하여 다중 시점 이미지에서 3D 토폴로지, 재질, 조명을 동시에 재구성하는 PyTorch 구현.
adalca/neurite
의료 영상 분석을 위한 신경망 도구 상자로, 전용 텐서 연산, 사전 구축된 아키텍처, 공간 데이터용 플롯 도구를 제공합니다.
scribeocr/scribe.js
이미지 및 PDF에서 OCR 및 텍스트 추출을 수행하는 JavaScript 라이브러리로, 보이지 않는 텍스트 레이어를 가진 검색 가능한 PDF를 생성할 수 있습니다.
hysts/anime-face-detector
PyTorch 기반 도구로, 사전 학습된 Faster R-CNN, YOLOv3 및 HRNetV2 모델을 사용하여 애니메이션 얼굴을 감지하고 28개의 얼굴 랜드마크 포인트를 추정합니다.
mkalten/reacTIVision
피델리티 마커와 멀티터치 손가락을 추적하여 물리적 사용자 인터페이스를 만들 수 있게 해 주는 크로스 플랫폼 컴퓨터 비전 프레임워크입니다.
roboflow/roboflow-python
개발자가 모델, 데이터셋, 프로젝트와 프로그래밍 방식으로 상호작용하여 컴퓨터 비전 모델을 자동으로 구축하고 배포할 수 있도록 해주는 Roboflow 공식 Python 패키지입니다.
lessthanoptimal/BoofCV
자바로 작성된 실시간 컴퓨터 비전 라이브러리로, 저수준 이미지 처리, 카메라 캘리브레이션 및 특징 추적을 위한 도구를 제공합니다.
githubharald/SimpleHTR
TensorFlow 기반 손글씨 텍스트 인식 시스템으로, CNN 및 LSTM 레이어를 사용해 단어 또는 텍스트 라인 이미지를 디지털 텍스트로 변환합니다.
scribeocr/scribeocr
이미지에서 텍스트를 인식하고, 고정밀 교정을 수행하며, 완전히 디지털화된 ebook 스타일 문서를 생성하는 브라우저 기반 웹 애플리케이션입니다.
visionworkbench/visionworkbench
NASA에서 개발한 범용 이미지 처리 및 컴퓨터 비전용 C++ 라이브러리로, 카메라 모델, 지도 투영, 모자이크 합성 도구를 제공합니다.
openclimatefix/graph_weather
GenCast 및 Aurora와 같은 모델을 포함하여 일기 예보 및 데이터 동화를 위한 다양한 그래프 신경망을 구현하는 PyTorch 라이브러리입니다.
norlab-ulaval/libpointmatcher
로봇공학 및 컴퓨터 비전에서 3D 점군 정렬을 위해 Python 바인딩이 있는 모듈식 C++ 라이브러리입니다.
owensgroup/RXMesh
기하 처리 작업을 위한 통합된 행렬 인프라스트럭처와 자동 미분을 갖춘 GPU 가속 삼각 메시 처리 라이브러리입니다.
PoseLib/PoseLib
카메라 자세 추정을 위한 최소 솔버 및 견고한 추정기 모음으로, 다양한 대응 관계와 카메라 모델을 지원하며 의존성이 최소화되어 있습니다.
PozzettiAndrea/ComfyUI-SAM3
Meta의 SAM3용 ComfyUI 통합을 통해 자연어 텍스트 프롬프트를 사용하여 오픈 백과 이미지 및 동영상 세그멘테이션을 가능하게 합니다.
UCSC-VLAA/OpenVision
다중 모달 학습을 위한 오픈소스이자 비용 효율적인 비전 인코더 패밀리로, 이해 및 생성 작업에서 훈련 효율성과 성능을 최적화합니다.
Seeed-Studio/OSHW-reCamera-Series
에지 AI를 위한 통합 NPU를 갖춘 AI 기반 비전 모듈인 reCamera 시리즈의 하드웨어 문서 및 설계 리소스 허브입니다.
CellProfiler/CellProfiler
CellProfiler는 생물학자가 프로그래밍이나 컴퓨터 비전 전문 지식 없이도 수천 장의 이미지에서 자동으로 정량적으로 표현형을 측정할 수 있도록 해주는 오픈소스 소프트웨어입니다.
TechyNilesh/DeepImageSearch
다중 모달 임베딩과 벡터 인덱싱을 사용하여 텍스트, 이미지, 하이브리드 검색을 지원하는 AI 기반 이미지 검색 시스템을 구축하기 위한 Python 라이브러리입니다.