scikit-image/scikit-image

scikit-image는 이미지를 분석하고 조작하는 알고리즘 모음집을 제공하는 이미지 처리용 Python 라이브러리입니다.

google-research/scenic

JAX와 Flax 기반의 컴퓨터 비전 연구 라이브러리로, 이미지, 비디오, 오디오 전반에 걸친 어텐션 기반 모델 개발을 위한 확장 가능한 라이브러리와 프로젝트 템플릿을 제공합니다.

kotaro-kinoshita/yomitoku

이미지 문서에 대해 고정확도 OCR, 레이아웃 분석, 표 구조 인식을 제공하는 일본어 전용 문서 AI 엔진입니다.

zju3dv/InfiniSplat

InfiniSplat은 단일 RGB 이미지 또는 RGB-깊이 쌍에서 3D 가우시안 스플래팅 장면을 재구성하는 대기반 단일 시점 합성 시스템입니다.

SarahWeiii/CoACD

복잡한 형태를 효율적인 충돌 검출과 물리 시뮬레이션을 위해 근사 볼록 껍질로 분해하는 3D 메시 분해 도구입니다.

playcanvas/splat-transform

SplatTransform은 3차원 가우시안 스플래터 데이터를 변환, 편집, 분석하기 위한 오픈소스 라이브러리 및 CLI입니다. PLY, SOG, SPZ, GLB, HTML, 복셀, WebP 등 다양한 입력/출력 형식을 지원하며, 기하학적 변환, 필터링, 감소, LOD 스트리밍, 충돌 메시 생성, GPU 가속 연산을 제공합니다. npm으로 설치하거나 Docker 백엔드를 사용할 수 있으며, `splat-transform input.ply output.sog` 또는 `-s`, `-t`, `--filter-box`, `--decimate`와 같은 명령어를 체인하여 사용할 수 있습니다. 신경 그래픽스 스플래터 표현을 다루는 연구자, 엔진 개발자, 콘텐츠 제작자에게 이상적입니다.

PiTracLM/PiTrac

Raspberry Pi와 머신러닝을 사용하여 공의 발사 속도, 각도 및 스핀을 추적하는 오픈 소스 DIY 골프 런치 모니터.

twistedfall/opencv-rust

OpenCV 컴퓨터 비전 라이브러리용 Rust 바인딩으로, Rust에서 OpenCV의 이미지 처리 및 CV 도구를 사용할 수 있게 합니다.

davnords/LoMa

LoMa 는 컴퓨터 비전을 위한 빠르고 정확한 국소 특징 매칭기 패밀리입니다 — 이미지 쌍 간의 대응점을 찾으며, 3D 재구성 및 시각적 위치 추정 파이프라인에서 LightGlue 의 드롭인 대체품으로 사용 가능하며, 속도와 정확도를 균형 있게 조절할 수 있는 여러 모델 크기를 제공합니다.

duy-phamduc68/TrafficLab-3D

컴퓨터 비전과 사용자 정의 캘리브레이션 파이프라인을 사용하여 CCTV 영상과 위성 지도에서 3D 디지털 트윈을 생성하는 엔드투엔드 트래픽 분석 솔루션.

suzuran0y/CCTV-Smartphone-AI-Monitoring

Sentinel은 오픈소스의 LAN 전용 시스템으로, 안드로이드 폰을 실시간 카메라 노드로, Python/Flask 기반 PC 서버를 실시간 미리보기, 세그먼트 녹화, AI 트리거 감시 대시보드로 전환합니다. 모션 감지로 외부 비전 모델을 호출하고, 구조화된 JSON 이벤트를 출력하며, 모든 데이터를 로컬에 보관하여 개인정보 중심의 감시 또는 데이터 수집 연구에 적합합니다.

NVlabs/SpatialClaw

SpatialClaw는 공간 추론 에이전트를 위한 학습 없이 사용 가능한 코드 기반 프레임워크입니다. VLM은 사전에 인식 도구(SAM-3, Depth-Anything-3)와 과학 라이브러리가 로드된 지속적인 Jupyter 커널 내에서 Python 셀을 작성하고 실행합니다. 시스템은 계획, 코드 생성, 안전성 검사 실행, 관측의 루프를 반복하여 에이전트가 `ReturnAnswer(...)`를 반환할 때까지 진행합니다. 20개의 벤치마크에서 평균 정확도 59.9%를 달성하며, 이전 에이전트보다 11.2점 높은 성능을 보였으며, 동일한 프롬프트와 도구를 6개의 VLM 백엔드에서 사용했습니다. 리포지토리는 전체 런타임, 벤치마크 로더, 설치 스크립트, SLURM 지원을 포함합니다.

Dicklesworthstone/franken_ocr

franken_ocr는 Baidu의 Unlimited-OCR 및 네 가지 관련 비전-언어 모델을 실행하는 순수 Rust, CPU 전용 OCR 엔진입니다. 단일 포터블 바이너리(`focr`)로 배포되며, 한 번의 모델 다운로드 후 완전히 오프라인으로 작동하며, Markdown, JSON, 차트 데이터, MusicXML 출력을 제공합니다. 프로젝트는 수작업으로 작성된 SIMD 커널을 사용하고, 안전하지 않은 Rust는 검토된 SIMD 섬 외에는 금지하며, 광범위한 자체 테스트 및 릴리스 인증 스크립트를 포함합니다.

manycoretech/aholo-viewer

거대한 3D 데이터셋을 처리할 수 있도록 체크된 스트리밍 LOD를 사용하는 고성능 3D 가우시안 스플래터링 및 메시 렌더러입니다.

opencv/opencv_contrib

OpenCV 공식 코어 배포판에 통합되기 전, 실험적 기능 및 커뮤니티 기여 추가 모듈을 테스트하기 위한 저장소입니다.

PointCloudLibrary/pcl

2D/3D 이미지 및 포인트 클라우드 처리를 위한 대규모 오픈소스 라이브러리로, 로봇공학 및 3D 인식 분야에서 널리 사용됩니다.

robertknight/ocrs

신경망 모델을 사용하여 이미지에서 텍스트를 추출하는 러스트 라이브러리 및 CLI 도구로, 이미지 전처리의 필요성을 최소화합니다.

DeepLabCut/DeepLabCut

DeepLabCut은 딥러닝을 사용하여 물리적 마커 없이 비디오 내의 동물과 물체를 추적할 수 있는 마커리스 포즈 추정 툴박스입니다.

infinitered/nsfwjs

TensorFlow.js를 사용하여 이미지를 안전한 카테고리와 NSFW 카테고리로 분류하는 자바스크립트 라이브러리입니다.

antvis/chart-visualization-skills

검색 가능한 스킬 카탈로그, CLI, HTTP 서비스, npm 패키지를 통해 LLM이 정확하고 실행 가능한 차트(G2, G6, X6, 인포그래픽, 내러티브 텍스트 등)를 생성할 수 있도록 하는 AI 강화 AntV 스킬 라이브러리.

MIT-SPARK/KISS-Matcher

상대 회전과 이동을 결정하기 위해 3D 포인트 클라우드를 정렬하는 빠르고 견고한 포인트 클라우드 등록 라이브러리입니다.

MIC-DKFZ/nnInteractive

3D 의료 영상용 최첨단 3D 프롬프트 가능한 세그멘테이션 프레임워크로, 점, 스케치, 라소 프롬프트를 사용해 부피 마스크를 보정할 수 있습니다.

TencentARC/Track4World

Track4World는 단안 영상에서 모든 픽셀의 밀도 높은 3D 추적을 가능하게 하며, 피드포워드 방식으로 월드 센트릭 3D 장면 흐름을 추정하는 프레임워크입니다.

UVA-Computer-Vision-Lab/OmniShotCut

다양한 동영상 소스에서 컷과 전환을 식별하는 고성능 쇼트 경계 검출 도구. Shot-Query Transformer를 사용.

kocasariumut/FaceAnything

Face Anything는 임의의 이미지 시퀀스나 단일 사진으로부터 시간적으로 일관된 4D (3D + 시간) 얼굴을 재구성하는 피드포워드 신경망 모델입니다. 포인트 클라우드 비디오, 깊이/법선 맵, 표준 좌표 시각화, 프레임별 PLY 메쉬 및 카메라 데이터를 출력합니다. CUDA GPU에서 실행되며, 한 줄의 스크립트로 설치가 가능하며, 구성 가능한 처리 모드와 배경 제거 기능을 제공합니다.

ssrajadh/sentrysearch

자연어 또는 이미지를 사용해 특정 이벤트를 영상에서 검색하고 일치하는 클립을 자동으로 자르는 의미적 동영상 검색 도구입니다.

nvpro-samples/vk_gltf_renderer

glTF 2.0 및 2.1 씬의 고충실도 PBR 재료 레퍼런스로 기능하는 Vulkan RTX 패스 트레이서 및 glTF 씬 편집기입니다.

RollingPlain/IVIF_ZOO

적외선 및 가시광선 이미지 융합(IVIF)을 위한 포괄적인 리소스 허브 및 벤치마크로, 큐레이션된 데이터셋, 분류된 융합 방법 카탈로그, 평가 도구를 제공합니다.

Pointcept/Utonia

다양한 하류 3D 인식 작업에 대한 보편적인 표현을 제공하는, 3D 포인트 클라우드용 크로스도메인 사전 훈련된 Point Transformer V3 인코더입니다.

fegennari/3DWorld

우주, 도시, 지형의 광범위한 프로시저 생성과 대규모 모델의 고성능 렌더링을 갖춘 크로스플랫폼 OpenGL 기반 3D 게임 엔진

google/ffn

뇌 조직 전자현미경 데이터셋에서 대규모이고 복잡한 3D 형태의 인스턴스 세그멘테이션을 위한 신경망 프레임워크.

Artoriuz/ArtCNN

애니메이션 콘텐츠의 확대 및 정리에 최적화된 단일 이미지 슈퍼리졸루션(SISR) 모델 컬렉션으로, 실시간 및 고품질 비실시간 옵션을 모두 제공합니다.

hybridgroup/gocv

GoCV는 OpenCV 4용 Go 언어 바인딩을 제공하여 Go 개발자가 고급 컴퓨터 비전 및 하드웨어 가속 이미지 처리를 애플리케이션에 통합할 수 있게 합니다.

microsoft/GlobalMLBuildingFootprints

Microsoft의 Global Building Footprints 리포지토리는 심층학습 세그멘테이션 모델로 생성된 10억 개 이상의 건물 다각형(및 많은 높이 추정치)을 포함하는 오픈 라이선스 데이터셋을 공개합니다. 데이터는 Bing 쿼드키로 인덱싱된 gzip 압축된 줄 단위 GeoJSON 파일 형태로 제공되며, 신뢰도 점수와 문서를 포함해 대규모 GIS 또는 AI 기반 도시 분석에 적합합니다.

tue-mps/eomt

복잡한 디코더 없이 일반적인 Vision Transformer (ViT)를 재사용하여 고속이고 정확한 이미지 세그멘테이션을 수행하는 엔코더 전용 모델.

automeris-io/WebPlotDigitizer

WebPlotDigitizer는 컴퓨터 비전 기술을 활용하여 연구자와 과학자가 데이터 시각화 이미지에서 수치 데이터를 추출할 수 있도록 돕는 도구입니다.

cvg/resplat

ReSplat은 렌더링 오차를 피드백으로 사용하여 장면 표현을 반복적으로 정교화하는 피드포워드 재귀 모델입니다.

mikel-brostrom/boxmot

축에 맞는 경계 상자(AABB)와 방향성 경계 상자(OBB)를 모두 지원하는 플러그인 가능한 다중 객체 추적 프레임워크로, 다양한 검출기와 추적기를 통일된 인터페이스로 통합할 수 있습니다.

ok-oldking/ok-script

Windows 앱, 게임, Android 장치를 위한 컴퓨터 비전 기반 파이썬 자동화 프레임워크. OCR 및 템플릿 매칭을 지원.

QIN2DIM/hcaptcha-challenger

컴퓨터 비전 모델과 다중모달 대규모 언어 모델을 결합한 AI 기반 도구로 hCaptcha 챌린지를 해결합니다.

vccimaging/DeepLens

PyTorch 훈련 루프 내에서 학습 가능한 파라미터로 렌즈를 최적화할 수 있는, 계산 영상 및 광학 설계를 위한 미분 가능한 광학 렌즈 시뮬레이터입니다.

princeton-vl/infinigen

컴퓨터 비전 및 로봇 시뮬레이션을 위해 무한한 포토리얼리스틱 3D 세계, 실내 장면 및 관절형 에셋을 생성하는 절차적 생성 엔진입니다.

Peterande/D-FINE

D‑FINE는 DETR의 박스 회귀를 세밀한 분포 개선으로 재정의하고 자기 증류 모듈을 추가한 실시간 객체 탐지 프레임워크입니다. 다양한 모델 크기(‑N에서 ‑X까지)를 제공하며, T4 GPU에서 70~470 FPS로 작동하면서 COCO/AP 점수에서 최신 기준(42.8 %~55.8 %)을 달성하며, 추론 비용은 추가되지 않습니다. 리포지토리는 COCO, Objects365 및 사용자 정의 COCO 형식 데이터셋용 사전 학습된 체크포인트, 설정 파일, 완전한 학습/평가 스크립트를 제공합니다.

PozzettiAndrea/ComfyUI-MotionCapture

GVHMR를 사용하여 동영상에서 3D 인간 운동과 SMPL 골격 파라미터를 추출하는 ComfyUI 커스텀 노드 패키지입니다.

apple-aiml-research/ml-depth-pro

1초 미만에 고해상도이고 선명한 깊이 맵을 절대 스케일로 생성하는 제로샷 단안 메트릭 깊이 추정을 위한 기초 모델.

koide3/direct_visual_lidar_calibration

환경의 구조와 텍스처를 활용하여 정밀한 센서 정렬을 위한 타겟 없고 자동적인 LiDAR-카메라 외부 캘리브레이션 도구 상자입니다.

localai-org/depth-anything.cpp

CPU 및 GPU에서 빠르고 종속성 없는 C++ 포트로 Depth Anything 3 및 V2를 위한 단안 메트릭 깊이와 카메라 자세 추론을 제공합니다.

liebharc/homr

사진이나 PDF로 촬영된 악보를 기계로 읽을 수 있는 MusicXML 파일로 변환하는 광학 악보 인식(OMR) 소프트웨어입니다.