lucidrains/vit-pytorch

이미지 분류를 위한 원본 Vision Transformer (ViT) 및 수십 가지의 아키텍처 변종을 구현한 포괄적인 PyTorch 라이브러리입니다.

aqlaboratory/openfold-3

단백질, RNA, DNA, 소분자의 3차원 구조를 예측하기 위한 AlphaFold3의 오픈소스 재현.

Project-MONAI/MONAI

의료 영상에서의 딥러닝을 위한 PyTorch 기반 오픈소스 프레임워크로, 의료 데이터를 위한 표준화된 워크플로우와 도메인 특화 도구를 제공합니다.

LibreYOLO/libreyolo

MIT 라이선스의 컴퓨터 비전 라이브러리로, 탐지, 세그멘테이션, 자세, 깊이, OCR 및 기타 비전 작업을 위한 단일 API를 제공하며, 훈련 및 내보내기 도구도 포함합니다.

nv-tlabs/vipe

핀홀, 광각, 360도 파노라마 영상 포함 원시 동영상에서 카메라 자세, 내부 파라미터, 밀도 높은 깊이 맵을 추정하는 공간 AI 도구입니다.

aiptimizer/TurboOCR

C++, CUDA, TensorRT를 사용하여 이미지와 PDF를 구조화된 Markdown으로 변환하는 고속 GPU 문서 파서로, 표와 수식을 지원합니다.

mkturkcan/DART

TensorRT 최적화와 교육된 백본을 사용하여 SAM3를 실시간 다중 클래스 오픈-보이지 않는 감지기로 변환하는 학습 없이도 가능한 프레임워크입니다.

TickLabVN/biopass

AI 기반 위조 방지 기능과 GUI 관리자와 함께 Linux에서 얼굴 인식과 지문 인식을 지원하는 다중 모달 생체 인증 로그인 시스템입니다.

leeyeel/Sketch2Motion

정적 이미지나 스케치를 SVG로 변환하고 Manim으로 렌더링하여 부드러운 그림 애니메이션으로 변환하는 도구입니다.

opencv/opencv-python

수동 컴파일 없이 pip를 통해 설치 가능한 OpenCV의 사전 빌드된 Python 바인딩.

pytorch/vision

컴퓨터 비전을 위한 인기 있는 데이터셋, 모델 아키텍처 및 이미지 변환을 제공하는 PyTorch 라이브러리입니다.

mindee/doctr

PDF 및 이미지에서 텍스트 검출 및 인식, 레이아웃 및 표 분석을 가능하게 하는 PyTorch 기반 OCR 라이브러리입니다.

fabiotosi92/ZipDepth

ZipDepth 는 6 M 파라미터의 제로샷 단안 깊이 모델로, GPU 에서 1 k FPS 이상으로 작동하며 모바일 런타임으로 내보낼 수 있습니다. RepVGG 스타일의 재파라미터화 가능한 컨볼루션, 스트립 풀링 어텐션, 가벼운 FPN 디코더를 결합했습니다. 리포지토리에는 즉시 실행 가능한 추론 스크립트, ONNX/TorchScript 내보내기 유틸리티, 벤치마크, 그리고 전체 학습 파이프라인(Deep Anything V2 로부터 지식 증류)이 포함되어 있습니다.

qpuchen/nnUNet_att_position_correction

축향 어텐션(axial attention)과 위치 수정 모듈을 nnU-Net에 통합하여 제한된 레이블 데이터로 정확도를 높이는 준지도 학습 기반 3D 치아 세그멘테이션 프레임워크입니다.

mitsuba-renderer/mitsuba3

Python과의 깊은 통합을 갖춘, 순방향 및 역방향 광 전달 시뮬레이션을 위한 연구 지향적 미분 가능 렌더링 시스템.

obss/sahi

SAHI (Slicing‑Aided Hyper Inference)는 매우 큰 이미지나 비디오에서 객체 탐지 및 인스턴스 세그멘테이션을 위한 슬라이스 추론을 가능하게 하는 오픈소스 파이썬 라이브러리입니다. YOLO, MMDetection, Detectron2, HuggingFace, TorchVision 등 대부분의 인기 탐지기와 호환되며, CLI와 파이썬 API를 제공하고, FiftyOne을 통한 시각화를 지원하며, COCO 데이터셋 처리 및 평가를 위한 유틸리티도 포함하고 있습니다.

Zarxrax/Sammie-Roto-2

SAM2 및 MatAnyone과 같은 모델을 사용하는 AI 지원 비디오 마스킹, 세그멘테이션 및 객체 제거를 위한 크로스 플랫폼 데스크톱 애플리케이션.

WebODM/OpenSplat

OpenSplat은 COLMAP/OpenSfM/ODX/nerfstudio 데이터를 컴팩트한 가우시안 기반 장면 파일로 변환하는 C++ 기반 3D 가우시안 스플래터링 구현체입니다. CUDA, ROCm(HIP), Apple Metal, CPU 전용 빌드를 지원하며, Docker 이미지를 제공하고, `.ply`/`.splat`/`.spz`/`.rad` 형식으로 훈련, 재개, 마스킹, 내보내기를 위한 간단한 CLI를 제공합니다.

Tencent-Hunyuan/HunyuanOCR

구조화된 텍스트 추출을 빠르게 하기 위해 지시적 추론을 통합한 경량형 엔드투엔드 OCR 비전-언어 모델

Intellindust-AI-Lab/DEIMv2

DEIMv2는 DINOv3 피처를 활용하여 엣지 및 서버 배포를 위한 다양한 모델 크기에서 확장 가능하고 최첨단 성능을 제공하는 실시간 객체 탐지 프레임워크입니다.

AprilRobotics/apriltag

로봇용 시각 피쥬얼 시스템으로, 이미지 내 고유한 마커를 감지하여 정확한 식별과 3D 자세 추정을 제공합니다.

GunduLabs/gaze

Linux용 얼굴 인증 시스템으로, 기기 내 얼굴 인식과 PAM 통합을 제공하여 안전하고 비밀번호 없는 로그인 및 sudo 액세스를 지원합니다.

roboflow/inference

엣지 장치부터 클라우드까지 어떤 하드웨어에서도 컴퓨터 비전 모델과 복잡한 시각 워크플로를 실행할 수 있도록 하는 추론 엔진 및 배포 플랫폼.

jacobgil/pytorch-grad-cam

컴퓨터 비전 분야의 설명 가능한 AI(XAI)를 위한 PyTorch 라이브러리로, 모델 예측을 시각화하고 진단하기 위한 광범위한 픽셀 어트리뷰션(pixel attribution) 방법을 제공합니다.

SimonZeng7108/efficientsam3

지식 증류를 활용해 시각 및 텍스트 인코더를 압축한 SAM3의 가벼운 버전으로, 모델 크기를 최대 90% 줄여 효율적인 세그멘테이션을 가능하게 합니다.

Tau-J/rtmlib

rtmlib는 RTMPose 및 ViTPose 모델을 감싸는 경량 Python 라이브러리로, 무거운 OpenMMLab 종속성을 피하고 numpy, OpenCV, ONNX Runtime(옵션 GPU/가속기 백엔드)만 필요로 합니다. Wholebody, Body, Hand, Animal, Custom, Wholebody3d와 같은 고수준 솔루션 클래스는 검출기(YOLOX, RFDETR, RTMDet)와 포즈 추정기를 결합하며, 스켈레톤 그리기 유틸리티도 제공합니다. 모델은 OpenMMLab 또는 HuggingFace 미러에서 자동 다운로드됩니다. pip 또는 소스에서 설치 가능하며, Gradio WebUI 또는 Python API를 통해 단일 이미지, 비디오, 웹캠 추론을 실행할 수 있습니다.

1038lab/ComfyUI-RMBG

RMBG-2.0 및 SAM2와 같은 다양한 AI 모델을 사용하여 고급 이미지 배경 제거 및 정밀한 객체 분할을 수행하기 위한 ComfyUI 커스텀 노드 제품군입니다.

prs-eth/LitePT

LitePT는 3D 비전 작업에서 최신 기술 수준의 정확도를 유지하면서도 파라미터 수와 메모리 사용량을 크게 줄이는 경량이고 고성능의 3D 포인트 클라우드 아키텍처입니다.

deepfakes/faceswap

추출‑학습‑변환 파이프라인을 통해 사진 및 비디오에서 얼굴을 인식하고 교체하는 딥러닝 도구.

Farama-Foundation/ViZDoom

시각 정보만을 사용하여 게임을 플레이하는 봇을 개발하고 테스트하기 위한 Doom 기반 AI 연구 플랫폼. 주로 강화 학습 연구를 위해 사용됨.

Udayraj123/OMRChecker

스캔된 OMR 시트나 모바일 사진을 정확하게 읽고 평가하는 오픈소스 OMR 체크 소프트웨어로, 결과를 CSV로 내보냅니다.

kotaro-kinoshita/yomitoku

이미지 문서에 대해 고정확도 OCR, 레이아웃 분석, 표 구조 인식을 제공하는 일본어 전용 문서 AI 엔진입니다.

margelo/react-native-vision-camera

프로페셔널한 사진/동영상 촬영과 실시간 AI 프레임 처리를 가능하게 하는 React Native용 고성능 카메라 라이브러리입니다.

koide3/small_gicp

고속 3D 정렬을 위한 고도로 최적화된 병렬화 C++ 라이브러리. ICP, GICP, VGICP를 지원.

KennethJAllen/proper-pixel-art

노이즈가 많고 고해상도인 피크셀 아트 스타일 이미지 및 애니메이션을 원래 그리드를 복원하여 깨끗하고 진짜 해상도의 피크셀 자산으로 변환하는 도구.

MIT-SPARK/VGGT-SLAM

3D 매핑 및 위치 추정을 위한 실시간 고밀도 피드포워드 장면 장면 재구성 시스템으로, 선택 사항으로 오픈셋 3D 객체 탐지 기능을 제공합니다.

roflcoopter/viseron

가정 및 사무실 모니터링을 위한 자체 호스팅, 로컬 전용 NVR 및 AI 컴퓨터 비전 소프트웨어로, 객체 및 얼굴 인식 기능을 제공합니다.

bhimrazy/receipt-ocr

Tesseract와 LLM을 사용하여 레시트 이미지에서 원시 텍스트 또는 구조화된 JSON 데이터를 추출하는 OCR 엔진입니다.

Yuliang-Liu/MonkeyOCR

MonkeyOCR은 Structure-Recognition-Relation(구조-인식-관계) 삼중 패러다임을 사용하여 PDF와 이미지를 구조화된 Markdown으로 변환하는 문서 파싱 모델로, 영어와 중국어를 지원합니다.

VisoMasterFusion/VisoMaster-Fusion

이미지, 비디오, 실시간 웹캠 피드에 대해 AI 기반 얼굴 교체 및 향상 기능을 제공하는 데스크톱 애플리케이션으로, 전문적인 편집 도구와 GPU 가속을 지원합니다.

NVlabs/SOMA-X

SOMA‑X는 매개변수화된 인간 몸체와 손의 통합된 미분 가능한 표현을 제공하는 Python 라이브러리로, 여러 아이덴티티 모델(MHR, SMPL‑X, MANO 등)을 지원하고 NVIDIA Warp를 통한 빠른 스키닝을 제공합니다. 여러 수준의 세부 사항에 대한 전신 및 손 메시를 위한 `SOMALayer`와 `SOMAHandLayer`, 그리고 자세 역변환, 리그 제어, 데이터 I/O 도구를 포함하여 애니메이션, 자세 추정 피팅, 합성 데이터 생성에 유용합니다.

zs1083339604/FaceWinUnlock-Tauri

OpenCV와 사용자 정의 인증 공급자를 사용하여, 네이티브 Windows Hello 하드웨어가 없는 장치에서도 얼굴 인식 잠금 해제 기능을 제공하는 Windows 도구입니다.

AmmarkoV/SAM3DBody-cpp

Python 종속 없이 2D 이미지에서 3D 인간 몸체 자세, 형태, 카메라 파라미터를 회귀하는 SAM-3D-Body용 스탠드얼론 C++ 추론 엔진.

ButzYung/SystemAnimatorOnline

웹캠 기반의 AI 모션 캡처 애플리케이션으로, VTubing 및 XR 목적을 위해 3D 아바타(VRM/MMD)를 실시간으로 애니메이션화합니다.

roboflow/sports

스포츠 분석을 위한 컴퓨터 비전 도구 및 데이터셋 모음입니다. 공 추적, 선수 재식별, 유니폼 번호 OCR과 같은 과제에 초점을 맞춥니다.

SharpAI/DeepCamera

로컬에서 VLM 장면 분석 및 객체 감지 스킬을 배포할 수 있는 오픈소스 AI 카메라 플랫폼으로, 자율적이며 하드웨어 인식 설치를 지원합니다.

phongdaot/MocapAnything

임의의 스켈레톤(동물 및 사용자 정의 리깅 포함)에 대해 단일 모노크롬 영상에서 3D 관절 회전으로 변환하는 에ンド투엔드 모션 캡처 시스템.

scikit-image/scikit-image

scikit-image는 이미지를 분석하고 조작하는 알고리즘 모음집을 제공하는 이미지 처리용 Python 라이브러리입니다.