liebharc/homr

사진이나 PDF로 촬영된 악보를 기계로 읽을 수 있는 MusicXML 파일로 변환하는 광학 악보 인식(OMR) 소프트웨어입니다.

cvg/vidmap

시간적 트랙, 루프 클로저, 메트릭 깊이를 활용하여 카메라 자세를 추정하고 스파스 3D 맵을 생성하는 비디오용 오프라인 Structure-from-Motion 시스템.

nv-tlabs/NKSR

Neural Kernel Surface Reconstruction (NKSR)는 수백만 개의 점을 초당 처리할 수 있는, 대규모이고 희박하며 노이즈가 많은 점군에서 고품질의 3D 음함수 표면을 생성하는 방법입니다.

ultralytics/yolov3

Ultralytics YOLOv3 는 YOLOv3 객체 탐지 모델의 PyTorch 구현으로, 세 가지 변형(풀, SPP, 타이니)을 제공하며, 학습, 추론, 검증, 다양한 배포 형식으로 내보내기 위한 스크립트를 포함합니다. 자동으로 COCO 사전 학습된 가중치를 다운로드하고, PyTorch Hub 로딩을 지원하며, 인기 있는 ML-ops 도구 및 클라우드 노트북과 통합됩니다. AGPL‑3.0 라이선스로 오픈소스 사용에 적합하며, 상업용 엔터프라이즈 옵션도 제공됩니다.

lightly-ai/lightly

자기지도 학습을 위한 모듈식 컴퓨터 비전 프레임워크로, 수많은 최신 SSL 모델의 구현과 모듈식 빌딩 블록을 제공합니다.

google-ai-edge/model-explorer

Model Explorer 는 Google‑AI‑Edge 의 오픈소스 시각화 도구로, TensorFlow, TFLite, TF‑JS, MLIR, PyTorch ExportedProgram 모델을 인터랙티브한 계층 그래프로 렌더링합니다. GPU 가속 렌더링, 검색 가능한 노드, I/O 하이라이트, 메타데이터 오버레이, 그리고 추가 형식을 위한 확장 가능한 어댑터 시스템을 제공합니다.

ndl-lab/ndlocr-lite

GPU가 필요 없는 가정용 컴퓨터용 가벼운 OCR 도구. 디지털화된 책과 잡지에서 텍스트를 추출하기 위해 설계됨.

albumentations-team/AlbumentationsX

컴퓨터 비전 모델의 품질과 견고성을 향상시키기 위해 합성 학습 샘플을 생성하는 고성능 이미지 증강용 Python 라이브러리입니다.

bytedance/Protenix

AlphaFold3의 대안으로, 단백질과 RNA의 고정밀 3차원 모델링을 제공하는 오픈소스 생체분자 구조 예측 프레임워크입니다.

facebookresearch/MHR

정체성, 자세, 얼굴 표정 파라미터를 사용하여 현실적이고 미분 가능한 인간 메시를 생성하는 고정밀 파라메트릭 3D 인간 몸체 모델.

triple-mu/YOLOv8-TensorRT

YOLOv8용 고성능 TensorRT 가속 래퍼로, 검출, 세그멘테이션, 포즈, OBB, 분류 작업의 Python 및 C++에서 빠른 추론을 가능하게 합니다.

cvg/GeoCalib

GeoCalib은 딥러닝과 기하 최적화를 결합한 연구용 파이썬 라이브러리로, 단일 이미지에서 카메라 내부 파라미터와 장면의 중력 방향을 예측합니다. 여러 렌즈 모델, 부분적 사전 지식, 배치 및 다중 카메라 리그 캘리브레이션을 지원하며, 설치가 쉬운 추론 코드, Gradio 웹 데모, Colab 노트북, 실시간 웹캠 데모를 제공합니다. 사전 학습된 모델은 OpenPano 데이터셋(약 37k개의 HDR 파노라마에서 추출한 투시 투영 이미지)에서 학습되었으며, LaMAR, MegaDepth, TartanAir, Stanford2D3D 등의 벤치마크에서 최고 성능을 기록합니다.

SunOner/sunone_aimbot_2

컴퓨터 비전 모델을 사용하여 타겟을 감지하고 게임용 마우스 조작을 자동화하는 C++ 기반 AI 아임봇입니다.

orbbec/pyorbbecsdk

Orbbec SDK v2.x용 파이썬 바인딩으로, 깊이 스트리밍, 3D 포인트 클라우드 생성 및 컴퓨터 비전 작업을 위한 RGB-D 카메라와의 인터페이스를 가능하게 합니다.

luicfrr/react-native-vision-camera-face-detector

React Native 라이브러리로, Google MLKit과 Vision Camera를 통합하여 실시간 및 정적 이미지 얼굴 감지를 제공합니다.

facebookresearch/detectron2

Detectron2는 Meta AI Research에서 제공하는 고성능 컴퓨터 비전 라이브러리로, 최첨단 객체 탐지 및 세그멘테이션 알고리즘을 제공합니다.

LazoVelko/neverclick

컴퓨터 비전을 사용하여 사용자가 키보드만으로 마우스 작업을 수행할 수 있도록 해주는 데스크톱 애플리케이션. 물리적 마우스 사용을 줄이는 데 목적이 있습니다.

dweep-desai/FaceGate-Mac

기기 내 얼굴 인식, Touch ID 또는 비밀번호를 사용하여 특정 애플리케이션에 대한 접근을 제한하는 네이티브 macOS 앱 잠금 도구입니다.

mne-tools/mne-python

MEG 및 EEG와 같은 인간 신경생리학적 데이터를 탐색, 시각화 및 분석하기 위한 오픈 소스 Python 패키지입니다.

egdels/makeacopy

온디바이스 ML과 OCR을 사용해, 자체 호스팅 워크플로우를 위한 검색 가능한 PDF를 생성하는, 오프라인 중심의 개인정보 보호 Android 문서 스캐너입니다.

krupkat/xpano

이미지 그룹 감지 자동화와 내보내기용 투영 조정을 제공하는 풀레졸루션 패노라마 생성 도구

sceneview/sceneview

Jetpack Compose와 SwiftUI와 같은 선언형 UI 프레임워크를 사용하여 다중 플랫폼에서 몰입형 3D 및 AR 경험을 개발할 수 있는 프레임워크입니다.

blakeblackshear/frigate-hass-integration

Frigate의 인공지능 기반 객체 탐지 및 NVR 기능을 스마트 홈 허브에 연결하는 Home Assistant 통합을 통해 자동화된 보안 모니터링을 가능하게 합니다.

perfanalytics/pose2sim

OpenSim을 사용하여 저비용 카메라에서 촬영한 2D 영상을 연구 수준의 3D 관절 각도와 골격 분석으로 변환하는 마커리스 3D 운동학 워크플로우입니다.

playcanvas/supersplat-viewer

WebGPU 또는 WebGL을 사용하여 웹에서 인터랙티브한 3D 가우시안 스플래팅 장면을 고성능으로 렌더링할 수 있는 웹 뷰어입니다.

microsoft/aurora

Aurora는 일반 목적의 사전 훈련 모델을 특화된 예측 작업에 적응시켜 기온, 대기 오염, 해양 파도와 같은 대기 변수를 예측하는 지구 시스템용 기초 모델입니다.

yatengLG/ISAT_with_segment_anything

Segment Anything Model(SAM)을 사용하여 라벨링된 데이터셋 생성을 가속화하는 인터랙티브 반자동 이미지 세그멘테이션 주석 도구입니다.

secluso/core

클라우드 감시를 피하기 위해 엔드투엔드 암호화를 사용하는 Raspberry Pi용 개인용 DIY 홈 보안 카메라 시스템입니다.

mahmoodlab/TRIDENT

AI 병리학에서 대규모 전체 슬라이드 이미지 처리를 위한 툴킷으로, 다양한 기초 모델을 사용하여 조직 세그멘테이션과 특징 추출의 엔드투엔드 파이프라인을 제공합니다.

CERN/TIGRE

Python과 MATLAB을 사용하여 다양한 반복 알고리즘과 유연한 CT 기하 구조를 지원하는 GPU 가속 3D 톰로그래픽 재구성 도구상자로, 빠르고 정확한 재구성 가능

InsightSoftwareConsortium/ITK

N차원 과학적 이미지 처리, 세그멘테이션 및 레지스트레이션을 위한 오픈소스 크로스플랫폼 툴킷으로, 주로 의료 영상 분석에 사용됨.

mtalcott/google-photos-deduper

OAuth 설정이 필요 없이 로컬 이미지 임베딩을 사용하여 Google Photos 라이브러리의 중복 사진을 찾아 제거하는 Chrome 확장 프로그램입니다.

Geekgineer/YOLOs-CPP

객체 탐지부터 미터법 깊이 추정까지 다양한 작업을 지원하며, 전체 YOLO 제품군을 위한 통합 API를 제공하는 프로덕션용 C++ 추론 엔진입니다.

alicevision/AliceVision

무질서한 사진이나 비디오로부터 3D 재구성 및 카메라 트래킹을 위한 알고리즘을 제공하는 사진측량 컴퓨터 비전 프레임워크입니다.

chaofengc/IQA-PyTorch

수많은 전반적 참조 및 비참조 품질 지표를 GPU 가속으로 구현한 PyTorch 기반 이미지 품질 평가(IQA) 도구상자입니다.

Babyhamsta/Aimmy

YOLOv8과 DirectML을 사용하여 신체적 또는 시각적 장애가 있는 게이머가 FPS 게임에서 정확도를 높일 수 있도록 돕는 AI 기반 조준 정렬 도구입니다.

pur1fying/blue_archive_auto_script

YOLOv8을 사용한 캐릭터 탐지 기술을 활용해 블루 아카이브의 전투, 일일 작업, 자원 관리를 자동화하는 자동화 스크립트입니다.

withoutbg/withoutbg-python

무료 로컬 ONNX 모델 또는 전문적인 클라우드 API를 사용하여 이미지 배경을 제거하기 위한 Python 라이브러리입니다.

apple-aiml-research/ARKitScenes

모바일 LiDAR를 통해 촬영된 실내 장면의 대규모 RGB-D 데이터셋으로, 3D 객체 탐지 및 깊이 업샘플링을 위한 지상 진실을 제공합니다.

lukasHoel/video_to_world

동영상 확산 모델이 생성한 동영상에서 발생하는 기하학적 불일치를 해결하여 안정적인 3D 세계를 생성하는 3D 재구성 파이프라인입니다.

Slicer/Slicer

3D Slicer는 3D 의료 영상 데이터의 시각화 및 분석을 위한 무료로 오픈소스인 소프트웨어 패키지입니다.

qupath/qupath

QuPath는 기계학습과 전용 알고리즘을 사용하여 전체 슬라이드 이미지 및 현미경 이미지의 주석 달기와 분석을 수행하는 오픈소스 생물 이미지 분석 소프트웨어입니다.

mudler/locate-anything.cpp

NVIDIA의 LocateAnything-3B의 C++/ggml 추론 이식 버전으로, Python 런타임 없이 CPU와 GPU에서 빠르고 오픈 박스 객체 탐지를 가능하게 합니다.

deepinv/deepinv

DeepInverse는 모듈식 연산자 및 알고리즘 프레임워크를 통해 딥러닝을 사용하여 이미징 역문제를 해결하도록 설계된 오픈 소스 PyTorch 기반 라이브러리입니다.

Junjue-Wang/LoveDA

도시 및 농촌 환경에서 세그멘테이션 및 도메인 적응을 개선하기 위한 고해상도 원격 탐사 토지 피복 데이터셋입니다.

chenwei-zhao/captcha-recognizer

슬라이더 CAPTCHA에서 갭 좌표와 신뢰도를 식별하기 위한 딥러닝 기반 라이브러리.

privatenumber/mac-ocr

macOS용 명령줄 도구와 Node.js API로, Apple의 Vision 프레임워크를 사용해 이미지와 PDF에서 텍스트를 추출하고 검색 가능한 PDF를 생성하는 로컬 및 개인 정보 보호 중심의 OCR 기능 제공.

nsfw-filter/nsfw-filter

데이터를 서버에 업로드하지 않고 기기에서 AI를 실행하여 NSFW 이미지를 차단하는 개인정보 보호 중심의 브라우저 확장 프로그램입니다.