MCG-NJU/MOTIP
MOTIP는 트래킹을 인컨텍스트 ID 예측 문제로 취급하여 현재 탐지된 객체에 대한 ID 레이블을 직접 디코딩하는 다중 객체 트래킹 프레임워크입니다.
xiaobiaodu/Mobile-GS
Mobile-GS는 모바일 장치에서 고품질 3D 장면 렌더링을 가능하게 하는 실시간 가우시안 스플래터링 프레임워크입니다.
allenai/olmoearth_pretrain
지구 관측을 위한 멀티모달 시공간 기초 모델 제품군, 위성 데이터를 사용하여 데모스피어 플래닛 인텔리전스를 위한 확장 가능한 프레임워크를 제공합니다.
Tsinghua-MARS-Lab/SLAM-Former
이미지 시퀀스로부터 3D 재구성과 카메라 추적을 위한 로컬라이제이션과 매핑을 하나의 모델로 통합하는 Transformer 기반 SLAM 시스템.
alicevision/CCTag
동심원으로 구성된 원형 피듀셜 마커의 검출 및 정확한 위치 추정을 위한 컴퓨터 비전 라이브러리입니다.
81NewArk/AntiCAP-WebApi
모델 추론을 사용하여 CAPTCHA를 해결하는 웹 API 서비스로, 로컬 및 공공 네트워크 배포를 지원합니다.
bhky/opennsfw2
이미지 및 동영상 내의 음란물 콘텐츠를 감지하기 위한 Yahoo Open-NSFW 모델의 Keras 구현체입니다.
RenderKit/oidn
몬테카를로 노이즈를 제거함으로써 레이 트레이싱 애플리케이션의 렌더링 시간을 단축하는 딥러닝 기반 고성능 필터 라이브러리입니다.
myBoris/wzry_ai
기계 학습과 사용자 정의 화면 좌표 매핑을 활용하여 헌터 오브 코링스의 게임 플레이를 자동화하는 오픈소스 AI 모델 프로젝트입니다.
LuisaGroup/LuisaRender
CUDA, DirectX, Metal 등의 여러 하드웨어 백엔드를 지원하는, 스트림 아키텍처용 고성능 크로스플랫폼 몬테카를로 렌더러입니다.
henrywoo/kazam
화면 캡처에서 텍스트를 추출하는 AI 기반 OCR을 포함한 Linux용 스크린 레코더 및 브로드캐스터.
wenbowen123/BundleTrack
BundleTrack은 객체나 해당 카테고리의 3D CAD 모델 없이도 새로운 객체의 실시간 6D 포즈 트래킹을 수행하는 프레임워크입니다.
OpenStitching/stitching
OpenCV를 사용하여 중첩 이미지에서 파노라마를 생성하는 빠르고 견고한 이미지 스티칭용 Python 패키지입니다.
NativeSensors/EyeGestures
고가의 전용 하드웨어 대신 표준 웹캠과 스마트폰 카메라를 사용하여 눈 제어 인터페이스를 구현할 수 있는 오픈소스 눈 추적 라이브러리.
facebookresearch/projectaria_tools
Project Aria AR 안경에서 발생하는 센서 및 기계 인식 데이터를 처리하고 분석하기 위한 C++/Python 유틸리티 세트로, AI 및 기계 인식 연구를 지원합니다.
FaceAISDK/FaceAISDK_Android
클라우드 연결이 필요 없는 Android용 오프라인 온디바이스 얼굴 인식 SDK로, 얼굴 감지, 인식, 라이브니스 검출을 모두 제공합니다.
facebookresearch/Ego4d
Ego4D와 Ego-Exo4D를 위한 툴킷 및 데이터셋 인프라스트럭처로, 대규모 1인칭 및 멀티뷰 비디오 데이터셋을 다운로드, 처리 및 모델 학습에 사용할 수 있는 도구를 제공합니다.
yuxumin/PoinTr
PoinTr는 기하학적 인지 인코더-디코더 아키텍처를 사용하여 부분적인 포인트 클라우드로부터 완전한 3D 객체를 재구성하는 Transformer 기반의 포인트 클라우드 완성 모델입니다.
MeshInspector/MeshLib
다양한 프로그래밍 언어에서 작동하는 고성능 3D 메시 처리 SDK로, 3D 데이터의 복구, 최적화 및 조작을 제공합니다.
hbb1/2d-gaussian-splatting
2D 방향성 디스크(surfels)를 사용하여 기하학적으로 정확한 레디언스 필드와 고품질 3D 메시를 생성하는 2D 가우스 스플래팅 구현입니다.
nipreps/fmriprep
최신 신경영상 도구들을 조합하여 운동 보정, 정규화, 뇌 추출을 자동화하는 fMRI 데이터용 강력한 전처리 파이프라인입니다.
lolishinshi/imsearch
작은 자르기된 스크린샷을 사용하여 대규모 데이터셋에서 전체 이미지를 특징점 매칭으로 찾는 도구.
cdcseacave/openMVS
OpenMVS는 희소 점군과 카메라 자세를 세밀하고 텍스처가 있는 3D 메시로 변환하는 다중 시점 입체 재구성 라이브러리입니다.
microsoft/BiomedParse
9가지 영상 모달리티에 걸쳐 생물의학적 객체의 통합 세그멘테이션, 탐지, 인식을 가능하게 하는 기초 모델로, 2D 및 3D 볼륨 추론을 모두 지원합니다.
thiagotigaz/ocr-it
텍스트 선택이 비활성화된 페이지 구분 웹 문서 및 뷰어에서 로컬 OCR을 사용하여 텍스트를 추출하는 Chrome 및 Firefox 확장 프로그램입니다.
ohirose/bcpd
BCPD는 점군 및 함수(DET)의 베이지안 비강체 정렬을 위한 MATLAB 호환 명령줄 스위트이며, 가속화된 "++" 모드, 다양한 커널 옵션, 그리고 3D 재구성, 형태 전송, 공간 오믹스 데이터를 위한 데모를 제공합니다.
facebook/ThreatExchange
유사성 매칭을 위한 이미지 및 동영상 해시 알고리즘을 포함한 콘텐츠 모더레이션 및 보안 위협 인텔리전스를 위한 도구 및 API 모음입니다.
Linfeng-Tang/Image-Fusion
다중 모달, 디지털 사진, 원격 탐사 이미지 조합 기술을 포함하는, 이미지 융합에 대한 연구 논문과 코드 구현의 포괄적 컬렉션.
freesurfer/freesurfer
FreeSurfer는 구조적 및 기능적 연구에서 나온 인간 뇌 MRI 데이터를 처리, 분석, 시각화하기 위한 오픈소스 소프트웨어 스위트입니다.
dipy/dipy
DIPY는 MR 확산 영상 분석을 위한 Python 라이브러리로, 연구자들이 의료 영상 데이터를 처리할 수 있도록 도구를 제공합니다.
NVIDIA-AI-IOT/Lidar_AI_Solution
3D Lidar 인식을 위해 고도로 최적화된 CUDA 및 TensorRT 구현 모음으로, 자율 주행 시스템의 희소 합성곱(sparse convolutions) 및 센서 퓨전을 가속화합니다.
the-database/mpv-AnimeJaNai
TensorRT 또는 DirectML을 사용하여 애니메이션 콘텐츠의 실시간 4K 업스케일링을 가능하게 하는 커스텀 mpv 비디오 플레이어 빌드 및 Real-ESRGAN 모델 세트.
naver/anny
Anny는 모든 연령대를 포괄하는 오픈소스 PyTorch 기반의 미분 가능한 인간 몸체 메시 모델입니다. 여러 리그(컴팩트한 104본 기본값, 전체 MakeHuman), 여러 메시 위상(SMPL-X 및 SOMA 포함), 그리고 세밀한 형태, 로컬 변경, 얼굴 액션 매개변수를 제공합니다. pip를 통해 설치하고, 빠른 Python 예제를 실행하여 .ply 메시를 출력하거나, 인터랙티브 Gradio 데모를 시작할 수 있습니다. 이 라이브러리는 Apache-2.0 라이선스를 적용받으며, MakeHuman 에셋을 기반으로 하며, 자세 추정, 애니메이션, 연령대 간 몸체 모델링과 같은 연구/프로덕션 작업을 위해 설계되었습니다.
arcships/light-ocr
Node.js 및 C++용 빠르고 오프라인의 OCR 라이브러리로, 내장된 하드웨어 가속을 통해 이미지와 PDF의 로컬 텍스트 인식을 제공합니다.
kha-white/manga-ocr
일본 만화에 특화되어 최적화된 OCR 도구로, 다중 라인 텍스트, 후리가나, 그리고 세로·가로 레이아웃을 인식할 수 있습니다.
open-edge-platform/geti
컴퓨터 비전 AI 모델 구축을 위한 엔드투엔드 플랫폼으로, 주석(annotation), 학습, 그리고 엣지 하드웨어 배포를 위한 최적화 도구를 제공합니다.
voxelmorph/voxelmorph
신경망을 사용하여 이미지를 정렬하고 변형을 모델링하는 학습 기반 이미지 등록 라이브러리로, SynthMorph를 통한 대비 불가지론적(contrast-agnostic) 학습이 특징입니다.
JEOresearch/EyeTracker
영상 또는 이미지 데이터에서 눈동자 타원을 검출하는 경량 Python 기반 3D 눈 추적 알고리즘입니다.
hank-ai/darknet
C/C++ 및 CUDA로 작성된 오픈소스 신경망 프레임워크로, YOLO 실시간 객체 탐지 시스템을 구동합니다.
hku-mars/GS-SDF
Gaussian Splatting과 신경망 Signed Distance Fields (SDF)를 결합하여 기하학적으로 일관된 실사 렌더링과 3D 표면 재구성을 구현하는 LiDAR 증강 시스템입니다.
stereolabs/zed-sdk
ZED 카메라를 위한 크로스 플랫폼 공간 인지 SDK로, 실시간 깊이 감지, 객체 탐지 및 위치 추적을 제공합니다.
shimat/opencvsharp
C# 개발자에게 포괄적인 컴퓨터 비전 및 이미지 처리 기능을 제공하는 OpenCV용 크로스 플랫폼.NET 래퍼입니다.
leblancfg/autocrop
Python 기반 도구로 YuNet 신경망을 사용해 가장 크게 감지된 얼굴을 자동으로 크롭합니다. 프로필 사진 및 신분증에 이상적입니다.
imagej/ImageJ
ImageJ는 Java를 사용하여 여러 플랫폼에서 실행되도록 설계된 과학적 이미지를 처리하고 분석하기 위한 퍼블릭 도메인 소프트웨어입니다.
kha-white/mokuro
일본어 만화에 대한 텍스트 검출 및 OCR을 수행하여 브라우저에서 선택 가능한 텍스트 오버레이를 생성하는 도구로, 언어 학습자의 팝업 사전 사용을 촉진합니다.
ngageoint/hootenanny
기계학습을 활용하여 여러 지리공간 데이터셋을 하나의 원활한 지도로 통합하는 오픈소스 지도 데이터 통합 도구입니다.
facebookresearch/pytorch3d
3D 컴퓨터 비전 연구를 위한 PyTorch 기반 라이브러리로, 미분 가능한 렌더링과 3D 메쉬 및 포인트 클라우드 조작을 위한 효율적인 도구를 제공합니다.
luxonis/depthai-core
Luxonis DepthAI 하드웨어와 연동하여 공간 AI 및 컴퓨터 비전 애플리케이션을 구축하기 위한 C++ 및 Python 라이브러리입니다.