MCG-NJU/MOTIP

MOTIP는 트래킹을 인컨텍스트 ID 예측 문제로 취급하여 현재 탐지된 객체에 대한 ID 레이블을 직접 디코딩하는 다중 객체 트래킹 프레임워크입니다.

xiaobiaodu/Mobile-GS

Mobile-GS는 모바일 장치에서 고품질 3D 장면 렌더링을 가능하게 하는 실시간 가우시안 스플래터링 프레임워크입니다.

allenai/olmoearth_pretrain

지구 관측을 위한 멀티모달 시공간 기초 모델 제품군, 위성 데이터를 사용하여 데모스피어 플래닛 인텔리전스를 위한 확장 가능한 프레임워크를 제공합니다.

Tsinghua-MARS-Lab/SLAM-Former

이미지 시퀀스로부터 3D 재구성과 카메라 추적을 위한 로컬라이제이션과 매핑을 하나의 모델로 통합하는 Transformer 기반 SLAM 시스템.

alicevision/CCTag

동심원으로 구성된 원형 피듀셜 마커의 검출 및 정확한 위치 추정을 위한 컴퓨터 비전 라이브러리입니다.

81NewArk/AntiCAP-WebApi

모델 추론을 사용하여 CAPTCHA를 해결하는 웹 API 서비스로, 로컬 및 공공 네트워크 배포를 지원합니다.

bhky/opennsfw2

이미지 및 동영상 내의 음란물 콘텐츠를 감지하기 위한 Yahoo Open-NSFW 모델의 Keras 구현체입니다.

RenderKit/oidn

몬테카를로 노이즈를 제거함으로써 레이 트레이싱 애플리케이션의 렌더링 시간을 단축하는 딥러닝 기반 고성능 필터 라이브러리입니다.

myBoris/wzry_ai

기계 학습과 사용자 정의 화면 좌표 매핑을 활용하여 헌터 오브 코링스의 게임 플레이를 자동화하는 오픈소스 AI 모델 프로젝트입니다.

LuisaGroup/LuisaRender

CUDA, DirectX, Metal 등의 여러 하드웨어 백엔드를 지원하는, 스트림 아키텍처용 고성능 크로스플랫폼 몬테카를로 렌더러입니다.

henrywoo/kazam

화면 캡처에서 텍스트를 추출하는 AI 기반 OCR을 포함한 Linux용 스크린 레코더 및 브로드캐스터.

wenbowen123/BundleTrack

BundleTrack은 객체나 해당 카테고리의 3D CAD 모델 없이도 새로운 객체의 실시간 6D 포즈 트래킹을 수행하는 프레임워크입니다.

OpenStitching/stitching

OpenCV를 사용하여 중첩 이미지에서 파노라마를 생성하는 빠르고 견고한 이미지 스티칭용 Python 패키지입니다.

NativeSensors/EyeGestures

고가의 전용 하드웨어 대신 표준 웹캠과 스마트폰 카메라를 사용하여 눈 제어 인터페이스를 구현할 수 있는 오픈소스 눈 추적 라이브러리.

facebookresearch/projectaria_tools

Project Aria AR 안경에서 발생하는 센서 및 기계 인식 데이터를 처리하고 분석하기 위한 C++/Python 유틸리티 세트로, AI 및 기계 인식 연구를 지원합니다.

FaceAISDK/FaceAISDK_Android

클라우드 연결이 필요 없는 Android용 오프라인 온디바이스 얼굴 인식 SDK로, 얼굴 감지, 인식, 라이브니스 검출을 모두 제공합니다.

facebookresearch/Ego4d

Ego4D와 Ego-Exo4D를 위한 툴킷 및 데이터셋 인프라스트럭처로, 대규모 1인칭 및 멀티뷰 비디오 데이터셋을 다운로드, 처리 및 모델 학습에 사용할 수 있는 도구를 제공합니다.

yuxumin/PoinTr

PoinTr는 기하학적 인지 인코더-디코더 아키텍처를 사용하여 부분적인 포인트 클라우드로부터 완전한 3D 객체를 재구성하는 Transformer 기반의 포인트 클라우드 완성 모델입니다.

MeshInspector/MeshLib

다양한 프로그래밍 언어에서 작동하는 고성능 3D 메시 처리 SDK로, 3D 데이터의 복구, 최적화 및 조작을 제공합니다.

hbb1/2d-gaussian-splatting

2D 방향성 디스크(surfels)를 사용하여 기하학적으로 정확한 레디언스 필드와 고품질 3D 메시를 생성하는 2D 가우스 스플래팅 구현입니다.

nipreps/fmriprep

최신 신경영상 도구들을 조합하여 운동 보정, 정규화, 뇌 추출을 자동화하는 fMRI 데이터용 강력한 전처리 파이프라인입니다.

lolishinshi/imsearch

작은 자르기된 스크린샷을 사용하여 대규모 데이터셋에서 전체 이미지를 특징점 매칭으로 찾는 도구.

cdcseacave/openMVS

OpenMVS는 희소 점군과 카메라 자세를 세밀하고 텍스처가 있는 3D 메시로 변환하는 다중 시점 입체 재구성 라이브러리입니다.

microsoft/BiomedParse

9가지 영상 모달리티에 걸쳐 생물의학적 객체의 통합 세그멘테이션, 탐지, 인식을 가능하게 하는 기초 모델로, 2D 및 3D 볼륨 추론을 모두 지원합니다.

thiagotigaz/ocr-it

텍스트 선택이 비활성화된 페이지 구분 웹 문서 및 뷰어에서 로컬 OCR을 사용하여 텍스트를 추출하는 Chrome 및 Firefox 확장 프로그램입니다.

ohirose/bcpd

BCPD는 점군 및 함수(DET)의 베이지안 비강체 정렬을 위한 MATLAB 호환 명령줄 스위트이며, 가속화된 "++" 모드, 다양한 커널 옵션, 그리고 3D 재구성, 형태 전송, 공간 오믹스 데이터를 위한 데모를 제공합니다.

facebook/ThreatExchange

유사성 매칭을 위한 이미지 및 동영상 해시 알고리즘을 포함한 콘텐츠 모더레이션 및 보안 위협 인텔리전스를 위한 도구 및 API 모음입니다.

Linfeng-Tang/Image-Fusion

다중 모달, 디지털 사진, 원격 탐사 이미지 조합 기술을 포함하는, 이미지 융합에 대한 연구 논문과 코드 구현의 포괄적 컬렉션.

freesurfer/freesurfer

FreeSurfer는 구조적 및 기능적 연구에서 나온 인간 뇌 MRI 데이터를 처리, 분석, 시각화하기 위한 오픈소스 소프트웨어 스위트입니다.

dipy/dipy

DIPY는 MR 확산 영상 분석을 위한 Python 라이브러리로, 연구자들이 의료 영상 데이터를 처리할 수 있도록 도구를 제공합니다.

NVIDIA-AI-IOT/Lidar_AI_Solution

3D Lidar 인식을 위해 고도로 최적화된 CUDA 및 TensorRT 구현 모음으로, 자율 주행 시스템의 희소 합성곱(sparse convolutions) 및 센서 퓨전을 가속화합니다.

the-database/mpv-AnimeJaNai

TensorRT 또는 DirectML을 사용하여 애니메이션 콘텐츠의 실시간 4K 업스케일링을 가능하게 하는 커스텀 mpv 비디오 플레이어 빌드 및 Real-ESRGAN 모델 세트.

naver/anny

Anny는 모든 연령대를 포괄하는 오픈소스 PyTorch 기반의 미분 가능한 인간 몸체 메시 모델입니다. 여러 리그(컴팩트한 104본 기본값, 전체 MakeHuman), 여러 메시 위상(SMPL-X 및 SOMA 포함), 그리고 세밀한 형태, 로컬 변경, 얼굴 액션 매개변수를 제공합니다. pip를 통해 설치하고, 빠른 Python 예제를 실행하여 .ply 메시를 출력하거나, 인터랙티브 Gradio 데모를 시작할 수 있습니다. 이 라이브러리는 Apache-2.0 라이선스를 적용받으며, MakeHuman 에셋을 기반으로 하며, 자세 추정, 애니메이션, 연령대 간 몸체 모델링과 같은 연구/프로덕션 작업을 위해 설계되었습니다.

arcships/light-ocr

Node.js 및 C++용 빠르고 오프라인의 OCR 라이브러리로, 내장된 하드웨어 가속을 통해 이미지와 PDF의 로컬 텍스트 인식을 제공합니다.

kha-white/manga-ocr

일본 만화에 특화되어 최적화된 OCR 도구로, 다중 라인 텍스트, 후리가나, 그리고 세로·가로 레이아웃을 인식할 수 있습니다.

open-edge-platform/geti

컴퓨터 비전 AI 모델 구축을 위한 엔드투엔드 플랫폼으로, 주석(annotation), 학습, 그리고 엣지 하드웨어 배포를 위한 최적화 도구를 제공합니다.

voxelmorph/voxelmorph

신경망을 사용하여 이미지를 정렬하고 변형을 모델링하는 학습 기반 이미지 등록 라이브러리로, SynthMorph를 통한 대비 불가지론적(contrast-agnostic) 학습이 특징입니다.

JEOresearch/EyeTracker

영상 또는 이미지 데이터에서 눈동자 타원을 검출하는 경량 Python 기반 3D 눈 추적 알고리즘입니다.

hank-ai/darknet

C/C++ 및 CUDA로 작성된 오픈소스 신경망 프레임워크로, YOLO 실시간 객체 탐지 시스템을 구동합니다.

hku-mars/GS-SDF

Gaussian Splatting과 신경망 Signed Distance Fields (SDF)를 결합하여 기하학적으로 일관된 실사 렌더링과 3D 표면 재구성을 구현하는 LiDAR 증강 시스템입니다.

stereolabs/zed-sdk

ZED 카메라를 위한 크로스 플랫폼 공간 인지 SDK로, 실시간 깊이 감지, 객체 탐지 및 위치 추적을 제공합니다.

shimat/opencvsharp

C# 개발자에게 포괄적인 컴퓨터 비전 및 이미지 처리 기능을 제공하는 OpenCV용 크로스 플랫폼.NET 래퍼입니다.

leblancfg/autocrop

Python 기반 도구로 YuNet 신경망을 사용해 가장 크게 감지된 얼굴을 자동으로 크롭합니다. 프로필 사진 및 신분증에 이상적입니다.

imagej/ImageJ

ImageJ는 Java를 사용하여 여러 플랫폼에서 실행되도록 설계된 과학적 이미지를 처리하고 분석하기 위한 퍼블릭 도메인 소프트웨어입니다.

kha-white/mokuro

일본어 만화에 대한 텍스트 검출 및 OCR을 수행하여 브라우저에서 선택 가능한 텍스트 오버레이를 생성하는 도구로, 언어 학습자의 팝업 사전 사용을 촉진합니다.

ngageoint/hootenanny

기계학습을 활용하여 여러 지리공간 데이터셋을 하나의 원활한 지도로 통합하는 오픈소스 지도 데이터 통합 도구입니다.

facebookresearch/pytorch3d

3D 컴퓨터 비전 연구를 위한 PyTorch 기반 라이브러리로, 미분 가능한 렌더링과 3D 메쉬 및 포인트 클라우드 조작을 위한 효율적인 도구를 제공합니다.

luxonis/depthai-core

Luxonis DepthAI 하드웨어와 연동하여 공간 AI 및 컴퓨터 비전 애플리케이션을 구축하기 위한 C++ 및 Python 라이브러리입니다.