Xiaoqi-Zhao-DLUT/MSNet-M2SNet
MSNet과 M2SNet 아키텍처를 갖춘 의료 영상 세그멘테이션 프레임워크로, 다중 스케일 빼기를 사용해 폴립 및 폐 감염과 같은 병변을 정확히 분리합니다.
MrBlankness/LightM-UNet
LightM-UNet은 UNet과 Mamba의 경량 융합으로, 단 1M의 파라미터만으로 높은 성능을 제공하는 의료 영상 세그멘테이션 모델입니다.
OvidijusParsiunas/myvision
자동 바운딩 박스 생성 및 데이터셋 형식 변환을 지원하여 컴퓨터 비전 ML 학습 데이터를 생성할 수 있는 무료 온라인 이미지 어노테이션 도구입니다.
laugh12321/TensorRT-YOLO
NVIDIA 디바이스에서 YOLO 시리즈 모델을 위한 고성능 추론 배포 도구로, TensorRT와 CUDA를 사용하여 전처리 및 후처리를 최적화합니다.
xiaofengShi/CHINESE-OCR
텍스트 방향 감지, CTPN을 통한 영역 검출, CRNN을 통한 엔드투엔드 문자 인식을 결합한 자연 장면에서의 중국어 OCR을 위한 포괄적인 파이프라인입니다.
guochengqian/openpoints
PointNet 및 PointNeXt와 같은 모델을 위한 포인트 기반 포인트 클라우드 이해 방법의 벤치마킹과 재현을 가능하게 하는 표준화된 엔진을 제공하는 라이브러리.
oculus-samples/Unity-PassthroughCameraApiSamples
Quest 3/3S 헤드셋의 파스스루 카메라 API를 사용하여 MR 애플리케이션용으로 원시 카메라 데이터와 메타데이터에 접근하는 Unity 샘플 세트입니다.
CNES/cars
CARS는 위성 이미지를 사용하여 사진 측량을 통해 수치 표면 모델(DSM)을 생성하는 오픈 소스 다중 뷰 스테레오 프레임워크입니다.
photonixapp/photonix
객체 인식과 색상 분석을 사용하여 사진 컬렉션을 자동으로 정리하고 필터링하는 자체 호스팅 사진 관리 앱
Xiaohan-Chen/bear_fault_diagnosis
진동 데이터를 사용하여 회전 기계의 베어링 고장을 진단하기 위한 다중 스케일 CNN-LSTM 모델의 PyTorch 구현.
ShiqiYu/OpenGait
인간 식별 및 건강 스크리닝을 위한 유연하고 확장 가능한 보행 분석 프레임워크로, 실루엣, 스켈레톤, LiDAR 포인트 클라우드와 같은 여러 모달리티를 지원합니다.
jinlife/Synology_Photos_Face_Patch
지원되지 않는 NAS 하드웨어에서 GPU 요구 사항을 우회하여 Synology Photos의 얼굴 및 객체 인식 기능을 활성화하는 패치입니다.
YuChuang1205/PAL
전체 마스크 대신 단일점 레이블만을 사용하여 높은 성능을 달성할 수 있는 적외선 소형 타겟 탐지를 위한 프로그레시브 액티브 러닝 프레임워크.
azxcvn/mpv-android-anime4k
libmpv를 기반으로 한 안드로이드 동영상 플레이어로, Anime4K 알고리즘을 사용하여 애니메이션 및 애니메이션 영상의 실시간 슈퍼레졸루션 확대를 제공합니다.
oculix-org/SikuliX1
컴퓨터 비전 기반의 자동화 도구로, 이미지 인식을 통해 화면 요소를 식별하고 마우스와 키보드 입력을 시뮬레이션하여 상호작용합니다.
ruoyuw22-byte/NeuroMorph-Assessment
CAT12 처리를 통합한 자동화된 구조적 MRI 모르포메트리 시스템으로 뇌 조직 부피를 측정하고 정량적 보고서를 생성합니다.
hcliucs/APSD
이미지 내 적대적 섭동의 은폐성을 평가하기 위한 인간 중심의 프레임워크와 새로운 데이터셋 (APSD) 및 어텐션 기반 예측 모델 (A2SM)을 제공합니다.
OCR4all/OCR4all
역사적 인쇄물 및 초기 간행물의 고품질 텍스트 인식을 위해 특별히 설계된 반자동 OCR 워크플로우를 제공하는 오픈 소스 도구입니다.
jakobwilm/slstudio
단일 카메라와 프로젝터를 사용하여 실시간 3D 구조광 스캐너를 구축하기 위한 오픈 소스 프레임워크입니다.
jenly1314/WeChatQRCode
OpenCV 기반의 WeChat QR 엔진을 포팅하여 더 빠르고 다중 코드 스캔 및 디코딩을 지원하는 Android QR 코드 인식 라이브러리입니다.
zju3dv/Wis3D
Wis3D는 컴퓨터 비전 연구자를 위한 웹 기반 3D 시각화 도구로, Python에서 3D 경계 상자, 포인트 클라우드, 메시를 직접 가져와 볼 수 있습니다.
D-Ogi/WatermarkRemover-AI
Florence-2 및 LaMA 모델을 사용하여 이미지와 AI 생성 영상에서 워터마크를 감지하고 매끄럽게 제거하는 AI 기반 도구입니다.
zju3dv/LoG
LoG는 단일 RTX 4090 GPU에서 Gaussian Splatting을 사용하여 고도로 사실적인 도시 규모 3D 모델을 학습하고 실시간으로 렌더링하기 위한 프레임워크입니다.
zju3dv/DetectorFreeSfM
전통적인 특징점 검출기에 의존하지 않고 이미지로부터 3D 장면을 재구성하는 검출기 없는 Structure from Motion (SfM) 시스템으로, Image Matching Challenge 2023에서 최고 성적을 거두었습니다.
zju3dv/EasyMocap
RGB 비디오에서 마커 없는 인체 동작 캡처 및 새로운 시점 합성을 위한 오픈소스 툴박스로, 다중 뷰 설정부터 인터넷 비디오까지 다양한 입력 소스를 지원합니다.
zju3dv/GVHMR
GVHMR은 단안 비디오에서 세계 좌표계에 접지된 3D 인체 동작을 복원하는 SIGGRAPH-Asia 2024 연구 코드베이스입니다. 시각적 주행 거리 측정(DPVO 또는 SimpleVO)과 중력 정렬 좌표계를 결합하여 즉시 실행 가능한 데모 스크립트, Colab/HuggingFace 데모, 그리고 3DPW, RICH, EMDB에서 벤치마크 결과를 재현하기 위한 스크립트를 제공합니다.
zju3dv/EasyVolcap
신경 볼륨 비디오 연구를 가속화하기 위한 PyTorch 라이브러리로, 볼륨 비디오 캡처, 재구성 및 렌더링을 위한 도구를 제공합니다.
zju3dv/snake
Deep Snake는 학습 가능한 액티브 컨투어(snake) 모듈을 사용하는 실시간 인스턴스 세그멘테이션을 위한 오픈소스 CVPR 2020 구현체입니다. 이 저장소는 Cityscapes, KITTI, SBD에 대한 사전 학습된 모델을 제공하며, 평가, 속도 테스트, 시각화, 데모 추론 및 학습(Cityscapes는 2단계, KITTI/SBD는 1단계)을 위한 명령줄 도구를 포함합니다. 모든 기능은 YAML 설정 파일로 구동되며, TensorBoard 로그를 통해 모니터링할 수 있습니다. 빠르고 정확한 마스크 예측이 필요한 연구자와 엔지니어에게 적합합니다.
nghorbani/amass
인체 모션 캡처를 위한 통합 데이터베이스 및 툴킷으로, 다양한 마커 기반 데이터셋을 애니메이션 및 딥러닝 학습을 위한 공통 프레임워크로 통합합니다.
HenriquesLab/ZeroCostDL4Mic
코딩 전문 지식 없이도 현미경 연구자들이 딥러닝 네트워크를 학습하고 사용할 수 있도록 그래픽 인터페이스를 갖춘 무료 오픈 소스 Google Colab 노트북 툴박스입니다.
zju3dv/OnePose_Plus_Plus
OnePose++는 CAD 모델이 필요 없으며 키포인트를 사용하지 않는 1샷 물체 자세 추정 시스템으로, 물체의 3차원 위치와 방향을 결정합니다.
zju3dv/AutoRecon
AutoRecon은 RGB 이미지 세트에서 개별 객체를 자동으로 탐지하고 신경 SDF 표면으로 재구성하여 표준 메시 파일을 내보내는 연구용 파이프라인입니다. 거친 객체 분해 단계(AutoDecomp)와 nerfstudio/sdfstudio 기반의 신경 표면 재구성 단계를 결합하며, 데모, BlendedMVS, CO3D 데이터셋용 실행 가능한 스크립트를 제공합니다.
naver/must3r
MUSt3R은 다중 시점 3D 재구성용 연구용 Python 라이브러리입니다. DUSt3R 모델을 대칭 처리, 다층 메모리, 온라인 자세 추정 기능으로 확장하여, 순서 없는 이미지 세트의 오프라인 재구성과 비디오 또는 웹캠 스트림에서의 실시간 SLAM 스타일 맵핑을 가능하게 합니다. 리포지토리는 설치 스크립트, 여러 사전 학습된 ViT 기반 체크포인트(224px 및 512px), Gradio/viser 및 Open3D 데모 인터페이스, 완전한 학습 파이프라인을 제공합니다. 비영리 라이선스로 배포되며, 데이터셋 이용 조건이 제한적입니다.
lucidrains/perceiver-pytorch
Perceiver 및 Perceiver IO 아키텍처(및 소규모 실험적 변형)를 구현한 PyTorch 라이브러리입니다. 즉시 사용 가능한 Perceiver, PerceiverIO 및 PerceiverLM 클래스를 제공하며, 푸리에 위치 인코딩을 지원하고 pip install perceiver-pytorch를 통해 설치할 수 있습니다. 이 저장소는 대규모 멀티모달 입력을 처리하기 위한 최첨단 Transformer 모델에 중점을 둔 AI/ML 프로젝트입니다.
zcablii/LSKNet
Large Selective Kernel 메커니즘을 사용하여 수용 영역을 동적으로 조정함으로써 객체 탐지 및 분할 성능을 향상시키는 원격 탐사용 경량 기반 백본입니다.
zju3dv/NeuralRecon-W
통제되지 않은 실제 환경에서 캡처된 이미지로부터 고품질 3D 메시를 재구성하도록 설계된 신경망 3D 재구성 프레임워크.
HongwenZhang/PyMAF
PyMAF 및 PyMAF-X는 피라미드형 메시 정렬 피드백 루프를 사용하여 단안 이미지와 비디오에서 3D 인체 포즈와 형태를 회귀하는 프레임워크입니다.
zju3dv/ENeRF
ENeRF는 효율적인 신경 렌지안스 필드를 구현하는 연구용 코드베이스로, 인터랙티브(~20–50 FPS) 자유 시점 영상 구현을 가능하게 합니다. DTU에서의 학습, 특정 스캔 또는 인간 캡처 데이터에서의 피니튜닝, 표준 지표를 통한 평가, 실시간 렌더링용 GUI를 제공합니다. 데이터셋 다운로드 지침, 사전 학습된 DTU 모델, 멀티 GPU 학습 및 평가를 위한 상세 명령어를 포함합니다.
PABannier/sam3.cpp
SAM 2, 2.1, 3 및 EdgeTAM을 사용한 고성능 이미지 및 비디오 세그멘테이션을 위한 포터블 C++ 라이브러리. Python 및 CUDA 필요 없음.
Joey-S-Liu/MedSAM3
경계 상자나 점이 필요 없이 다양한 모달리티에서 의료 개념을 사용하여 대상을 식별하고 세그멘테이션하는 텍스트 기반 의료 영상 세그멘테이션 모델
sunsmarterjie/yolov12
어텐션 메커니즘의 정확도와 CNN 기반 탐지기의 속도를 결합한 어텐션 중심의 실시간 객체 탐지 프레임워크.
emilianavt/OpenSeeFace
OpenSeeFace는 ONNX로 내보낸 MobileNetV3 모델을 기반으로 구축된 오픈 소스 CPU 전용 얼굴 랜드마크 추적기(66개 포인트)입니다. UDP를 통해 랜드마크, 시선, 눈 깜빡임 데이터를 스트리밍하여 Unity, Godot, VSeeFace 등에서 실시간 아바타 애니메이션을 구현합니다. 다양한 모델 크기를 통해 속도(최대 213 fps)와 정확도 사이의 균형을 맞출 수 있습니다. 이 프로젝트에는 데이터 수신, 포인트 시각화, IK 구동 및 소규모 SVM 기반 표정 분류기 학습을 위한 Unity 구성 요소가 포함되어 있습니다. 저조도, 노이즈 및 부분적 가림 현상에서도 안정적으로 작동하지만 눈 영역의 정밀도는 보통 수준이며, 30 fps로 단일 얼굴을 추적할 때 CPU 코어 하나를 거의 다 사용합니다. BSD-2-clause 라이선스로 제공됩니다.
zju3dv/4K4D
새로운 시점에서 동적 장면의 고해상도 4K 렌더링을 가능하게 하는 실시간 4D 뷰 합성 시스템.
huggingface/gsplat.js
브라우저에서 3D Gaussian Splatting 데이터를 렌더링하기 위한 JavaScript 라이브러리로, three.js와 유사한 고수준 API를 제공합니다.
FeiYull/TensorRT-Alpha
TensorRT‑Alpha는 주요 컴퓨터 비전 모델(YOLO, EfficientDet, U‑2‑Net 등)을 PyTorch에서 ONNX를 거쳐 TensorRT로 변환하고, 멀티 배치 전처리, 디코딩 및 NMS가 포함된 즉시 사용 가능한 추론 파이프라인을 제공하는 C++/CUDA 툴킷입니다. Ubuntu 18.04 및 Windows 10 GPU 환경을 지원합니다.
huridocs/pdf-document-layout-analysis
PDF 레이아웃 분석, OCR 및 콘텐츠 추출을 위한 Docker 기반 마이크로 서비스로, PDF를 구조화된 Markdown 또는 HTML로 변환하고 자동 번역을 지원합니다.
zju3dv/street_gaussians
Street Gaussians는 3-D Gaussian splatting을 확장하여 동적 거리 장면(예: Waymo 데이터)을 재구성하고 렌더링하기 위한 연구용 코드베이스입니다. 데이터 변환 도구, 학습/평가 스크립트, 선택적 LiDAR 깊이/스카이 마스크 전처리 기능을 제공하며, 모두 구성 가능한 YAML 파이프라인으로 래핑되어 있습니다.
zju3dv/InfiniDepth
InfiniDepth는 단일 RGB 이미지(또는 RGB + 희소 깊이)를 임의 해상도의 깊이 맵 및 3D Gaussian‑splatting 모델로 변환하는 CVPR‑2026 프로젝트입니다. 즉시 실행 가능한 추론 스크립트, Hugging Face Gradio 데모, 다중 뷰 비디오 처리, 그리고 사용자 정의 데이터 미세 조정을 위한 전체 학습 파이프라인을 제공합니다.