imagej/imagej2
ImageJ2는 다차원 이미지 데이터 지원 및 여러 프로그래밍 언어에 걸친 헤드리스 처리를 위해 기존 ImageJ를 확장한 과학적 이미징 프레임워크입니다.
unrealcv/unrealcv
컴퓨터 비전 연구자들이 PyTorch 및 TensorFlow와 같은 외부 AI 프레임워크를 사용하여 가상 세계를 구축하고 상호작용할 수 있게 해주는 Unreal Engine용 플러그인입니다.
microsoft/Cognitive-Samples-VideoFrameAnalysis
Microsoft Cognitive Services Vision API를 사용하여 웹캠 비디오 프레임을 준실시간으로 분석하기 위한 C# 라이브러리 및 샘플 애플리케이션.
zhanghang1989/PyTorch-Encoding
이미지 분류 및 세맨틱 세그멘테이션을 위한 고급 인코딩 모듈과 모델 주(zoo)를 제공하는 PyTorch 라이브러리입니다.
apple-aiml-research/ml-aim
멀티모달 이해 및 이미지 인식에 높은 성능을 제공하는 대규모 자기회귀형 비전 인코더 패밀리입니다.
hzxie/GaussianCity
GaussianCity는 Gaussian Splatting을 사용하여 무한한 대규모 도시 환경을 생성하는 생성형 3D 도시 합성 도구입니다.
HarborYuan/ovsam
수천 개의 객체 클래스에 대한 동시에 상호작용형 분할과 개방형 어휘 인식을 가능하게 하는 Segment Anything Model (SAM)의 개방형 어휘 확장입니다.
hzxie/CityDreamer
CityDreamer은 레이아웃 생성기, 배경 요소 생성기, 건물 인스턴스 생성기를 결합하여 무한하고 사실적인 3D 도시 풍경을 생성하는 연구용 PyTorch 프레임워크입니다. 대규모 OSM/GoogleEarth 데이터셋에서의 훈련 코드, 사전 학습된 체크포인트, 웹 데모, 동영상 렌더링을 위한 CLI를 포함합니다.
cvg/DeepLSD
DeepLSD는 딥러닝과 이미지 기울기를 결합하여 현실 세계 이미지에서 선분을 추출하고 정제하는 고정밀 선분 검출기입니다.
VCIP-RGBD/DFormer
DFormer은 RGB‑D 세그멘테이션을 위한 연구용 코드베이스로, DFormer, DFormerv2(지오메트리 가이드 애티튜드) 및 DFormer++(효율적이고 고정확도 변형)을 구현합니다. 사전 훈련 스크립트, 데이터셋 헬퍼, 훈련/평가 파이프라인, NYU‑Depth v2 및 SUN‑RGBD용 사전 학습 가중치를 포함합니다. 이 리포지토리는 진정한 AI/ML 프로젝트입니다.
ria-com/nomeroff-net
YOLOv8과 RNN 기반 OCR을 사용하여 여러 국가의 번호판을 자동으로 검출하고 읽는 오픈소스 파이썬 프레임워크입니다.
google-ar/arcore-unity-extensions
Unity의 AR Foundation을 위해 Google ARCore의 증강 현실(AR) 기능에 대한 네이티브 API 액세스를 제공하는 확장 기능 세트입니다.
QuinnDamerell/OctoPrint-OctoEverywhere
AI 기반 인쇄 실패 감지 기능을 갖춘 3D 프린터용 원격 액세스 및 모니터링 서비스로, 실패한 인쇄를 자동으로 중단합니다.
half-potato/radiance_meshes
이미지로부터 3D 장면의 볼륨 재구성을 가능하게 하며, 모바일 웹 환경에서의 모델 최적화 옵션을 제공하는 Radiance Meshes용 학습 프레임워크입니다.
tensorflow/graphics
TensorFlow를 위한 미분 가능한 그래픽 및 기하학 레이어 라이브러리로, '분석을 통한 합성' 방식을 통해 3D 비전 모델의 자기 지도 학습을 가능하게 합니다.
HasnainRaz/Fast-SRGAN
SR-GAN 기반의 실시간 슈퍼레졸루션 구현으로, 피크셀 셔플을 사용해 저해상도 동영상을 고해상도로 효율적으로 확대합니다.
levyflux/AViD
AViD는 LoRA와 EMA를 사용하여 Grounding DINO를 미세 조정하는 프레임워크로, 오픈-보리ュ움 객체 탐지기를 사용자 정의 데이터셋에 효율적으로 적응시킬 수 있게 합니다.
lartpang/SAMs-CDConcepts-Eval
이미지 및 비디오 전반에서 의료 병변 및 산업 결함과 같은 문맥 의존적 개념을 분할하는 SAM 및 SAM 2의 능력을 테스트하기 위한 종합적인 평가 프레임워크입니다.
Luo-Yihao/FaithC
SDF와 Marching Cubes를 대체하여 날카로운 에지와 내부 구조를 보존하는 거의 손실 없는 3D 복셀 표현 시스템. Faithful Contour Tokens (FCTs)를 사용하여 구현.
google-ar/arcore-ios-sdk
Google의 크로스플랫폼 ARCore 기능(클라우드 앵커 및 지오스페이셜 API 등)을 iOS 애플리케이션에 제공하는 소프트웨어 개발 키트입니다.
arthurflor23/handwritten-text-recognition
TensorFlow 기반의 프레임워크로, 광범위한 데이터 증강과 여러 표준 HTR 데이터셋을 지원하는 손글씨 텍스트 인식 및 합성 기능을 제공합니다.
openMVG/openMVG
이미지(사진측량)에서의 3D 재구성용 C++ 프레임워크로, 구조-운동 문제를 해결하기 위한 라이브러리와 파이프라인을 제공합니다.
argoverse/argoverse-api
자율주행 연구를 위한 HD 지도, 3D 추적 데이터, 운동 예측 시퀀스에 접근할 수 있는 Python API입니다.
ShenhanQian/VHAP
VHAP은 단안 및 다안 영상에서 머리카락과 귀와 같은 랜드마크가 없는 영역을 적응적 외관 사전 지식을 사용하여 추적하는 광도 최적화 파이프라인입니다.
lartpang/PySODMetrics
Matlab 기반 평가 도구 상자 대신 빠르고 검증 가능한 방법으로 현저 객체 탐지(SOD) 메트릭을 계산하는 가벼운 파이썬 라이브러리입니다.
naruya/gaussian-vrm
웹, 모바일, VR 애플리케이션에서 현실감 있고 애니메이션 가능한 3D 캐릭터를 렌더링할 수 있는 three.js 기반의 인스턴트 스킨 처리된 가우시안 아바타 구현입니다.
worldcoin/open-iris
컴퓨터 비전과 머신러닝을 활용한 고도화된 고유 인식 파이프라인으로, 안전한 생체 인식 인증 및 대규모 고유성 확인을 실현합니다.
MrGiovanni/SyntheticTumors
AI 세그멘테이션 모델을 훈련하기 위해 수동으로 레이블링된 의료 영상 데이터에 대한 의존도를 줄이기 위한 현실적인 합성 종양 생성을 위한 프레임워크입니다.
MrGiovanni/AbdomenAtlas
인간-인공지능 협업 AI를 활용해, 복부 세그멘테이션을 위한 대규모 다장기 CT 데이터셋과 도구 세트를 제공하여, 아노테이션 시간을 수십 년에서 수주로 단축합니다.
foo123/FILTER.js
WebGL, WebAssembly, Web Workers를 통해 하드웨어 가속을 지원하는 순수 자바스크립트 이미지 및 비디오 처리 및 컴퓨터 비전 라이브러리입니다.
Unity-Technologies/arfoundation-samples
AR Foundation를 사용하여 다중 플랫폼 증강현실 기능을 구현하는 데 도움이 되는 공식 Unity 샘플 씬과 코드 모음입니다.
pyushkevich/itksnap
ITK-SNAP은 의료 영상에서 해부학적 구조의 사용자 주도 3D 활성 윤곽선 세그멘테이션을 위한 오픈소스 소프트웨어 애플리케이션입니다.
tudelft-iv/view-of-delft-dataset
도시 교통에서 도로 이용자의 3D 경계 상자 레이블이 포함된 동기화된 LiDAR, 카메라, 3+1D 레이더 데이터를 포함하는 다중 센서 자동차 데이터셋.
dstndstn/astrometry.net
Astrometry.net은 천체 위치가 알려지지 않은 이미지에 대해 천체 좌표와 보정 메타데이터를 자동으로 제공하는 도구입니다.
ducha-aiki/pydegensac
희소 이미지 대응 관계로부터 호모그래피 행렬과 기본 행렬을 추정하기 위한 Python 래퍼 (LO-RANSAC 및 DEGENSAC 사용)
mapillary/OpenSfM
Python 기반의 구조에서 운동(SfM) 라이브러리로, 여러 이미지에서 3D 장면과 카메라 포즈를 재구성하고 센서 데이터를 통합하여 지리적 정렬을 수행합니다.
bcmi/Image-Harmonization-Dataset-iHarmony4
iHarmony4라는 대규모 이미지 조화 데이터셋과 DoveNet의 PyTorch 구현을 제공하여, 합성 이미지에 삽입된 객체가 자연스럽게 보이도록 하는 모델 개발을 지원합니다.
Pointcept/Concerto
3D 포인트 클라우드에서 고품질 공간 표현을 추출하기 위한 공동 2D-3D 자기지도 사전 훈련된 Point Transformer V3 모델.
hanna-xu/U2Fusion
레이블이 지정된 훈련 데이터 없이 다중 모달, 다중 노출 및 다중 초점 이미지를 하나의 고품질 이미지로 융합하는 통합 비지도 이미지 융합 네트워크입니다.
IvanDrokin/torch-conv-kan
TorchConv‑KAN은 각 커널이 학습 가능한 일변수 함수(KAN, Fast‑KAN, Cheby‑KAN 등)의 집합인 합성곱 레이어를 구현하는 PyTorch 라이브러리입니다. 다양한 레이어 변종, CNN 스타일 모델 패밀리(ResKANet, DenseKANet, VGG‑KAN, U‑Net‑KAN), 사전 학습된 ImageNet‑1k 체크포인트, Accelerate, Hydra, WandB, Ray‑Tune를 사용하는 학습 스크립트를 포함합니다. 프로젝트는 현재 활발히 개발 중이며, 콜모고로프-아르노르드 합성곱에 관한 연구 논문과 함께 제공됩니다.
MIC-DKFZ/nnDetection
의료 영상 내 객체의 동시에 위치 파악과 분류를 위한 자기 설정 프레임워크로, 설정 프로세스를 자동화하여 다양한 의료 탐지 문제에 적응합니다.
Mark12Ding/SAM2Long
SAM2Long은 오류 누적을 방지하고 장시간 동영상에서의 오브젝트 세그멘테이션을 향상시키기 위한, 학습이 필요 없는 SAM 2의 개선 기술입니다.
Altaheri/EEG-ATCNet
뇌-컴퓨터 인터페이스를 향상시키기 위해 운동 상상 EEG 신호를 분류하기 위한 Attention Temporal Convolutional Network (ATCNet)의 TensorFlow 구현.
Sompote/DINOV3-YOLOV12
YOLOv12와 DINOv3를 결합한 하이브리드 객체 탐지 프레임워크로, 특히 소규모 또는 복잡한 데이터셋에서 뛰어난 정확도와 빠른 수렴을 제공합니다.
schappim/macOCR
Apple의 Vision 프레임워크를 사용하여 화면, 이미지 또는 PDF에서 텍스트, QR 코드 및 바코드를 추출하는 macOS용 명령줄 OCR 도구입니다.
EyeTrackVR/EyeTrackVR
OSC 및 UDP 프로토콜을 통해 VRChat에서 눈 추적을 가능하게 하는 오픈소스이며 저렴한 VR 눈 추적 플랫폼입니다.
nipy/nipype
신경영상 소프트웨어에 대한 일관된 인터페이스를 제공하는 Python 프로젝트로, 다양한 패키지의 도구를 하나의 재현 가능한 워크플로우로 결합할 수 있게 합니다.
gallantlab/pycortex
Pycortex는 뇌 표면에 fMRI 및 기타 부피형 뇌영상 데이터를 시각화하기 위한 소프트웨어 라이브러리입니다.