MITK/MITK
ITK와 VTK를 결합하여 인터랙티브한 의료 영상 처리 소프트웨어를 개발하기 위한 오픈소스 C++ 툴킷입니다.
NeoGeographyToolkit/StereoPipeline
NASA가 개발한 오픈소스 자동 지오데시 및 스테레오그래메트리 도구 세트로, 스테레오 이미지를 3D 지형 모델과 지도 제작 제품으로 변환합니다.
savvasdalkitsis/uhuruphotos-android
오픈소스인 안드로이드 미디어 갤러리로, Google Photos의 대안으로 개인정보 보호에 중점을 둔 선택지를 제공하며, LibrePhotos 서버와의 선택적 통합을 통해 AI 기반 검색과 얼굴 인식 기능을 제공합니다.
soruly/trace.moe
이미지 벡터 검색을 사용하여 스크린샷의 특정 애니메이션, 에피소드, 타임스탬프를 식별하는 애니메이션 장면 검색 엔진.
gowvp/owl
GB28181, ONVIF, RTSP 스트림을 하나의 브라우저 기반 관리 시스템으로 통합하는 오픈소스 네트워크 비디오 플랫폼이며, AI 알림 기능을 지원합니다.
flatironinstitute/CaImAn
대규모 칼슘 및 전압 이미징 데이터 분석을 위한 확장 가능한 파이썬 도구상자. 모션 보정, 소스 추출, 스파이크 디컨볼루션을 위한 확장 가능한 알고리즘 제공.
ros-perception/image_pipeline
로봇 공학에서 고수준 비전 처리에 사용 가능한 형식으로 Raw 카메라 이미지를 처리하는 ROS 2 패키지입니다.
nguyenq/tess4j
Tess4J는 Tesseract OCR API용 Java JNA 래퍼로, 다양한 이미지 형식과 PDF 문서에서 텍스트를 추출할 수 있도록 합니다.
aws-samples/amazon-textract-textractor
Amazon Textract를 사용하여 문서에서 텍스트, 테이블, 폼, 신분 정보를 추출하는 것을 간소화하는 Python 패키지입니다.
yo-WASSUP/Good-GYM
RTMPose를 이용한 실시간 포즈 감지와 웹캠을 통한 자동 운동 반복 횟수 카운팅을 제공하는 AI 피트니스 어시스턴트.
TissueImageAnalytics/tiatoolbox
PyTorch 기반의 계산 병리학 도구 상자로, 데이터 로딩부터 시각화까지 엔드투엔드 API를 제공합니다.
LSH9832/edgeyolo
EdgeYOLO는 앵커 프리 객체 탐지기로, Nvidia Jetson 등 임베디드 엣지 디바이스에서 실시간 성능을 최적화했으며 TensorRT와 RKNN을 포함한 다양한 배포 형식을 지원합니다.
deltacv/VisionGraph
실시간 파이프라인 미리보기 기능을 갖춘 OpenCV 알고리즘의 생성 및 프로토타이핑을 위한 시각적 노드 에디터입니다.
apple-aiml-research/ml-fastvit
구조적 재패러미터화를 활용한 빠른 하이브리드 비전 트랜스포머로, 모바일 장치에서 저지연 이미지 분류를 달성합니다.
shaoshengsong/DeepSORT
YOLO와 ONNX Runtime을 사용하여 ByteTrack, OC-SORT, Deep OC-SORT, DeepSORT를 구현한 C++ 기반 실시간 다객체 추적 시스템입니다.
apple-aiml-research/ml-mobileone
MobileOne은 iPhone 12 Pro에서 ≤ 2ms 지연 시간으로 71–79%의 ImageNet Top-1 정확도를 달성하는 다섯 가지 초고속 CNN 백본(S0–S4)의 PyTorch 구현을 제공합니다. 리포지토리에는 학습용 및 추론용 체크포인트, 디바이스 내 배포용 CoreML 모델, iOS 벤치마크 앱(ModelBench)이 포함되어 있으며, 재패러미터화를 통해 학습 시 브랜치를 추론 시 단일 빠른 네트워크로 융합합니다.
apple-aiml-research/ml-matrix3d
Matrix3D는 단일 또는 소수의 촬영되지 않은 이미지에서 3D 재구성을 가능하게 하는 포즈 추정, 깊이 예측, 새로운 시점 합성을 통합한 포토그라메트리 모델입니다.
cvignac/DiGress
Graph Transformer 아키텍처를 사용하여 합성 그래프와 분자 구조를 생성하는 이산 노이즈 제거 확산 모델.
EasyLive2D/relive2d
Live2D 네이티브 SDK용 Python 래퍼로, 웹 엔진 없이 OpenGL을 직접 사용하여 Live2D 모델을 로드하고 렌더링할 수 있음.
HZAI-ZJNU/Mamba-YOLO
Mamba YOLO는 전통적인 아키텍처 대신 상태 공간 모델을 사용하여 실시간 탐지에 대한 효율적인 대안을 제공하는 객체 탐지 기준선입니다.
fieldtrip/fieldtrip
다양한 하드웨어 형식과 소스 재구성 기능을 지원하는 MEG, EEG, iEEG 데이터의 고급 분석을 위한 MATLAB 도구상자입니다.
sgoldenlab/simba
SimBA는 프로그래밍 기술이 필요 없는 GUI 기반 툴킷으로, 포즈 추정 영상 데이터에서 동물 행동을 자동으로 탐지하고 정량화할 수 있는 지도 학습 분류기를 연구자가 훈련할 수 있게 해줍니다. 원시 추적 데이터를 검증된 행동 분류와 풍부한 후속 분석으로 전환하여 행동 신경과학 연구를 지원합니다.
ecmwf-lab/ai-models
AI 기반 기상 예측 모델을 실행하기 위한 명령줄 도구로, 데이터 검색과 모델 실행을 위한 통합 인터페이스를 제공합니다.
isl-org/Open3D-ML
Open3D의 확장으로, 세분화 및 객체 탐지와 같은 3D 머신러닝 작업을 위한 도구, 사전 학습 모델, 파이프라인을 제공합니다.
ANTsX/ANTs
고차원 생물의학 영상의 정합과 세그멘테이션에 특화된 C++ 라이브러리로, 종과 장기계를 아우르는 뇌 구조 및 기능 분석에 사용된다.
MiniAiLive/Android-FaceRecognition
보안 및 핀테크 애플리케이션에서 스푸핑을 방지하기 위한 얼굴 인식 및 3D 패시브 생체 인식 기능을 갖춘 Android SDK입니다.
supervisely/supervisely
Supervisely는 데이터 라벨링, 모델 학습, 추론 및 협업 도구를 결합한 웹 기반 컴퓨터 비전 플랫폼입니다. 자동화를 위한 Python SDK와 REST API를 제공하며, 개발자가 헤드리스 스크립트, 대화형 UI 도구 또는 라벨링 도구 확장 기능을 생성하고 모두 한 번의 클릭으로 배포할 수 있는 앱 생태계를 제공합니다.
PozzettiAndrea/ComfyUI-DepthAnythingV3
고품질 깊이 추정, 3D 포인트 클라우드 재구성, 일관된 동영상 깊이 매핑을 위한 Depth Anything V3 통합 커스텀 ComfyUI 노드
sh4den/Montscan
Ollama를 통해 로컬 Vision AI를 사용하여 스캔한 PDF를 분석하고 설명이 포함된 파일 이름으로 자동으로 이름을 변경하는 자동화된 문서 처리기입니다.
cosanlab/py-feat
이미지와 동영상에서 얼굴을 감지하고 감정 표현, 얼굴 근육 움직임, 랜드마크를 추출하는 Python 도구 상자입니다.
Zyphra/zuna
ZUNA1.1은 3D 두피 좌표를 사용하여 EEG의 노이즈 제거, 누락 채널 재구성, 그리고 희박한 전극 배열의 업샘플링을 수행하는 오픈 소스 기반 모델입니다.
Pixel-Talk/PEAR
PEAR는 이미지나 비디오에서 100 FPS로 표현력 있는 3D 인간 메시 파라미터를 예측할 수 있는 실시간 프레임워크입니다.
scu-zjz/IMDLBenCo
이미지 수정 탐지 및 국소화를 위한 포괄적이고 모듈식 코드베이스와 표준화된 구성 요소, 최첨단 모델 구현을 제공합니다.
Mengqi-Lei/count-anything
Count Anything은 자연어 질의를 기반으로 이미지 내 객체를 카운팅하는 연구용 모델입니다. 스파스 영역 카운터와 밀집 픽셀 카운터를 결합하여 파라미터 없는 융합 단계를 통해 6개 도메인(장면, 위성, 의료 등)에서 작동합니다. 리포지토리는 사전 학습된 체크포인트, 트레이닝/평가 스크립트, 그리고 대규모 CLOC 데이터셋 준비 방법을 제공합니다.
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter는 엣지 장치에 최적화된 컴팩트한 비전 트랜스포머(ViT)를 제공하여 낮은 지연 시간으로 고성능 객체 탐지, 인스턴스 세그멘테이션, 자세 추정을 가능하게 합니다.
ultralytics/xview-yolov3
리모트 센싱 응용을 위한 xView 위성 이미지 데이터셋에서 객체 탐지를 훈련하고 실행하기 위해 특화된 YOLOv3 구현.
mlmed/torchxrayvision
흉부 X‑ray 데이터셋 및 모델을 위한 라이브러리로, 사전 학습된 모델과 통합 인터페이스를 제공하여 여러 공개 흉부 X‑ray 데이터셋을 손쉽게 사용할 수 있습니다.
tschnz/Live-Video-Magnification
Eulerian video magnification 기술을 사용하여 미세한 움직임과 색 변화를 실시간으로 증폭하는 비디오 확대 도구입니다.
lightly-ai/lightly-studio
임베딩을 사용하여 이미지 및 비디오 데이터를 효율적으로 관리하고 레이블링할 수 있는 로컬 우선 데이터 큐레이션 및 레이블링 도구입니다.
dog-qiuqiu/FastestDet
ARM CPU 및 임베디드 디바이스에서 고속 추론을 최적화한 초경량, 앵커 프리 실시간 객체 탐지 알고리즘.
open-edge-platform/dlstreamer
Intel CPU, GPU, NPU에서 하드웨어 가속된 비디오 및 오디오 지능 파이프라인을 구현할 수 있는 GStreamer 및 OpenVINO 기반 미디어 분석 프레임워크입니다.
xrdevrob/QuestCameraKit
Meta Quest 3/3S용 Unity 샘플 모음으로, 물체 감지, QR 코드 추적, 다중 모달 AI를 활용해 주변 환경을 이해하는 혼합현실 경험을 가능하게 합니다.
torch-points3d/torch-points3d
3D 분류, 세그멘테이션, 탐지를 위한 최신 모델과 고수준 API를 제공하는 점군 분석을 위한 딥러닝 프레임워크입니다.
BGU-CS-VIL/WTConv
CUDA, Metal, Triton용 최적화된 백엔드를 갖춘 웨이블릿 합성곱을 구현하는 라이브러리로, CNN에 큰 수용 필드를 제공합니다.
reall3d-com/Reall3dViewer
Three.js 기반의 웹 렌더러로, 대규모 3D 가우시안 스플래터링 장면을 고성능으로 스트리밍하고 적응형 LOD를 제공합니다.
cre185/InstantSfM
2D 이미지에서 3D 구조를 재구성하는 과정을 가속화하는 GPU 네이티브 구조에서 운동(SfM) 파이프라인으로, 3D 가우시안 스플래팅의 통합 지원도 제공합니다.
ilastik/ilastik
세포 및 기타 실험 이미지 데이터의 세그멘테이션, 분류, 추적, 카운팅을 위한 인터랙티브 기계학습 툴킷입니다.
Ma-Zhuang/OmniNWM
OmniNWM은 자율주행 시뮬레이션을 위한 파노라마형 다중 모달 월드 모델을 구축하는 연구용 코드베이스입니다. 차량의 경로에서 RGB, 세분화, 깊이, 3D 점유 맵을 동시에 생성하고, 정규화된 Plücker 레이 맵을 사용해 정밀한 제어를 수행하며, 점유 기반 밀도 보상을 통해 폐루프 정책 평가를 가능하게 합니다. 리포지토리에는 transformers 패치 포함 설치 절차, nuScenes 데이터 준비 안내, 사전 학습 체크포인트 다운로드 링크, 추론, 분포 외 테스트, 단계별 학습용 스크립트가 포함되어 있습니다.