ruvnet/RuView

카메라, 웨어러블 기기, 클라우드 연결 없이 사람의 존재, 생체 신호, 자세를 추정하는 WiFi 센싱 플랫폼입니다.

roboflow/supervision

데이터 로딩, 시각화 및 데이터셋 관리 작업을 위한 모델 불가지론적(model-agnostic) 빌딩 블록을 제공하여 컴퓨터 비전 애플리케이션 개발을 가속화하는 컴퓨터 비전 툴킷입니다.

immich-app/immich

AI 기반 얼굴 인식과 CLIP 기반 검색을 갖춘 고성능 자체 호스팅 사진 및 동영상 관리 솔루션입니다.

img2threejs/img2threejs

img2threejs는 LLM이 단일 참조 이미지를 절차적 Three.js 모델로 변환할 수 있게 해주는 Python 기반 스킬입니다. spec을 구축하고, 게이트 방식의 시각적 검토 루프를를 통해, 프리미티브와 셰이더를 사용하여 사물을 재현하는 TypeScript 코드를 생성하여 애니메이션 준비가 완료된 상태로 출력합니다. 이 시스템은 도메인 플러그인(예: CS2 무기 스킨)을 통해 확장 가능하며, 라이브 데모 갤러리를 포함합니다.

baidu/Unlimited-OCR

복잡한 문서, PDF, 다중 페이지 이미지의 원샷 장거리 분석을 위한 다중 모달 OCR 모델.

PaddlePaddle/PaddleOCR

PaddleOCR는 이미지나 PDF를 구조화된 LLM 대응 텍스트, 표, 마크다운/JSON으로 변환하는 오픈소스 OCR 및 문서 AI 툴킷입니다. PP-OCRv6를 통한 다국어 장면 텍스트 인식 모델과 PaddleOCR-VL / PP-StructureV3를 통한 경량 시각-언어 모델을 제공하며, 최고 수준의 정확도, 빠른 CPU/GPU 추론, Docker에서 브라우저 SDK까지 다양한 배포 옵션을 갖추고 있습니다. Dify 및 RAGFlow와 같은 RAG 플랫폼과 통합되어 AI 에이전트 및 검색 증강 생성 파이프라인의 데이터 엔진으로 활용됩니다.

om-ai-lab/VLX-Seek

VLX‑Seek는 에지 기기 에이전트를 위한 오픈소스 비전-언어 모델로, 세밀한 인식을 수행합니다. 영역 제안을 생성하고 각 영역을 특수 토큰으로 인코딩한 후 언어 모델이 이 토큰을 선택하게 하여, 검출, 참조 표현 이해, OCR, 세기, VQA 등의 작업에 적합한 컴팩트하고 파싱 가능한 출력을 생성합니다. 리포지토리에는 추론 코드, 파이썬 API, 그리고 10 B 체크포인트(허깅페이스에 호스팅)가 포함되어 있습니다.

huawei-bayerlab/marigold-v2

마리골드 V2는 사전 훈련된 확산 변환기(Qwen-Image-Edit-2509)를 활용하여 단안 깊이, 투명 깊이, 표면 법선, 알베도를 위한 빠르고 단일 스텝 예측기로 전환하는 연구용 코드베이스입니다. 단일 32GB GPU에서 약 5일이 소요되는 저비용 미세 조정, 최첨단 벤치마크 성능, 바로 사용 가능한 추론/평가 스크립트, 그리고 새로운 밀도-비전 작업으로 확장 가능한 모듈식 YAML 기반 훈련 프레임워크를 제공합니다.

playcanvas/supersplat

3D Gaussian Splats를 검사, 편집 및 최적화하기 위한 브라우저 기반 오픈 소스 도구입니다.

ultralytics/ultralytics

실시간 객체 탐지, 세그멘테이션, 분류 및 자세 추정을 위한 YOLO 모델을 특징으로 하는 포괄적인 컴퓨터 비전 프레임워크.

blakeblackshear/frigate

Home Assistant와 밀접하게 통합된 IP 카메라용 로컬 NVR로, 실시간 AI 객체 탐지를 제공합니다.

julyx10/lap

macOS, Windows, Linux용 개인 정보 보호 중심의 로컬 우선 사진 관리 도구로, 클라우드 업로드 없이 로컬 AI를 활용해 검색과 얼굴 클러스터링을 제공합니다.

viettranx/3dviz-pro-max

3Dviz Pro Max는 대규모 언어 모델이 자연어 설명을 완전한 Three.js 장면으로 변환할 수 있는 AI 에이전트 스킬입니다. 10단계 워크플로우, 223개의 레시피 카탈로그, 22개의 검증된 Three.js 킷 블루프린트, 스타일 기본값, 그리고 Python 헬퍼를 제공하여 헤드리스 Chromium에서 장면을 렌더링하고 PNG 프레임을 캡처한 후 모델에 피드백을 제공합니다. Claude Code 또는 Codex에 `skills/3dviz-pro-max/` 폴더를 링크하여 설치하고, Vite로 번들된 37개의 실행 가능한 데모를 실행하세요. 프로젝트는 MIT 라이선스이며, 모든 레시피가 완전히 렌더링된다고 주장하지 않고, 재현 가능하고 증거 기반의 3D 시각화에 중점을 둡니다.

gazijarin/itsgiving

실시간으로 얼굴 표정과 손 제스처를 감지하여 해당하는 미ーム 오버레이를 트리거하는 웹캠 애플리케이션. 비디오 회의에서 사용 가능한 가상 카메라 기능을 제공합니다.

wilsjo2/OptiScaler-DLSSNR-PreSR-Multipass

지원되는 게임에서 조명, 세부 사항, 색상을 강화하기 위해 NVIDIA AI를 사용하는 게임 모드로, 사용자 정의 가능한 신경망 렌더링 효과를 제공합니다.

ooolabdev/ooosplat

로컬 데스크톱 애플리케이션으로, 주변 시야 영상 또는 이미지 시퀀스를 자동화된 로컬 파이프라인을 통해 3D 가우시안 스플래터링 모델로 변환합니다.

amap-cvlab/ABot-Recon

ABot-Recon은 장시간 동영상 스트림에서 글로벌 궤적과 포인트 클라우드를 구축하기 위해 고정된 12프레임의 국소적 컨텍스트를 사용하는 스트리밍 3D 재구성 시스템이며, 장기적 지속 메모리가 필요하지 않습니다.

MaaAssistantArknights/MaaAssistantArknights

이미지 인식과 OCR을 사용하여 일상 작업, 자원 농사, 기지 관리를 자동화하는 아크내이츠용 자동화 보조 도구입니다.

facebookresearch/vggt-omega

VGGT-Omega는 이미지에서 카메라 자세와 깊이를 예측하여 3D 장면 재구성을 가능하게 하는 컴퓨터 비전 모델입니다.

ika-rwth-aachen/ros2-depth-anything-v3-trt

Depth Anything V3와 TensorRT 가속을 사용한 실시간 메트릭 깊이 추정 및 포인트 클라우드 생성을 위한 ROS 2 노드입니다.

tesseract-ocr/tesseract

Tesseract는 100개 이상의 언어를 지원하며 이미지 속의 텍스트를 기계 판독 가능한 텍스트로 변환하는 오픈 소스 OCR 엔진 및 명령줄 도구입니다.

StarTrail-org/PixelRAG

PixelRAG은 웹 페이지, PDF, 이미지를 스크린샷 타일로 렌더링하고, 시각-언어 모델로 임베딩하여 FAISS/Qdrant 벡터 인덱스를 구축한 후, LLM이 시각적 레이아웃 기반으로 정보를 검색할 수 있는 검색 API(또는 Claude 플러그인)를 제공합니다.

harry7557558/spirula-studio

Python, PyTorch, COLMAP 없이 사진과 영상을 3D 모델로 변환하는 독립형 3D Gaussian Splatting 파이프라인입니다.

hacksider/Deep-Live-Cam

하나의 소스 이미지만으로 비디오나 실시간 웹캠 스트림에서 얼굴을 실시간으로 교체할 수 있는 딥페이크 도구입니다.

agamrossen/VolAnti

무선 신호가 아닌 프로펠러의 고조파 소리로 다중 회전축 드론을 식별하는 오픈소스 음향 드론 탐지 시스템.

ace-trump-tech/DeltaForce-OBS-Locker

환경 오류 탐지를 필터링하여 Delta Force 게임 내 캐릭터를 식별하는 실시간 객체 탐지 및 타겟 잠금 시스템, YOLOv14 기반

ocrmypdf/OCRmyPDF

스캔된 PDF에 OCR 텍스트 레이어를 추가하여 검색 가능하고 복사/붙여넣기 가능한 문서로 만드는 명령줄 도구이며, 이미지 품질을 유지합니다.

colmap/colmap

COLMAP는 사진의 집합을 자동으로 3D 모델로 변환하는 오픈소스 구조-운동(SfM) 및 다중뷰 스테레오(MVS) 파이프라인입니다. GUI, 명령줄 도구, Python 바인딩, GPU 가속 특징 추출, 크로스플랫폼 바이너리 등을 제공하여 컴퓨터 비전, 로보틱스, AR/VR, 카메라 자세 및 밀도 높은 장면 기하학이 필요한 모든 워크플로우에서 연구 및 응용의 기반으로 널리 사용됩니다.

Robbyant/lingbot-map

LingBot‑Map은 Geometric Context Transformer를 통해 비디오 프레임을 스트리밍하고, 페이지 기반 KV 캐시(FlashInfer)를 사용해 메모리를 낮게 유지하는 피드포워드 3D 재구성 모델입니다. 보통 GPU에서 약 20 fps로 작동하며, 키 프레임 간격 또는 윈도우 기반 추론을 통해 매우 긴 시퀀스를 지원하고, HuggingFace/ModelScope에 사전 학습된 체크포인트를 포함하며, 실행 가능한 데모와 오프라인 배치 렌더러를 제공합니다.

opencv/opencv

OpenCV는 AI 및 시각적 인지 개발을 위한 도구와 알고리즘을 제공하는 오픈소스 컴퓨터 비전 라이브ertary가입니다.

jeremyipark/vision-demos

vision‑demos는 최첨단 자세 추정(`vitpose-plus-large`) 및 분할(`sam3.1`) 모델을 일상 활동에 적용하는 4개의 구체적인 Python 데모 세트입니다. 댄스 동기화, 턱걸이 카운팅, 볼더링 루트 분석, 러닝 카덴스 측정이 포함됩니다. 각 데모에는 README, 설정 지침, 시각적 예시가 포함되어 있으며 전체 저장소는 Apache‑2.0 하에 배포됩니다.

RapidAI/RapidOCR

PaddleOCR 모델을 ONNX 형식으로 변환하여 다양한 플랫폼과 언어에서 빠르고 자원 소비가 적은 오프라인 배포가 가능한 오픈소스 OCR 도구입니다.

roboflow/rf-detr

RF‑DETR는 DINOv2 백본을 기반으로 한 실시간 트랜스포머 기반 비전 모델 세트(검출, 세그멘테이션, 키포인트)입니다. `rfdetr` Python 패키지로 제공되며, Nano‑2XL의 여러 크기 변형을 포함하며, 코어는 Apache‑2.0, XL/2XL는 PML 1.0 라이선스를 사용합니다. COCO 및 RF100‑VL에서 최첨단의 정확도-지연 시간 트레이드오프를 보여주는 벤치마크 표를 포함합니다. 설치는 `pip install rfdetr`로, 사용은 `model.predict(...)` 한 줄로 가능하며, `supervision` 라이브러리를 사용해 선택적으로 시각화할 수 있습니다. 프로젝트는 Roboflow 플랫폼에서 사용 가능한 커스텀 아키텍처 탐색을 위한 NAS 파이프라인도 제공합니다.

facebookresearch/sam3

SAM 3 (Concepts with Segment Anything)는 Meta의 848M 파라미터 기초 모델로, 자유형 텍스트(또는 시각적 예시)로 이미지나 동영상을 프롬프트할 수 있으며, *모든 일치하는 객체*에 대해 마스크, 박스, 점수를 반환합니다. DETR 스타일 검출기와 SAM 2 스타일 추적기를 결합하고, 세밀한 프롬프트 구분을 위한 프레젠스 토큰을 도입하며, 400만 개 이상의 자동 애노테이션된 개념으로 훈련되었습니다. 27만 개념의 새로운 SA‑CO 벤치마크를 제공합니다. 리포지토리는 설치 절차, 예제 노트북, 평가용 벤치마크를 포함합니다.

cvat-ai/cvat

컴퓨터 비전을 위한 고품질 시각적 데이터셋 구축을 위한 오픈 소스 데이터 어노테이션 플랫폼으로, 이미지, 비디오, 3D 어노테이션을 지원합니다.

aoguai/LiYing

AI를 사용하여 얼굴 감지, 배경 교체 및 레이아웃 배치를 처리하여 전문가급 신분증 사진을 만드는 자동 ID 사진 처리 도구.

deepinsight/insightface

얼굴 인식, 탐지 및 정렬을 위한 최첨단 알고리즘을 제공하는 오픈 소스 2D 및 3D 딥 페이스 분석 툴박스입니다.

ultralytics/yolov5

YOLOv5는 Ultralytics에서 제공하는 PyTorch 기반의 오픈 소스 객체 탐지/세그멘테이션/분류 모델 제품군으로, 다양한 모델 크기, 간단한 Python/CLI 추론, 한 줄 명령어로 실행되는 학습, 그리고 다양한 배포포맷으로의 내보내기가 가능합니다.

yakhyo/uniface

UniFace는 15가지 얼굴 분석 작업—탐지, 랜드마크, 3D 메쉬, 파싱, 매팅, 시선, 머리 자세, 인구 통계, 감정, 품질, 안티 스푸핑, 인식, 익명화, 그리고 FAISS 기반 유사도 검색—을 하나의 설치하기 쉬운 패키지(CPU, Apple Silicon, 또는 CUDA)로 통합한 Python 라이브러리입니다. 일관된 API, 자동 모델 가중치 다운로드, 풍부한 문서, 노트북, 그리고 커뮤니티 Discord를 제공합니다.

oncologylab/histopia

연속 단면 히스토로지 및 단백질체 이미지 분석을 위한 계산 연구 도구로, 조직 단면 간 3D 재구성과 공간 토폴로지 프로파일링을 가능하게 합니다.

MrNeRF/LichtFeld-Studio

학습, 실시간 시각화, 편집 및 내보내기를 하나의 네이티브 애플리케이션에서 통합하는 모듈형 워크스테이션입니다.

jayin92/Skyfall-GS

Skyfall-GS는 위성 이미지에서 얻은 기하 정보를 diffusion 모델이 생성하는 고품질 텍스처와 결합하여 대규모 몰입형 3D 도시 장면을 합성하는 프레임워크입니다.

ArthurBrussee/brush

WebGPU와 Burn 프레임워크를 사용하여 macOS, Windows, Linux, Android 및 브라우저에서 작동하는 크로스플랫폼 3D 재구성 엔진입니다.

serengil/deepface

얼굴 인식 및 얼굴 속성 분석을 위한 경량 Python 프레임워크로, 여러 최첨단 모델을 래핑하여 신원 확인 및 인구통계 예측을 수행합니다.

facebookresearch/boxer

Boxer는 포즈된 이미지와 준밀도 점군을 활용하여 오픈월드 2D 객체 탐지를 실내 장면의 3D 방향 경계 상자로 끌어올리는 시스템입니다.

ByteDance-Seed/Depth-Anything-3

단일 또는 다중 이미지에서 통합된 깊이-레이 표현을 사용하여 공간적으로 일관된 3D 기하, 깊이 맵 및 카메라 자세를 예측하는 모델.

microsoft/OmniParser

GUI 스크린샷을 구조화된 요소로 변환하는 스크린 파싱 도구로, 시각 기반 AI 에이전트가 인터페이스 컴포넌트를 정확히 식별하고 상호작용할 수 있도록 합니다.

pq-yang/MatAnyone2

실세계 조건에서도 높은 견고성을 발휘하며, 머리카락이나 가장자리와 같은 미세한 세부 사항을 유지하여 사람을 동영상에서 추출하는 인간 동영상 마팅 프레임워크입니다.