gazijarin/itsgiving
실시간으로 얼굴 표정과 손 제스처를 감지하여 해당하는 미ーム 오버레이를 트리거하는 웹캠 애플리케이션. 비디오 회의에서 사용 가능한 가상 카메라 기능을 제공합니다.
img2threejs/img2threejs
img2threejs는 LLM이 단일 참조 이미지를 절차적 Three.js 모델로 변환할 수 있게 해주는 Python 기반 스킬입니다. spec을 구축하고, 게이트 방식의 시각적 검토 루프를를 통해, 프리미티브와 셰이더를 사용하여 사물을 재현하는 TypeScript 코드를 생성하여 애니메이션 준비가 완료된 상태로 출력합니다. 이 시스템은 도메인 플러그인(예: CS2 무기 스킨)을 통해 확장 가능하며, 라이브 데모 갤러리를 포함합니다.
ruvnet/RuView
카메라, 웨어러블 기기, 클라우드 연결 없이 사람의 존재, 생체 신호, 자세를 추정하는 WiFi 센싱 플랫폼입니다.
PaddlePaddle/PaddleOCR
PaddleOCR은 이미지/PDF를 구조화된 LLM용 JSON 또는 Markdown으로 변환하는 오픈 소스 OCR 및 문서 AI 툴킷입니다. 다국어 장면 텍스트 모델(PP-OCRv6), 표/수식/고대 문자용 경량 비전-언어 파서(PaddleOCR-VL-1.6), 그리고 구조 인지 파이프라인(PP-StructureV3)을 제공합니다. 모델은 CPU, GPU, XPU, NPU 또는 ONNX/TensorRT를 통해 실행될 수 있으며, Dify 및 RAGFlow와 같은 RAG/에이전트 플랫폼과 통합됩니다.
immich-app/immich
AI 기반 얼굴 인식과 CLIP 기반 검색을 갖춘 고성능 자체 호스팅 사진 및 동영상 관리 솔루션입니다.
roboflow/rf-detr
RF-DETR은 DINOv2 백본을 기반으로 하는 실시간 트랜스포머 아키텍처로, 객체 탐지, 인스턴스 세그멘테이션, 키포인트 탐지에 사용됩니다.
baidu/Unlimited-OCR
복잡한 문서, PDF, 다중 페이지 이미지의 원샷 장거리 분석을 위한 다중 모달 OCR 모델.
julyx10/lap
로컬 AI를 활용한 검색과 얼굴 인식을 통해 클라우드 사진 서비스의 사생활 보호 대안이 되는 오픈소스로, 로컬 우선의 사진 관리 도구입니다.
ultralytics/ultralytics
실시간 객체 탐지, 분할, 분류 및 자세 추정을 위해 YOLO 모델을 구현한 고성능 컴퓨터 비전 프레임워크.
MaaAssistantArknights/MaaAssistantArknights
이미지 인식과 OCR을 사용하여 일상 작업, 자원 농사, 기지 관리를 자동화하는 아크내이츠용 자동화 보조 도구입니다.
amap-cvlab/ABot-Recon
ABot-Recon은 장시간 동영상 스트림에서 지속적인 장거리 메모리 없이도 효율적으로 글로벌 궤적과 포인트 클라우드를 구축할 수 있는 스트리밍 3D 재구성 시스템입니다. 고정된 12프레임의 국소 컨텍스트를 사용합니다.
om-ai-lab/VLX-Seek
VLX‑Seek는 에지 기기 에이전트를 위한 오픈소스 비전-언어 모델로, 세밀한 인식을 수행합니다. 영역 제안을 생성하고 각 영역을 특수 토큰으로 인코딩한 후 언어 모델이 이 토큰을 선택하게 하여, 검출, 참조 표현 이해, OCR, 세기, VQA 등의 작업에 적합한 컴팩트하고 파싱 가능한 출력을 생성합니다. 리포지토리에는 추론 코드, 파이썬 API, 그리고 10 B 체크포인트(허깅페이스에 호스팅)가 포함되어 있습니다.
blakeblackshear/frigate
Home Assistant와 밀접하게 통합된 IP 카메라용 로컬 NVR로, 실시간 AI 객체 탐지를 제공합니다.
ooolabdev/ooosplat
로컬 데스크톱 애플리케이션으로, 주변 시야 영상 또는 이미지 시퀀스를 자동화된 로컬 파이프라인을 통해 3D 가우시안 스플래터링 모델로 변환합니다.
Faceplugin-ltd/Open-Source-Face-Recognition-SDK
딥러닝을 사용하여 온프레미스에서 얼굴 탐지, 랜드마크 탐지 및 유사도 비교를 제공하는 Windows 및 Linux용 오픈소스 얼굴 인식 SDK입니다.
MaaXYZ/MaaFramework
내부 API에 접근할 수 없는 소프트웨어에 대한 자동화된 블랙박스 테스팅을 가능하게 하는, 이미지 인식 기반의 저코드 파이프라인 프로토콜을 사용하는 자동화 프레임워크입니다.
hacksider/Deep-Live-Cam
하나의 소스 이미지만으로 비디오나 실시간 웹캠 스트림에서 얼굴을 실시간으로 교체할 수 있는 딥페이크 도구입니다.
tesseract-ocr/tesseract
Tesseract는 100개 이상의 언어를 지원하며 이미지 속의 텍스트를 기계 판독 가능한 텍스트로 변환하는 오픈 소스 OCR 엔진 및 명령줄 도구입니다.
Yuliang-Liu/MonkeyOCRv2
MonkeyOCRv2는 Document AI를 위한 오픈 소스 시각-텍스트 파운데이션 모델입니다. ViT 기반 비전 인코더와 다국어 파싱 및 이해 헤드(약 0.6-1.8 B 매개변수)를 탑재하여 17개 언어의 OCR, 레이아웃 파싱, VQA 및 수식 인식에서 최고 수준의 점수를 달성합니다. 모델은 Hugging Face/ModelScope에서 사용할 수 있으며, Transformers 또는 vLLM으로 실행할 수 있고(CPU 지원 및 DFlash 가속은 선택 사항), 대규모 MonkeyDoc v2 사전 학습 데이터셋이 함께 제공됩니다.
facebookresearch/vggt-omega
VGGT-Omega는 이미지에서 카메라 자세와 깊이를 예측하여 3D 장면 재구성을 가능하게 하는 컴퓨터 비전 모델입니다.
Robbyant/lingbot-map
동영상을 기반으로 실시간으로 포인트 클라우드와 카메라 궤적을 생성할 수 있는 피드포워드 3D 기초 모델입니다.
roboflow/supervision
데이터 로딩, 시각화 및 데이터셋 관리를 위한 모델 불가지론적(model-agnostic) 빌딩 블록을 제공하여 비전 애플리케이션 개발을 가속화하는 컴퓨터 비전 툴킷입니다.
opencv/opencv
OpenCV는 AI 및 시각적 인지 개발을 위한 도구와 알고리즘을 제공하는 오픈소스 컴퓨터 비전 라이브ertary가입니다.
ace-trump-tech/DeltaForce-OBS-Locker
환경 오류 탐지를 필터링하여 Delta Force 게임 내 캐릭터를 식별하는 실시간 객체 탐지 및 타겟 잠금 시스템, YOLOv14 기반
MaaEnd/MaaEnd
Endfield 게임을 위한 자동화 보조 도구로, 화면 인식을 사용해 전투, 자원 농사, 일상 관리 작업을 자동화합니다.
RapidAI/RapidOCR
PaddleOCR 모델을 ONNX 형식으로 변환하여 다양한 플랫폼과 언어에서 빠르고 자원 소비가 적은 오프라인 배포가 가능한 오픈소스 OCR 도구입니다.
deepinsight/insightface
얼굴 인식, 탐지 및 정렬을 위한 최첨단 알고리즘을 제공하는 오픈 소스 2D 및 3D 딥 페이스 분석 툴박스입니다.
playcanvas/supersplat
3D Gaussian Splats를 검사, 편집, 최적화 및 게시할 수 있는 브라우저 기반 오픈소스 에디터입니다.
duy-phamduc68/TrafficLab-3D
컴퓨터 비전과 사용자 정의 캘리브레이션 파이프라인을 사용하여 CCTV 영상과 위성 지도에서 3D 디지털 트윈을 생성하는 엔드투엔드 트래픽 분석 솔루션.
BigBodyCobain/Shadowbroker
60개 이상의 실시간 OSINT 피드를 통합하여 글로벌 위협 모니터링을 위한 단일 지도 인터페이스로 제공하는 분산형 지리공간 인텔리전스 플랫폼.
harry7557558/spirula-studio
Python이나 PyTorch를 필요로 하지 않고, 사진과 동영상을 3D 스플래트와 메시로 변환하는 자체 완결형 3D 가우시안 스플래팅 파이프라인입니다.
oncologylab/histopia
연속 단면 히스토로지 및 단백질체 이미지 분석을 위한 계산 연구 도구로, 조직 단면 간 3D 재구성과 공간 토폴로지 프로파일링을 가능하게 합니다.
facebookresearch/sam3
SAM 3 (Concepts with Segment Anything)는 Meta의 848M 파라미터 기초 모델로, 자유형 텍스트(또는 시각적 예시)로 이미지나 동영상을 프롬프트할 수 있으며, *모든 일치하는 객체*에 대해 마스크, 박스, 점수를 반환합니다. DETR 스타일 검출기와 SAM 2 스타일 추적기를 결합하고, 세밀한 프롬프트 구분을 위한 프레젠스 토큰을 도입하며, 400만 개 이상의 자동 애노테이션된 개념으로 훈련되었습니다. 27만 개념의 새로운 SA‑CO 벤치마크를 제공합니다. 리포지토리는 설치 절차, 예제 노트북, 평가용 벤치마크를 포함합니다.
ByteDance-Seed/Depth-Anything-3
단일 또는 다중 이미지에서 통합된 깊이-레이 표현을 사용하여 공간적으로 일관된 3D 기하, 깊이 맵 및 카메라 자세를 예측하는 모델.
roflcoopter/viseron
가정 및 사무실 모니터링을 위한 자체 호스팅, 로컬 전용 NVR 및 AI 컴퓨터 비전 소프트웨어로, 객체 및 얼굴 인식 기능을 제공합니다.
ocrmypdf/OCRmyPDF
스캔된 PDF에 OCR 텍스트 레이어를 추가하여 검색 가능하고 복사/붙여넣기 가능한 문서로 만드는 명령줄 도구이며, 이미지 품질을 유지합니다.
freemocap/freemocap
비싼 전용 하드웨어 없이도 연구 수준의 추적을 제공하는 무료이고 오픈소스인 모션 캡처 플랫폼입니다.
colmap/colmap
이미지 컬렉션에서 3D 구조를 재구축하기 위한 범용적인 Structure-from-Motion 및 Multi-View Stereo 파이프라인.
suzuran0y/CCTV-Smartphone-AI-Monitoring
Sentinel은 오픈소스의 LAN 전용 시스템으로, 안드로이드 폰을 실시간 카메라 노드로, Python/Flask 기반 PC 서버를 실시간 미리보기, 세그먼트 녹화, AI 트리거 감시 대시보드로 전환합니다. 모션 감지로 외부 비전 모델을 호출하고, 구조화된 JSON 이벤트를 출력하며, 모든 데이터를 로컬에 보관하여 개인정보 중심의 감시 또는 데이터 수집 연구에 적합합니다.
nerfstudio-project/gsplat
3D 가우시안 래스터화를 위한 CUDA 가속 라이브러리로, 공식 구현보다 더 빠르고 메모리 효율적인 라디언스 필드 렌더링 방식을 제공합니다.
cvat-ai/cvat
컴퓨터 비전을 위한 고품질 시각적 데이터셋 구축을 위한 오픈 소스 데이터 어노테이션 플랫폼으로, 이미지, 비디오, 3D 어노테이션을 지원합니다.
beixiaocai/rebucca
YOLO 탐지와 LLM 검증을 결합하여 구조화된 알림을 제공하는 다중 채널 비디오 분석 플랫폼입니다.
microsoft/MoGe
MoGe는 단일 오픈 도메인 이미지로부터 미터 단위 깊이 및 포인트 맵을 포함한 정확한 3D 형상을 복원하는 모델입니다.
datalab-to/surya
91개 언어에서 고정밀 텍스트 인식, 레이아웃 분석, 테이블 추출을 제공하는 650M 파라미터 OCR 모델입니다.
open-edge-platform/anomalib
이미지 및 동영상 내 결함을 식별하고 위치를 파악하기 위한 벤치마킹, 개발, 배포에 적합한 딥러닝 라이브러리.
mkturkcan/DART
TensorRT 최적화와 교육된 백본을 사용하여 SAM3를 실시간 다중 클래스 오픈-보이지 않는 감지기로 변환하는 학습 없이도 가능한 프레임워크입니다.
sparkjsdev/spark
THREE.js를 위한 고급 3D Gaussian Splatting 렌더러로, 폭넓은 기기 지원을 통해 웹에서 고성능의 사실적인 3D 장면을 구현합니다.
ZhengPeng7/BiRefNet
BiRefNet은 다양한 해상도의 이미지에서 최첨단(state-of-the-art) 배경 제거 및 오브젝트 세그멘테이션을 제공하는 고해상도 이분법적 이미지 세그멘테이션 모델입니다.