liustack/modlens
ModLens는 DeepSeek Harness(및 기타 로컬 AI 어시스턴트)용 플러그인으로, 텍스트 전용 LLM에 비전 기능을 추가합니다. 사용자는 이미지를 채팅에 직접 붙여넣습니다. 플러그인은 이를 구성 가능한 비전 엔진(Gemini, OpenAI 호환, Anthropic, Antigravity CLI, Claude/Kimi CLI 또는 로컬 에이전트)으로 전달하고 모델이 인용할 수 있는 구조화된 전사를 반환합니다. 설치는 단일 `npx` 명령 또는 `skills.sh`를 통해 이루어지며, 제로 구성 기본값과 자동 키 순환/장애 조치를 제공합니다. 프로젝트는 MIT 라이선스이며 무거운 래퍼보다는 경량 통합에 중점을 둡니다.
royshil/obs-backgroundremoval
물리적인 그린 스크린 없이도 신경망을 사용하여 인물 배경을 제거하고 저조도 비디오를 실시간으로 개선하는 OBS Studio 플러그인입니다.
lyuwenyu/RT-DETR
검출 트랜스포머(DETR) 아키텍처를 기반으로 한 실시간 객체 탐지 프레임워크로, 속도와 정확도 면에서 YOLO 모델을 능가하려는 목표를 가지고 있습니다.
MaaEnd/MaaEnd
화면 인식을 사용해 전투, 자원 채굴, 일일 관리를 자동화하는 게임 엔드필드용 자동화 보조 도구.
microsoft/MoGe
MoGe는 단일 오픈 도메인 이미지로부터 미터 단위 깊이 및 포인트 맵을 포함한 정확한 3D 형상을 복원하는 모델입니다.
sparkjsdev/spark
THREE.js용 고급 3D 가우시안 스플래팅 렌더러로, 스플랫 기반 3D 장면의 고성능 크로스 디바이스 렌더링을 가능하게 합니다.
MaaXYZ/MaaFramework
내부 API에 접근할 수 없는 소프트웨어에 대한 자동화된 블랙박스 테스팅을 가능하게 하는, 이미지 인식 기반의 저코드 파이프라인 프로토콜을 사용하는 자동화 프레임워크입니다.
beixiaocai/rebucca
YOLO 탐지와 LLM 검증을 결합하여 구조화된 알림을 제공하는 다중 채널 비디오 분석 플랫폼입니다.
davidakpele/wifi-densepose
카메라 없이 포즈를 감지하기 위해 WiFi 채널 상태 정보(CSI)와 머신러닝을 사용하는 프라이버시 보호형 인간 포즈 추정 시스템.
nerfstudio-project/gsplat
3D 가우시안 래스터화를 위한 CUDA 가속 라이브러리로, 공식 구현보다 더 빠르고 메모리 효율적인 라디언스 필드 렌더링 방식을 제공합니다.
aloshdenny/reverse-SynthID
Google Gemini가 생성한 이미지에 포함된 보이지 않는 SynthID 워터마크를 스펙트럼 분석과 다단계 적대적 파이프라인을 사용하여 탐지하고 제거하는 리버스 엔지니어링 프로젝트입니다.
wasserth/TotalSegmentator
CT 및 MR 이미지에서 주요 해부학적 구조를 자동으로 분할하여 상세한 해부학적 마스크와 신체 통계를 제공하는 자동화 도구입니다.
valkia/aramgg_client
리그 오브 레전드 ARAM 모드를 위한 Windows 데스크톱 보조 도구로, 챔피언 선택 조언을 제공하고 게임 내 하크스테크 오그먼트를 OCR로 인식하여 빌드를 추천합니다.
google-deepmind/alphafold3
생체 분자 상호작용의 정확한 3D 구조 예측을 위한 AlphaFold 3 추론 파이프라인 구현.
isl-org/Open3D
Open3D는 점구름 및 메쉬 조작, 시각화 및 3D 머신러닝을 위한 최적화된 도구를 제공하는 현대적인 3D 데이터 처리 라이브러리입니다.
open-edge-platform/anomalib
이미지와 비디오의 시각적 이상 탐지에 중점을 둔 이상 탐지 알고리즘의 벤치마킹 및 배포를 위한 딥러닝 라이브러리.
pynicolas/FairScan
로컬 머신러닝을 사용하여 자동 문서 감지 및 투시 보정을 수행하여 개인 정보를 보호하는 오픈소스 안드로이드 문서 스캐너입니다.
freemocap/freemocap
비싼 전용 하드웨어 없이도 연구 수준의 추적을 제공하는 무료이고 오픈소스인 모션 캡처 플랫폼입니다.
lightly-ai/lightly-train
DINOv3 및 LTDETRv2와 같은 최첨단 모델을 객체 탐지 및 세그멘테이션과 같은 작업을 위해 사전 학습, 미세 조정 및 지식 증류하기 위한 컴퓨터 비전 프레임워크입니다.
huggingface/pytorch-image-models
AI 프로젝트에 쉽게 통합할 수 있도록 최첨단 컴퓨터 비전 백본과 사전 학습된 가중치를 방대한하게 제공하는 포괄적인 PyTorch 라이브러리입니다.
WebODM/WebODM
드론 이미지를 지리적으로 참조된 지도, 점군, 3D 모델, 가우시안 스플래트로 변환하는 상용 등급 소프트웨어입니다.
ZhengPeng7/BiRefNet
BiRefNet은 다양한 해상도의 이미지에서 최첨단(state-of-the-art) 배경 제거 및 오브젝트 세그멘테이션을 제공하는 고해상도 이분법적 이미지 세그멘테이션 모델입니다.
vllm-project/llm-compressor
LLM Compressor는 대규모 언어 모델을 `compressed-tensors` 형식으로 양자화 및 절단하는 Python 라이브러리로, vLLM에서 메모리 효율적으로 배포할 수 있게 합니다. 다양한 저정밀도 형식(NVFP4, FP8, INT4 등), 여러 PTQ/GPTQ 알고리즘, DDP 및 디스크 오프로딩을 통한 거대 모델 지원, 인기 LLM의 사전 양자화 체크포인트를 제공합니다.
NVIDIA/DLSS
NVIDIA DLSS SDK는 DX11, DX12 및 Vulkan과의 통합을 지원하는 게임용 고성능 이미지 스케일링 및 샤프닝 도구를 제공합니다.
opengeos/geoai
AI 프레임워크와 지리 공간 데이터 분석을 통합하여 위성 이미지 처리, 모델 학습 및 추론을 위한 도구를 제공하는 Python 패키지입니다.
realsenseai/librealsense
RealSense 깊이 카메라를 위한 크로스 플랫폼 SDK로, 깊이 및 컬러 스트리밍을 지원하며 컴퓨터 비전 및 로보틱스를 위한 교정 데이터를 제공합니다.
voxel51/fiftyone
시각적 데이터 탐색, 레이블링, 모델 평가를 제공하여 고품질 컴퓨터 비전 데이터셋과 모델 구축을 지원하는 오픈소스 도구입니다.
NVlabs/Fast-FoundationStereo
지식 증류, 신경망 아키텍처 탐색, 구조적 프루닝을 활용해 강력한 제로샷 일반화를 달성하는 실시간 스테레오 매칭 아키텍처 패밀리.
opendatalab/OmniDocBench
현실 세계 시나리오에서 문서 구문 분석을 평가하기 위한 포괄적인 벤치마크로, 레이아웃 탐지, OCR, 표, 수식 인식을 위한 풍부한 주석을 제공합니다.
apple-aiml-research/ml-sharp
SHARP는 단일 이미지에서 1초 미만으로 메트릭 3D 가우시안 표현을 생성하는 빠른 단안 뷰 합성 도구로, 신경망을 사용합니다.
Pointcept/Pointcept
다양한 3D 백본과 자기 지도 사전 학습 프레임워크를 통합한 포인트 클라우드 인지 연구를 위한 강력하고 유연한 코드베이스.
prs-eth/Marigold
Stable Diffusion과 같은 사전 학습된 확산 모델을 재사용하여 고해상도 단안 깊이, 표면 법선, 그리고 내재 이미지 분석을 수행하는 조건부 생성 모델의 패밀리입니다.
roboflow/trackers
어떤 검출 모델에도 적용 가능한 여러 객체 추적 알고리즘의 벤치마크 구현을 제공하는 즉시 사용형 파이썬 라이브러리.
alicevision/Meshroom
3D 재구성 및 컴퓨터 비전을 위한 노드 기반 비주얼 프로그래밍 프레임워크로, AI와 포토그래메트리를 활용해 복잡한 데이터 처리 파이프라인을 구축할 수 있습니다.
roryclear/clearcam
어떤 RTSP 보안 카메라에도 객체 탐지, 추적 및 AI 생성 이벤트 요약 기능을 추가하는 AI 기반 NVR 시스템입니다.
Tencent/YOLO-Master
장면의 복잡성에 따라 계산을 적응적으로 할당하는 Mixture-of-Experts(MoE)를 활용한 실시간 객체 탐지용 YOLO 스타일 프레임워크로, 더 높은 정밀도와 낮은 지연을 실현합니다.
vietanhdev/anylabeling
YOLOv8과 Segment Anything을 통합하여 컴퓨터 비전 데이터셋에 대한 자동 레이블링을 제공하는 AI 기반 이미지 레이블링 도구입니다.
facebookresearch/map-anything
단일 트랜스포머 모델을 사용하여 다양한 입력 조합으로부터 여러 3D 작업을 처리하는 유니버설 메트릭 3D 재구성용 오픈 소스 연구 프레임워크.
Breakthrough/PySceneDetect
장면 전환을 자동으로 식별하여 비디오를 개별 씬으로 분할하거나 프레임을 추출하는 비디오 카트 검출 및 분석 도구입니다.
google/GNM
인간의 기하학적 구조와 외형을 고정밀도로 표현하기 위한, GNM Head를 시작으로 하는 파라메트릭 통계적 3D 인간 모델 제품군.
kornia/kornia
딥러닝 파이프라인에 고전적인 이미지 처리 및 기하학적 시각 알고리즘을 통합할 수 있도록 해주는 PyTorch용 미분 가능한 컴퓨터 비전 라이브러리입니다.
Audiveris/audiveris
오픈소스 광학 음악 인식(OMR) 애플리케이션으로, 음악 스코어 이미지를 재생 및 편집 가능한 기호적 디지털 형식으로 변환합니다.
datalab-to/surya
91개 언어에서 고정밀 텍스트 인식, 레이아웃 분석, 테이블 추출을 제공하는 650M 파라미터 OCR 모델입니다.
torinmb/mediapipe-touchdesigner
외부 설치 없이 실시간 컴퓨터 비전 작업(자세 및 손 추적 등)을 수행할 수 있는 GPU 가속 MediaPipe 플러그인.
Faceplugin-ltd/Open-Source-Face-Recognition-SDK
딥러닝을 사용하여 온프레미스에서 얼굴 탐지, 랜드마크 탐지 및 유사도 비교를 제공하는 Windows 및 Linux용 오픈소스 얼굴 인식 SDK입니다.
1bananachicken/MaaNTE
게임 *이환* (The Ring)의 반복적인 플레이와 미니게임을 이미지 및 음성 인식을 통해 자동화하는 도구입니다.
pixpark/gpupixel
OpenGL/ES를 사용하는 고성능이며 크로스플랫폼인 C++ 라이브러리로, 이미지 및 비디오 뷰티 필터를 제공합니다.
ucam-eo/tessera
TESSERA는 구름으로 인해 손상된 위성 시계열 데이터를 전 지구적 표현 및 분석을 위한 컴팩트한 128차원 임베딩으로 변환하는 오픈 지리 공간 기반 모델입니다.