ssrajadh/sentrysearch

Semantic search over videos using Gemini Embedding 2 or Qwen3-VL.

해결하는 문제

SentrySearch는 대량의 동영상 자료에 대해 의미 기반 검색을 가능하게 합니다. 수시간에 걸친 녹화물을 수동으로 스크롤하는 대신, 자연어 설명(예: "빨간 트럭이 정지 표지 무시")을 입력하거나 참조 이미지를 제공하여 관련 클립을 검색하고 자동으로 자릅니다.

작동 방식

이 도구는 동영상을 겹치는 청크로 나누어 처리합니다. 이 청크들은 다중 모달 모델(Google Gemini, Alibaba DashScope, 또는 로컬 Qwen3-VL 모델)을 사용해 벡터 임베딩으로 변환되어 로컬 ChromaDB 데이터베이스에 저장됩니다. 사용자가 검색할 때, 쿼리는 동일한 벡터 공간으로 임베딩되어 코사인 유사도를 사용해 저장된 동영상 임베딩과 매칭됩니다. 시스템은 또한 시각 언어 모델(VLM)을 사용해 상위 결과를 재순위 지정하여 더 높은 정확도를 달성할 수 있습니다.

대상 사용자

대량의 동영상 자료를 관리하는 모든 사람에게 설계되었습니다. 특히 테슬라 사용자나 보안 영상 리뷰어와 같이, 수동 검토 없이 특정 이벤트를 빠르게 찾고 싶은 사용자에게 적합합니다.

주요 기능

  • 다중 모달 검색: 텍스트 기반 자연어 쿼리와 이미지 기반 검색 모두 지원.
  • 유연한 백엔드: 클라우드 기반 API(Gemini, DashScope) 또는 완전히 로컬이고 개인적인 백엔드(Qwen3-VL) 제공.
  • 이상 탐지: 인덱스의 나머지와 크게 다른 통계적으로 이상한 클립을 식별하는 "하이라이트" 기능.
  • 테슬라 통합: 테슬라 드라이브레코더 파일의 텔레메트리 데이터(속도, 위치, 시간)를 자동으로 자른 클립에 직접 삽입 가능.
  • 자동 자르기: 원본 동영상 파일에서 일치하는 세그먼트를 자동으로 추출하여 새 클립으로 생성.
  • 에코시스템 통합: 동반 도구인 SentryMerge(다중 카메라 스티칭) 및 SentryBlur(정보 은폐)와 호환.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트