jeremyipark/vision-demos

Fun real-world computer vision demos!

vision‑demos – 실세계 컴퓨터 비전 데모

개요 – 최신 자세 추정 및 분할 모델이 일상적인 활동에 어떻게 적용될 수 있는지를 보여주는 바로 실행 가능한 데모 애플리케이션의 작은 컬렉션입니다. 각 데모는 전용 README, 설치 단계, 짧은 비디오 스타일 일러스트레이션을 포함하는 자체 하위 폴더에 위치합니다.

데모 기능 핵심 모델
dance_sync 동일한 안무의 두 비디오를 가져와 추정된 신체 자세를 오버레이하고 댄서들이 얼마나 잘 동기화되어 있는지를 정량화하는 수치적 유사도 점수를 생성합니다. vitpose-plus-large
chin_ups 턱걸이를 하는 사람의 클립을 분석하고 반복 횟수를 세며 각 반복의 상승 및 하강 단계에 타임스탬프를 부여합니다. vitpose-plus-large
rock_climbing 볼더링 벽을 개별 홀드로 분할하고 클라이머가 어떤 홀드를 어떤 순서로 사용했는지 식별하며 같은 루트의 여러 시도를 비교합니다. sam3.1 (분할) + vitpose-plus-large (자세)
running 러너의 카덴스를 측정하고 각 발 착지(풋 스트라이크)에 타임스탬프를 부여하며 접촉 시 평균 무릎 모양 프로파일을 계산합니다. vitpose-plus-large

작동 방식

  • 자세 추정vitpose-plus-large 모델(Vision-Transformer 기반 인간 자세 검출기)로 수행됩니다. 이 모델은 모든 프레임에 대해 2D 관절 좌표를 반환하며 데모는 이를 사용하여 타이밍, 유사도 또는 생체역학적 지표를 계산합니다.
  • 클라이밍 데모의 분할은 벽 위의 개별 클라이밍 홀드를 분리하기 위해 Meta의 sam3.1 (Segment Anything Model)에 의존합니다.
  • 간단한 Python 스크립트가 모델 출력을 결합하고 원본 비디오에 시각화를 오버레이하며 썸네일 패널에 표시되는 수치 요약을 생성합니다.

시작하기

  1. 저장소를 클론합니다.
  2. 관심 있는 하위 디렉토리의 데모별 README를 따릅니다(예: dance_sync/README.md).
  3. 나열된 Python 의존성을 설치합니다(일반적으로 torch, opencv-python, VLM 모델 클라이언트 라이브러리).
  4. 제공된 링크를 통해 필요한 모델 가중치를 다운로드합니다(README는 VLM 모델 허브를 가리킵니다).
  5. 자체 비디오 파일에서 데모 스크립트를 실행합니다.

대상 독자

  • 스포츠, 댄스 또는 운동 과학에 대한 자세 기반 분석의 빠르고 구체적인 예시를 원하는 연구자나 취미 애호가.
  • 동일한 모델을 중심으로 맞춤형 분석 파이프라인을 구축하기 위한 템플릿을 찾는 개발자.

라이선스

Apache‑2.0 – 출처를 명시하면 상업적 및 비상업적 사용이 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트