jeremyipark/vision-demos
Fun real-world computer vision demos!
vision‑demos – 실세계 컴퓨터 비전 데모
개요 – 최신 자세 추정 및 분할 모델이 일상적인 활동에 어떻게 적용될 수 있는지를 보여주는 바로 실행 가능한 데모 애플리케이션의 작은 컬렉션입니다. 각 데모는 전용 README, 설치 단계, 짧은 비디오 스타일 일러스트레이션을 포함하는 자체 하위 폴더에 위치합니다.
| 데모 | 기능 | 핵심 모델 |
|---|---|---|
| dance_sync | 동일한 안무의 두 비디오를 가져와 추정된 신체 자세를 오버레이하고 댄서들이 얼마나 잘 동기화되어 있는지를 정량화하는 수치적 유사도 점수를 생성합니다. | vitpose-plus-large |
| chin_ups | 턱걸이를 하는 사람의 클립을 분석하고 반복 횟수를 세며 각 반복의 상승 및 하강 단계에 타임스탬프를 부여합니다. | vitpose-plus-large |
| rock_climbing | 볼더링 벽을 개별 홀드로 분할하고 클라이머가 어떤 홀드를 어떤 순서로 사용했는지 식별하며 같은 루트의 여러 시도를 비교합니다. | sam3.1 (분할) + vitpose-plus-large (자세) |
| running | 러너의 카덴스를 측정하고 각 발 착지(풋 스트라이크)에 타임스탬프를 부여하며 접촉 시 평균 무릎 모양 프로파일을 계산합니다. | vitpose-plus-large |
작동 방식
- 자세 추정은
vitpose-plus-large모델(Vision-Transformer 기반 인간 자세 검출기)로 수행됩니다. 이 모델은 모든 프레임에 대해 2D 관절 좌표를 반환하며 데모는 이를 사용하여 타이밍, 유사도 또는 생체역학적 지표를 계산합니다. - 클라이밍 데모의 분할은 벽 위의 개별 클라이밍 홀드를 분리하기 위해 Meta의
sam3.1(Segment Anything Model)에 의존합니다. - 간단한 Python 스크립트가 모델 출력을 결합하고 원본 비디오에 시각화를 오버레이하며 썸네일 패널에 표시되는 수치 요약을 생성합니다.
시작하기
- 저장소를 클론합니다.
- 관심 있는 하위 디렉토리의 데모별 README를 따릅니다(예:
dance_sync/README.md). - 나열된 Python 의존성을 설치합니다(일반적으로
torch,opencv-python, VLM 모델 클라이언트 라이브러리). - 제공된 링크를 통해 필요한 모델 가중치를 다운로드합니다(README는 VLM 모델 허브를 가리킵니다).
- 자체 비디오 파일에서 데모 스크립트를 실행합니다.
대상 독자
- 스포츠, 댄스 또는 운동 과학에 대한 자세 기반 분석의 빠르고 구체적인 예시를 원하는 연구자나 취미 애호가.
- 동일한 모델을 중심으로 맞춤형 분석 파이프라인을 구축하기 위한 템플릿을 찾는 개발자.
라이선스
Apache‑2.0 – 출처를 명시하면 상업적 및 비상업적 사용이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트