taoufik123-collab/claude-watch

Give Claude the ability to watch any video — scene-change frames + transcript + a structured report, with a 0-10s hook microscope and optional Obsidian auto-save.

해결하는 문제

Claude는 원래 동영상을 "보는" 기능을 지원하지 않습니다. 이 프로젝트는 동영상 파일이나 URL(Youtube, TikTok 등)을 처리할 수 있는 기능을 제공하여, 핵심 프레임과 자막을 추출함으로써 AI가 시각적·음성 콘텐츠에 대해 질문에 답할 수 있도록 합니다. 사용자는 전체 동영상을 시청할 필요가 없습니다.

작동 방식

  1. 처리 파이프라인: 도구는 yt-dlp를 사용해 동영상을 다운로드하고, ffmpeg로 프레임을 추출합니다. 100프레임을 한도로 하는 자동 스케일링 프레임 예산을 사용하여 토큰 비용을 관리하면서도 시각적 커버리지를 유지합니다.
  2. 자막 추출: 먼저 내장 자막을 가져오려고 시도합니다. 없을 경우 Groq 또는 OpenAI를 통해 Whisper를 사용해 타임스탬프가 있는 자막을 생성합니다.
  3. 다중 모달 입력: 추출된 프레임(JPEG 형식)과 자막이 Claude의 컨텍스트에 입력되어 AI가 콘텐츠를 "보며" "듣는" 것이 가능해집니다.
  4. 전문 분석: 처음 10초에 대한 집중 분석을 위한 "훅 마이크로스코프"와 장면 전환 감지를 통해 고정 간격이 아닌 장면 전환 시마다 1개의 프레임을 캡처합니다.
  5. 통합: Claude Code용 플러그인, claude.ai용 스킬, 또는 Codex 스킬로 설치 가능합니다.

대상 사용자

  • 콘텐츠 제작자: 유행하는 훅과 경쟁 콘텐츠 구조를 분석하기 위해.
  • 개발자: 화면 녹화를 통해 버그를 진단하기 위해.
  • 연구자: 2배속으로 시청할 필요 없이 긴 동영상을 빠르게 요약하기 위해.

주요 기능

  • 장면 전환 기반 추출: 시각적 전환 기반으로 프레임을 캡처하여 동영상 길이에 관계없이 토큰 비용을 일정하게 유지합니다.
  • 훅 마이크로스코프: 동영상의 처음 10초에 대해 고밀도 프레임과 단어 수준의 자막을 제공합니다.
  • Obsidian 통합: 시청한 동영상을 연결된 위키 항목으로 자동 저장하는 옵션 기능.
  • 집중 모드: --start--end 플래그를 지원하여 특정 시간 구간을 더 밀도 있게 스캔할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트