jordanrendric/claude-video-vision
Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis
해결하는 문제
이 프로젝트는 Claude Code에 동영상 콘텐츠를 '시청'하고 이해할 수 있는 능력을 부여합니다. LLM은 원시 동영상 파일을 네이티브로 처리할 수 없기 때문에, 이 프로젝트는 동영상과 오디오를 Claude가 이해할 수 있는 형식으로 변환하는 '지각 계층'으로 작동합니다. 즉, 연속된 이미지(프레임)와 타임스탬프가 붙은 텍스트 트랜스크립트로 변환합니다.
작동 방식
이 플러그인은 MCP(Model Context Protocol) 서버를 사용하여 동영상을 처리합니다. ffmpeg를 사용해 시각적 프레임을 추출하고, 세 가지 오디오 백엔드 중 하나인 Gemini API, 로컬 Whisper, 또는 OpenAI API를 활용해 음성을 트랜스크립트합니다. YouTube 동영상의 경우 yt-dlp를 사용해 콘텐츠를 다운로드하고, 기존 자막을 우선적으로 가져온 후 트랜스크립트로 대체합니다. Claude는 이러한 이미지와 트랜스크립트를 받아 사용자의 질문에 답변하며, 요청에 따라 프레임 속도와 해상도를 자동으로 조정합니다.
대상 사용자
코드 환경 내에서 동영상 파일, 화면 녹화, YouTube 튜토리얼을 직접 분석하고자 하는 개발자들입니다.
주요 기능
- 유연한 오디오 백엔드: 클라우드 기반 API(Gemini, OpenAI) 또는
whisper.cpp를 통한 완전한 오프라인 로컬 처리를 지원합니다. - YouTube 통합: YouTube URL을 직접 지원하며, 자동으로 메타데이터와 자막을 가져옵니다.
- 적응형 추출: 사용자 요청에 따라 FPS와 해상도를 동적으로 변경합니다 (예: 특정 타임스탬프에 대해 고해상도, 긴 강의에는 낮은 FPS).
- 인터랙티브 설정: 설정 및 종속성 검사를 처리하는
/setup-video-vision워즈드를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch