HUANGCHIHHUNGLeo/claude-real-video
Let Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.
해결하는 문제
대부분의 LLM은 동영상을 직접 '보는' 능력이 없거나 고정 간격 샘플링(예: 1초당 1프레임)에 의존합니다. 이는 빠른 컷을 놓치거나 정적 장면에서 토큰을 낭비하게 됩니다. claude-real-video는 장면 전환 감지와 중복 제거를 기반으로 가장 의미 있는 프레임만 추출하는 로컬 처리 파이프라인을 제공하여 토큰 비용을 줄이고 AI의 동영상 이해 능력을 향상시킵니다.
작동 방식
이 도구는 다음 파이프라인을 사용해 로컬에서 동영상을 처리합니다:
- 다운로드 및 추출:
yt-dlp로 URL에서 다운로드하고,ffmpeg로 장면 전환마다 프레임을 추출하며 최소 밀도 하한선을 유지합니다. - 중복 제거: 슬라이딩 윈도우 기반 중복 제거 시스템을 사용합니다. 3개의 채널(전역 픽셀 차이, 소규모 UI 변화의 안정화 감지, 액션 채널)을 활용해 LLM에 전달되는 것은 유일한 장면만이 되도록 합니다.
- 음성 인식: 기존 자막을 우선 처리하고, 없을 경우 OpenAI Whisper(또는
faster-whisper)를 사용해 로컬에서 음성 인식을 수행합니다. - 패키징: 키프레임, 타임스탬프가 포함된 JSON 파일, 트랜스크립트를 포함한 폴더를 출력합니다. 이 데이터는 LLM에 업로드할 수 있습니다. 또한
--grid옵션으로 프레임을 접합 시트로 정렬해 모델이 움직임을 추적하는 데 도움을 줍니다. - 통합: CLI, 로컬 웹 UI(
crv-web), 또는 MCP 서버로 실행 가능하며, Claude Desktop 및 Cursor와 같은 에이전트와 직접 통합할 수 있습니다.
대상 사용자
- AI 전문 사용자: 클라우드 서비스에 원본 파일을 업로드하지 않고 LLM으로 동영상을 분석하고 싶은 사용자.
- 개발자: Claude Code, Cursor와 같은 코딩 에이전트 사용자로, 에이전트가 동영상을 '보는' 기능(스킬/플러그인)을 갖기를 원하는 사용자.
- 연구자: 동영상 분석을 위해 고품질의 중복 제거된 키프레임 추출기가 필요한 사용자.
주요 특징
- 로컬 처리: 모든 프레임 추출과 음성 인식은 사용자 기기에서 수행되며, LLM에 공유되는 것은 최종적으로 선택된 데이터뿐입니다.
- 지능형 샘플링: 고정 간격이 아닌 장면 전환 감지를 사용해 빠른 컷을 포착하고 정적 슬라이드를 압축합니다.
- 고급 중복 제거: 컷아웃(A-B-A 컷) 이후에도 중복 프레임이 전송되지 않도록 방지합니다.
- 에이전트 통합: MCP 서버 및 다양한 에이전트 호스트용 플러그인으로 제공됩니다.
- 유연한 입력: YouTube, Instagram, TikTok, 로컬 파일을 지원합니다.
- 메모리 시스템: SQLite를 사용해 모든 시청한 동영상을 로컬로 인덱싱하여 사용자가 전체 동영상 라이브러리에서 검색 가능합니다(
crv-ask).
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트