oxbshw/watch-skill
Give AI agents eyes, ears, and verifiable results. Watch Skill turns video, audio and screen activity into searchable, timestamped evidence and proves work with deterministic contracts, not model opinion. DeepWatch is the agent workspace built on DeepSeek Harness. Python + npm, MCP, CLI, REST, Web.
해결하는 문제
Watch Skill은 AI 에이전트가 동영상을 '보는' 것과 기억하는 능력을 제공합니다. 질문이 제기될 때마다 동영상을 다시 처리해야 하는 문제와, 브라우저나 데스크톱에서 작업을 수행하는 에이전트에 대해 신뢰할 수 있는 검증이 부족한 문제를 해결합니다. 시각적인 '성공' 메시지가 기술적 실패를 가리고 있을 수 있기 때문에 이 문제는 특히 중요합니다.
작동 방식
이 시스템은 장면 인식 프레임, 화면 내 텍스트(OCR), 음성 인식을 사용하여 동영상, 라이브 스트림, 화면 녹화의 검색 가능하고 타임스탬프가 붙은 인덱스를 생성합니다. 풀 텍스트 및 벡터 기반의 하이브리드 검색 시스템을 사용하여 특정 타임스탬프를 포함한 질문에 답변합니다. 에이전트 워크플로우에서는 'THE LOOP'이라는 캡처-비판-수정 사이클을 구현하여 에이전트의 행동을 기록하고, 결정론적 계약 및 네트워크 요청을 기반으로 검증하여 작업이 실제로 성공했는지 확인합니다.
대상 사용자
LangChain, CrewAI, AutoGen과 같은 프레임워크를 사용하여 AI 에이전트를 개발하는 개발자, 그리고 Claude Code, Cursor, Windsurf과 같은 AI 코딩 어시스턴트 사용자 중에서 에이전트가 동영상 증거를 분석하거나 높은 신뢰도로 브라우저를 운영해야 하는 사람들을 대상으로 합니다.
주요 특징
- 지속적인 동영상 기억: 동영상을 한 번 분석하면 재다운로드나 재음성 인식 없이 여러 번 검색 가능.
- THE LOOP 검증: 시각적 비판과 결정론적 검사(예: 네트워크 요청이 실제로 200 OK를 반환했는지 확인)를 결합한 엄격한 브라우저/데스크톱 흐름 검증 프로세스.
- 로컬 우선 처리: 음성 인식에는 로컬 Whisper, 시각 처리에는 Ollama를 지원하여 클라우드 API에 대한 의존도를 줄입니다.
- 광범위한 통합: MCP 도구, Claude Code 스킬, 주요 에이전트 프레임워크용 네이티브 어댑터로 제공됩니다.
- 증거 기반 답변: 일반적인 요약이 아니라 타임스탬프 기반 인용과 신뢰도 수준을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트