taoufik123-collab/claude-watch

Give Claude the ability to watch any video — scene-change frames + transcript + a structured report, with a 0-10s hook microscope and optional Obsidian auto-save.

解决的问题

Claude 无法原生 "观看" 视频。本项目提供一个技能,允许 Claude 处理视频文件或 URL(YouTube、TikTok 等),通过提取关键帧和字幕,使 AI 能够回答关于视觉和音频内容的问题,而无需用户观看完整视频。

工作原理

  1. 处理流水线:该工具使用 yt-dlp 下载视频,使用 ffmpeg 提取帧。采用自动扩展的帧预算(上限为 100 帧),在控制 token 成本的同时保持视觉覆盖范围。
  2. 字幕提取:首先尝试获取原生字幕;若不可用,则使用 Whisper(通过 Groq 或 OpenAI)生成带时间戳的字幕。
  3. 多模态输入:提取的帧(JPEG 格式)和字幕被输入 Claude 的上下文,使 AI 能够 "看到" 和 "听到" 内容。
  4. 专项分析:包含 "钩子显微镜",用于对前 10 秒进行密集分析,并通过场景变化检测,每场景仅提取一帧,而非固定间隔。
  5. 集成方式:可作为 Claude Code 的插件、claude.ai 的技能,或 Codex 技能安装使用。

适用人群

  • 内容创作者:分析爆款钩子和竞争对手的内容结构。
  • 开发者:通过屏幕录制诊断 bug。
  • 研究人员:无需以 2 倍速观看,快速总结长视频。

主要亮点

  • 基于场景变化的帧提取:根据视觉剪辑点捕捉帧,无论视频长度如何,token 成本保持稳定。
  • 钩子显微镜:为视频前 10 秒提供高密度帧和逐词字幕。
  • Obsidian 集成:可选自动保存功能,将观看过的视频转为连接的维基条目。
  • 聚焦模式:支持 --start--end 标志,对特定时间段进行更密集的扫描。

相关