taoufik123-collab/claude-watch
Give Claude the ability to watch any video — scene-change frames + transcript + a structured report, with a 0-10s hook microscope and optional Obsidian auto-save.
解决的问题
Claude 无法原生 "观看" 视频。本项目提供一个技能,允许 Claude 处理视频文件或 URL(YouTube、TikTok 等),通过提取关键帧和字幕,使 AI 能够回答关于视觉和音频内容的问题,而无需用户观看完整视频。
工作原理
- 处理流水线:该工具使用
yt-dlp下载视频,使用ffmpeg提取帧。采用自动扩展的帧预算(上限为 100 帧),在控制 token 成本的同时保持视觉覆盖范围。 - 字幕提取:首先尝试获取原生字幕;若不可用,则使用 Whisper(通过 Groq 或 OpenAI)生成带时间戳的字幕。
- 多模态输入:提取的帧(JPEG 格式)和字幕被输入 Claude 的上下文,使 AI 能够 "看到" 和 "听到" 内容。
- 专项分析:包含 "钩子显微镜",用于对前 10 秒进行密集分析,并通过场景变化检测,每场景仅提取一帧,而非固定间隔。
- 集成方式:可作为 Claude Code 的插件、claude.ai 的技能,或 Codex 技能安装使用。
适用人群
- 内容创作者:分析爆款钩子和竞争对手的内容结构。
- 开发者:通过屏幕录制诊断 bug。
- 研究人员:无需以 2 倍速观看,快速总结长视频。
主要亮点
- 基于场景变化的帧提取:根据视觉剪辑点捕捉帧,无论视频长度如何,token 成本保持稳定。
- 钩子显微镜:为视频前 10 秒提供高密度帧和逐词字幕。
- Obsidian 集成:可选自动保存功能,将观看过的视频转为连接的维基条目。
- 聚焦模式:支持
--start和--end标志,对特定时间段进行更密集的扫描。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目