taoufik123-collab/claude-watch
Give Claude the ability to watch any video — scene-change frames + transcript + a structured report, with a 0-10s hook microscope and optional Obsidian auto-save.
解決的問題
Claude 無法原生「觀看」影片。本專案提供一個技能,讓 Claude 可處理影片檔案或 URL(YouTube、TikTok 等),透過提取關鍵幀與字幕,使 AI 能回答關於視覺與音訊內容的問題,而無需使用者觀看完整影片。
工作原理
- 處理流程:該工具使用
yt-dlp下載影片,使用ffmpeg提取幀。採用自動擴展的幀預算(上限為 100 幀),在控制 token 成本的同時維持視覺覆蓋範圍。 - 字幕提取:首先嘗試取得原生字幕;若不可用,則使用 Whisper(透過 Groq 或 OpenAI)生成帶時間戳的字幕。
- 多模態輸入:提取的幀(JPEG 格式)與字幕被輸入 Claude 的上下文,使 AI 能夠「看到」與「聽到」內容。
- 專項分析:包含「鉤子顯微鏡」,用於對前 10 秒進行密集分析,並透過場景變換檢測,每場景僅提取一幀,而非固定間隔。
- 整合方式:可作為 Claude Code 的插件、claude.ai 的技能,或 Codex 技能安裝使用。
適用對象
- 內容創作者:分析爆紅鉤子與競爭對手的內容結構。
- 開發者:透過螢幕錄製診斷 bug。
- 研究人員:無需以 2 倍速觀看,快速總結長影片。
主要亮點
- 基於場景變換的幀提取:根據視覺剪輯點捕捉幀,無論影片長度如何,token 成本皆能保持穩定。
- 鉤子顯微鏡:為影片前 10 秒提供高密度幀與逐字字幕。
- Obsidian 整合:可選自動儲存功能,將觀看過的影片轉為連結的維基條目。
- 聚焦模式:支援
--start與--end標誌,對特定時間區段進行更密集的掃描。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案