jordanrendric/claude-video-vision
Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis
解決的問題
此專案為 Claude Code 提供「觀看」並理解影片內容的能力。由於大語言模型無法原生處理原始影片檔案,本專案扮演感知層的角色,將影片與音訊轉換為 Claude 可以理解的格式:一系列影像(畫面)與帶時間戳的文本轉錄。
運作方式
該外掛程式使用 MCP(模型上下文協定)伺服器處理影片。它利用 ffmpeg 提取視覺畫面,並使用三種音訊後端之一——Gemini API、本地 Whisper 或 OpenAI API——進行語音轉錄。針對 YouTube 影片,則使用 yt-dlp 下載內容,優先取得現有的字幕,再回退至轉錄。Claude 接收這些影像與轉錄內容來回答使用者問題,並根據特定請求自動調整畫面速率與解析度。
適用對象
需要在程式設計環境中直接分析影片檔案、螢幕錄影或 YouTube 教學影片的 Claude Code 使用者。
主要特色
- 彈性音訊後端:支援基於雲端的 API(Gemini、OpenAI)或透過
whisper.cpp實現的完全離線本地處理。 - YouTube 整合:直接支援 YouTube 連結,可自動取得元資料與字幕。
- 自適應提取:根據使用者查詢動態調整畫面速率與解析度(例如,特定時間點使用高解析度,長篇講座使用低畫面速率)。
- 互動式設定:內建
/setup-video-vision導引程式,用於處理設定與相依性檢查。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch