jordanrendric/claude-video-vision

Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis

解決的問題

此專案為 Claude Code 提供「觀看」並理解影片內容的能力。由於大語言模型無法原生處理原始影片檔案,本專案扮演感知層的角色,將影片與音訊轉換為 Claude 可以理解的格式:一系列影像(畫面)與帶時間戳的文本轉錄。

運作方式

該外掛程式使用 MCP(模型上下文協定)伺服器處理影片。它利用 ffmpeg 提取視覺畫面,並使用三種音訊後端之一——Gemini API、本地 Whisper 或 OpenAI API——進行語音轉錄。針對 YouTube 影片,則使用 yt-dlp 下載內容,優先取得現有的字幕,再回退至轉錄。Claude 接收這些影像與轉錄內容來回答使用者問題,並根據特定請求自動調整畫面速率與解析度。

適用對象

需要在程式設計環境中直接分析影片檔案、螢幕錄影或 YouTube 教學影片的 Claude Code 使用者。

主要特色

  • 彈性音訊後端:支援基於雲端的 API(Gemini、OpenAI)或透過 whisper.cpp 實現的完全離線本地處理。
  • YouTube 整合:直接支援 YouTube 連結,可自動取得元資料與字幕。
  • 自適應提取:根據使用者查詢動態調整畫面速率與解析度(例如,特定時間點使用高解析度,長篇講座使用低畫面速率)。
  • 互動式設定:內建 /setup-video-vision 導引程式,用於處理設定與相依性檢查。

相關