jordanrendric/claude-video-vision

Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis

解决的问题

该插件为 Claude Code 提供了「观看」并理解视频内容的能力。由于大语言模型无法原生处理原始视频文件,该项目充当感知层,将视频和音频转换为 Claude 可以理解的格式:一系列图像(帧)和带时间戳的文本转录。

工作原理

该插件使用 MCP(模型上下文协议)服务器处理视频。它利用 ffmpeg 提取视觉帧,并使用三种音频后端之一——Gemini API、本地 Whisper 或 OpenAI API——进行语音转录。对于 YouTube 视频,它使用 yt-dlp 下载内容,并优先获取现有字幕,再回退到转录。Claude 接收这些图像和转录内容来回答用户问题,并根据具体请求自动调整帧率和分辨率。

适用人群

需要在编码环境中直接分析视频文件、屏幕录制或 YouTube 教程的 Claude Code 用户。

主要亮点

  • 灵活的音频后端:支持基于云的 API(Gemini、OpenAI)或通过 whisper.cpp 实现的完全离线本地处理。
  • YouTube 集成:直接支持 YouTube 链接,可自动获取元数据和字幕。
  • 自适应提取:根据用户查询动态调整帧率和分辨率(例如,特定时间戳使用高分辨率,长讲座使用低帧率)。
  • 交互式设置:包含 /setup-video-vision 向导,用于处理配置和依赖项检查。

相关