jordanrendric/claude-video-vision
Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis
解决的问题
该插件为 Claude Code 提供了「观看」并理解视频内容的能力。由于大语言模型无法原生处理原始视频文件,该项目充当感知层,将视频和音频转换为 Claude 可以理解的格式:一系列图像(帧)和带时间戳的文本转录。
工作原理
该插件使用 MCP(模型上下文协议)服务器处理视频。它利用 ffmpeg 提取视觉帧,并使用三种音频后端之一——Gemini API、本地 Whisper 或 OpenAI API——进行语音转录。对于 YouTube 视频,它使用 yt-dlp 下载内容,并优先获取现有字幕,再回退到转录。Claude 接收这些图像和转录内容来回答用户问题,并根据具体请求自动调整帧率和分辨率。
适用人群
需要在编码环境中直接分析视频文件、屏幕录制或 YouTube 教程的 Claude Code 用户。
主要亮点
- 灵活的音频后端:支持基于云的 API(Gemini、OpenAI)或通过
whisper.cpp实现的完全离线本地处理。 - YouTube 集成:直接支持 YouTube 链接,可自动获取元数据和字幕。
- 自适应提取:根据用户查询动态调整帧率和分辨率(例如,特定时间戳使用高分辨率,长讲座使用低帧率)。
- 交互式设置:包含
/setup-video-vision向导,用于处理配置和依赖项检查。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch