jordanrendric/claude-video-vision

Give Claude the ability to watch and understand videos — Claude Code plugin with frame extraction and multimodal audio analysis

何を解決するか

Claude Codeに「動画を視覚的に理解する」能力を提供します。LLMは生の動画ファイルをネイティブに処理できないため、このプロジェクトは、動画と音声をClaudeが解釈できる形式(連続する画像(フレーム)とタイムスタンプ付きテキストトランスクリプト)に変換する「知覚レイヤー」として機能します。

動作方法

このプラグインはMCP(Model Context Protocol)サーバーを使用して動画を処理します。ffmpeg を使って視覚的なフレームを抽出し、3つの音声バックエンドのいずれか(Gemini API、ローカルのWhisper、OpenAI API)を用いて音声をトランスクリプト化します。YouTube動画の場合は、yt-dlp を使ってコンテンツをダウンロードし、既存の字幕を優先して取得した後、トランスクリプトにfallbackします。Claudeはこれらの画像とトランスクリプトを受け取り、ユーザーの質問に回答します。フレームレートと解像度は、ユーザーの要求に応じて自動的に調整されます。

対象ユーザー

コード環境内で動画ファイル、スクリーンレコーディング、YouTubeチュートリアルを直接分析したい開発者。

特徴

  • 柔軟な音声バックエンド:クラウドベースのAPI(Gemini、OpenAI)または whisper.cpp を用いた完全オフラインのローカル処理をサポート。
  • YouTube統合:YouTube URLの直接サポートと、自動的なメタデータおよび字幕取得。
  • 適応的抽出:ユーザーのクエリに応じてFPSと解像度を動的に変更(例:特定のタイムスタンプでは高解像度、長時間の講義では低FPS)。
  • インタラクティブなセットアップ/setup-video-vision ウィザードを含み、設定と依存関係のチェックを簡単に行えます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch