HUANGCHIHHUNGLeo/claude-real-video

Let Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.

何を解決するか

多くのLLMは動画をネイティブに「見ることができず」、固定間隔のサンプリング(例:1秒ごとに1フレーム)に依存しています。これにより、高速カットを逃すか、静止シーンでトークンを無駄に消費する場合があります。claude-real-videoは、シーン変化検出と重複除去に基づいて、最も意味のあるフレームのみを抽出するローカル処理パイプラインを提供し、トークンコストを削減しながらAIの動画理解能力を向上させます。

動作方法

このツールは以下のパイプラインでローカルで動画を処理します:

  1. 取得と抽出yt-dlpでURLから取得し、ffmpegでシーン変化ごとにフレームを取得し、最小密度の下限を確保します。
  2. 重複除去:スライディングウィンドウ方式の重複除去システムを採用。3つのチャネル(グローバル画素差、小さなUI変化の安定化検出、アクションチャネル)を使用して、LLMに送られるのは唯一のショットのみになります。
  3. 音声認識:既存の字幕を優先。なければOpenAI Whisper(またはfaster-whisper)を用いてローカルで音声認識を行います。
  4. パッケージング:キーフレーム、タイムスタンプ付きJSONファイル、トランスクリプトを含むフォルダを出力。このデータはLLMにアップロード可能です。また、--gridオプションでフレームをコンタクトシートにタイル化し、モデルが動きを追跡しやすくします。
  5. 統合:CLI、ローカルWeb UI(crv-web)、またはMCPサーバーとして実行可能。Claude DesktopやCursorなどのエージェントと直接統合できます。

対象ユーザー

  • AIパワーユーザー:クラウドサービスに原始動画をアップロードせずにLLMで動画を分析したい人。
  • 開発者:Claude CodeやCursorなどのコーディングエージェントのユーザーで、エージェントが「動画を見る」スキル/プラグインを持つことを望む人。
  • 研究者:動画分析に高品質で重複除去されたキーフレーム抽出器が必要な人。

特徴

  • ローカル処理:すべてのフレーム抽出と音声認識はユーザーのマシン上で行われ、LLMに共有されるのは最終的に選ばれたデータのみ。
  • 知能的なサンプリング:固定間隔ではなくシーン変化検出を使用し、高速カットを捉え、静止スライドを圧縮。
  • 高度な重複除去:カットアウェイ(A-B-Aカット)後でも重複フレームが送信されないよう防止。
  • エージェント統合:MCPサーバーおよびさまざまなエージェントホスト用のプラグインとして提供。
  • 柔軟な入力:YouTube、Instagram、TikTok、ローカルファイルに対応。
  • メモリシステム:SQLiteですべての視聴済み動画をローカルにインデックス化。ユーザーは全動画ライブラリを検索可能(crv-ask)。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト