HUANGCHIHHUNGLeo/claude-real-video
Let Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.
何を解決するか
多くのLLMは動画をネイティブに「見ることができず」、固定間隔のサンプリング(例:1秒ごとに1フレーム)に依存しています。これにより、高速カットを逃すか、静止シーンでトークンを無駄に消費する場合があります。claude-real-videoは、シーン変化検出と重複除去に基づいて、最も意味のあるフレームのみを抽出するローカル処理パイプラインを提供し、トークンコストを削減しながらAIの動画理解能力を向上させます。
動作方法
このツールは以下のパイプラインでローカルで動画を処理します:
- 取得と抽出:
yt-dlpでURLから取得し、ffmpegでシーン変化ごとにフレームを取得し、最小密度の下限を確保します。 - 重複除去:スライディングウィンドウ方式の重複除去システムを採用。3つのチャネル(グローバル画素差、小さなUI変化の安定化検出、アクションチャネル)を使用して、LLMに送られるのは唯一のショットのみになります。
- 音声認識:既存の字幕を優先。なければOpenAI Whisper(または
faster-whisper)を用いてローカルで音声認識を行います。 - パッケージング:キーフレーム、タイムスタンプ付きJSONファイル、トランスクリプトを含むフォルダを出力。このデータはLLMにアップロード可能です。また、
--gridオプションでフレームをコンタクトシートにタイル化し、モデルが動きを追跡しやすくします。 - 統合:CLI、ローカルWeb UI(
crv-web)、またはMCPサーバーとして実行可能。Claude DesktopやCursorなどのエージェントと直接統合できます。
対象ユーザー
- AIパワーユーザー:クラウドサービスに原始動画をアップロードせずにLLMで動画を分析したい人。
- 開発者:Claude CodeやCursorなどのコーディングエージェントのユーザーで、エージェントが「動画を見る」スキル/プラグインを持つことを望む人。
- 研究者:動画分析に高品質で重複除去されたキーフレーム抽出器が必要な人。
特徴
- ローカル処理:すべてのフレーム抽出と音声認識はユーザーのマシン上で行われ、LLMに共有されるのは最終的に選ばれたデータのみ。
- 知能的なサンプリング:固定間隔ではなくシーン変化検出を使用し、高速カットを捉え、静止スライドを圧縮。
- 高度な重複除去:カットアウェイ(A-B-Aカット)後でも重複フレームが送信されないよう防止。
- エージェント統合:MCPサーバーおよびさまざまなエージェントホスト用のプラグインとして提供。
- 柔軟な入力:YouTube、Instagram、TikTok、ローカルファイルに対応。
- メモリシステム:SQLiteですべての視聴済み動画をローカルにインデックス化。ユーザーは全動画ライブラリを検索可能(
crv-ask)。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト