wendy7756/AI-Video-Transcriber

Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.

何を解決するか

AI Video Transcriber は、YouTube、TikTok、Bilibili など 30 以上のプラットフォームやローカルファイルから動画・音声コンテンツを構造化されたテキストに変換する統合的な方法を提供します。手動で音声を文字起こししたり、字幕を探したりする必要がなくなり、AI駆動の要約と翻訳機能により、長編コンテンツをより簡単に理解できるようにします。

動作方法

このツールは、メディア処理のためのマルチステージパイプラインを使用しています。

  1. 抽出: まず、プラットフォームからネイティブ字幕を抽出しようとします。字幕が見つからない場合は、Faster-Whisper を使用してローカルで音声を文字起こしします。
  2. 処理: ローカルアップロードの場合、FFmpeg を使って音声を Whisper 用の標準フォーマットに正規化します。
  3. AI強化: 得られた字幕テキストを OpenAI 互換の LLM に送信し、タイポの修正、文の完成、段落への整理を行います。
  4. 最終処理: システムは 11 のサポート言語のいずれかで要約を生成し、要約言語が元の言語と異なる場合は字幕を翻訳します。

対象ユーザー

Web やローカルストレージから動画・音声コンテンツをアーカイブ、要約、翻訳する必要があるクリエイター、研究者、学生。

特徴

  • 字幕最優先アーキテクチャ: ネイティブ字幕を優先し、ほぼ即時結果を得られます。Whisper はフォールバックとしてのみ使用されます。
  • 広範なプラットフォーム対応: yt-dlp がサポートするすべてのサイト(YouTube、TikTok、Bilibili など)に対応しています。
  • 柔軟なAI統合: OpenAI 互換の API エンドポイントをすべてサポートしており、OpenAI、OpenRouter、またはローカル LLM を使用できます。
  • エージェント対応: ヘッドレス CLI、Codex プラグイン、MCP サーバーを備えており、Claude Code などの AI エージェントとの統合が可能です。
  • ローカルファイル対応: .mp3、.mp4、.wav などさまざまなメディアフォーマットとプレーンテキストファイルを扱います。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト