wendy7756/AI-Video-Transcriber

Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.

解決的問題

AI Video Transcriber 提供了一種統一的方法,將來自 30 多個平台(如 YouTube、TikTok 和 Bilibili)或本機檔案的影片與音訊內容轉換為結構化文字。它消除了手動轉錄音訊或尋找字幕的需要,同時透過 AI 驅動的摘要與翻譯功能,讓長篇內容更易消化。

工作原理

該工具使用多階段流程處理媒體:

  1. 提取:首先嘗試從平台提取原生字幕。若找不到字幕,則使用 Faster-Whisper 在本機轉錄音訊。
  2. 處理:對於本機上傳,使用 FFmpeg 將音訊標準化為 Whisper 所需的標準格式。
  3. AI 增強:將生成的字幕傳送至 OpenAI 相容的 LLM,以修正拼字錯誤、補全文句,並將文字組織成段落。
  4. 最終處理:系統會生成 11 種支援語言之一的摘要,並在摘要語言與來源語言不同時翻譯字幕。

適用對象

需要從網路或本機儲存中歸檔、總結或翻譯影片與音訊內容的內容創作者、研究人員與學生。

主要亮點

  • 字幕優先架構:優先使用原生字幕以實現近乎即時的結果,僅在無字幕時使用 Whisper 作為備用。
  • 廣泛平台支援:相容 yt-dlp 支援的任何網站(如 YouTube、TikTok、Bilibili 等)。
  • 彈性 AI 集成:支援任何 OpenAI 相容的 API 端點,允許使用者使用 OpenAI、OpenRouter 或本機 LLM。
  • 支援代理整合:包含無頭 CLI、Codex 插件與 MCP 伺服器,可與 Claude Code 等 AI 代理整合。
  • 本機檔案支援:支援多種媒體格式(.mp3、.mp4、.wav 等)與純文字檔案。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案