wendy7756/AI-Video-Transcriber
Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.
解決的問題
AI Video Transcriber 提供了一種統一的方法,將來自 30 多個平台(如 YouTube、TikTok 和 Bilibili)或本機檔案的影片與音訊內容轉換為結構化文字。它消除了手動轉錄音訊或尋找字幕的需要,同時透過 AI 驅動的摘要與翻譯功能,讓長篇內容更易消化。
工作原理
該工具使用多階段流程處理媒體:
- 提取:首先嘗試從平台提取原生字幕。若找不到字幕,則使用 Faster-Whisper 在本機轉錄音訊。
- 處理:對於本機上傳,使用 FFmpeg 將音訊標準化為 Whisper 所需的標準格式。
- AI 增強:將生成的字幕傳送至 OpenAI 相容的 LLM,以修正拼字錯誤、補全文句,並將文字組織成段落。
- 最終處理:系統會生成 11 種支援語言之一的摘要,並在摘要語言與來源語言不同時翻譯字幕。
適用對象
需要從網路或本機儲存中歸檔、總結或翻譯影片與音訊內容的內容創作者、研究人員與學生。
主要亮點
- 字幕優先架構:優先使用原生字幕以實現近乎即時的結果,僅在無字幕時使用 Whisper 作為備用。
- 廣泛平台支援:相容
yt-dlp支援的任何網站(如 YouTube、TikTok、Bilibili 等)。 - 彈性 AI 集成:支援任何 OpenAI 相容的 API 端點,允許使用者使用 OpenAI、OpenRouter 或本機 LLM。
- 支援代理整合:包含無頭 CLI、Codex 插件與 MCP 伺服器,可與 Claude Code 等 AI 代理整合。
- 本機檔案支援:支援多種媒體格式(.mp3、.mp4、.wav 等)與純文字檔案。
相關
- 專案
- 專案
- 專案
- 專案
- 專案