wendy7756/AI-Video-Transcriber

Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.

解决的问题

AI Video Transcriber 提供了一种统一的方法,将来自 30 多个平台(如 YouTube、TikTok 和 Bilibili)或本地文件的视频和音频内容转换为结构化文本。它消除了手动转录音频或寻找字幕的需要,同时通过 AI 驱动的摘要和翻译功能,使长篇内容更易于消化。

工作原理

该工具使用多阶段流水线处理媒体:

  1. 提取:首先尝试从平台提取原生字幕。如果找不到字幕,则使用 Faster-Whisper 在本地转录音频。
  2. 处理:对于本地上传,使用 FFmpeg 将音频标准化为 Whisper 所需的标准格式。
  3. AI 增强:将生成的字幕发送到 OpenAI 兼容的 LLM,以纠正拼写错误、补全句子,并将文本组织成段落。
  4. 最终处理:系统会生成 11 种支持语言之一的摘要,并在摘要语言与源语言不同时翻译字幕。

适用人群

需要从网络或本地存储中归档、总结或翻译视频和音频内容的内容创作者、研究人员和学生。

主要亮点

  • 字幕优先架构:优先使用原生字幕以实现近乎即时的结果,仅在无字幕时使用 Whisper 作为后备。
  • 广泛平台支持:兼容 yt-dlp 支持的任何网站(如 YouTube、TikTok、Bilibili 等)。
  • 灵活的 AI 集成:支持任何 OpenAI 兼容的 API 端点,允许用户使用 OpenAI、OpenRouter 或本地 LLM。
  • 支持代理集成:包含无头 CLI、Codex 插件和 MCP 服务器,可与 Claude Code 等 AI 代理集成。
  • 本地文件支持:支持多种媒体格式(.mp3、.mp4、.wav 等)和纯文本文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目