wendy7756/AI-Video-Transcriber
Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.
解决的问题
AI Video Transcriber 提供了一种统一的方法,将来自 30 多个平台(如 YouTube、TikTok 和 Bilibili)或本地文件的视频和音频内容转换为结构化文本。它消除了手动转录音频或寻找字幕的需要,同时通过 AI 驱动的摘要和翻译功能,使长篇内容更易于消化。
工作原理
该工具使用多阶段流水线处理媒体:
- 提取:首先尝试从平台提取原生字幕。如果找不到字幕,则使用 Faster-Whisper 在本地转录音频。
- 处理:对于本地上传,使用 FFmpeg 将音频标准化为 Whisper 所需的标准格式。
- AI 增强:将生成的字幕发送到 OpenAI 兼容的 LLM,以纠正拼写错误、补全句子,并将文本组织成段落。
- 最终处理:系统会生成 11 种支持语言之一的摘要,并在摘要语言与源语言不同时翻译字幕。
适用人群
需要从网络或本地存储中归档、总结或翻译视频和音频内容的内容创作者、研究人员和学生。
主要亮点
- 字幕优先架构:优先使用原生字幕以实现近乎即时的结果,仅在无字幕时使用 Whisper 作为后备。
- 广泛平台支持:兼容
yt-dlp支持的任何网站(如 YouTube、TikTok、Bilibili 等)。 - 灵活的 AI 集成:支持任何 OpenAI 兼容的 API 端点,允许用户使用 OpenAI、OpenRouter 或本地 LLM。
- 支持代理集成:包含无头 CLI、Codex 插件和 MCP 服务器,可与 Claude Code 等 AI 代理集成。
- 本地文件支持:支持多种媒体格式(.mp3、.mp4、.wav 等)和纯文本文件。
相关
- 项目
- 项目
- 项目
- 项目
- 项目