zh-plus/openlrc
Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。
解决的问题
Open-Lyrics 提供了一种简化的方法,将音频或视频文件转换为同步字幕(特别是 .lrc 文件)。它通过结合高速语音转文字与大语言模型(LLM)的上下文润色能力,解决了自动化转录中不准确或机械化的翻译问题。
工作原理
该库遵循多阶段流程:
- 音频预处理:使用音量归一化和可选的噪声抑制(通过 DPDFNet)来减少转录过程中的幻觉。
- 转录:使用
faster-whisper将音频转换为带时间戳的文本。 - 翻译与润色:将转录的文本发送给 LLM(如 GPT-4、Claude 或 Gemini)进行翻译和润色。使用上下文感知的提示,并可利用自定义术语表确保专业术语翻译准确。
- 输出:最终结果保存为同步字幕文件。
适用人群
- 构建字幕生成工具的开发者。
- 需要为音频/视频内容生成高质量翻译歌词或字幕的内容创作者。
- 希望通过本地 ASR 与云上 LLM 混合方式,自动化播客、歌曲或视频的转录与翻译的用户。
特色亮点
- 混合模型支持:提供「轻量翻译模式」,允许用户使用低成本模型进行初步翻译,再用大模型进行修正,以节省 token 消耗。
- 上下文准确性:保持翻译段落间的上下文连贯性,避免字幕断裂。
- 灵活集成:支持多种 LLM 提供商(OpenAI、Anthropic、Google、OpenRouter)及本地 OpenAI 兼容端点。
- 自定义术语表:支持 JSON/YAML 格式的术语表,确保专业术语翻译的一致性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目