zh-plus/openlrc

Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。

解决的问题

Open-Lyrics 提供了一种简化的方法,将音频或视频文件转换为同步字幕(特别是 .lrc 文件)。它通过结合高速语音转文字与大语言模型(LLM)的上下文润色能力,解决了自动化转录中不准确或机械化的翻译问题。

工作原理

该库遵循多阶段流程:

  1. 音频预处理:使用音量归一化和可选的噪声抑制(通过 DPDFNet)来减少转录过程中的幻觉。
  2. 转录:使用 faster-whisper 将音频转换为带时间戳的文本。
  3. 翻译与润色:将转录的文本发送给 LLM(如 GPT-4、Claude 或 Gemini)进行翻译和润色。使用上下文感知的提示,并可利用自定义术语表确保专业术语翻译准确。
  4. 输出:最终结果保存为同步字幕文件。

适用人群

  • 构建字幕生成工具的开发者。
  • 需要为音频/视频内容生成高质量翻译歌词或字幕的内容创作者。
  • 希望通过本地 ASR 与云上 LLM 混合方式,自动化播客、歌曲或视频的转录与翻译的用户。

特色亮点

  • 混合模型支持:提供「轻量翻译模式」,允许用户使用低成本模型进行初步翻译,再用大模型进行修正,以节省 token 消耗。
  • 上下文准确性:保持翻译段落间的上下文连贯性,避免字幕断裂。
  • 灵活集成:支持多种 LLM 提供商(OpenAI、Anthropic、Google、OpenRouter)及本地 OpenAI 兼容端点。
  • 自定义术语表:支持 JSON/YAML 格式的术语表,确保专业术语翻译的一致性。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目