zh-plus/openlrc

Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。

解決的問題

Open-Lyrics 提供了一種簡化的方式,將音訊或影片檔案轉換為同步字幕(特別是 .lrc 檔案)。它透過結合高速語音轉文字與大型語言模型(LLM)的上下文潤飾能力,解決自動化轉錄中不準確或機械化的翻譯問題。

工作原理

該套件遵循多階段流程:

  1. 音訊預處理:使用音量歸一化和可選的雜訊抑制(透過 DPDFNet)來減少轉錄過程中的幻覺。
  2. 轉錄:使用 faster-whisper 將音訊轉換為帶時間戳的文本。
  3. 翻譯與潤飾:將轉錄的文本傳送給 LLM(如 GPT-4、Claude 或 Gemini)進行翻譯與潤飾。使用上下文感知的提示,並可利用自訂詞彙表確保專業術語翻譯準確。
  4. 輸出:最終結果以同步字幕檔案形式儲存。

適用對象

  • 建構字幕生成工具的開發者。
  • 需要為音訊/影片內容生成高品質翻譯歌詞或字幕的內容創作者。
  • 希望透過本地 ASR 與雲端 LLM 混合方式,自動化播客、歌曲或影片的轉錄與翻譯的使用者。

特色亮點

  • 混合模型支援:提供「輕量翻譯模式」,允許使用者使用低成本模型進行初步翻譯,再用大型模型進行修正,以節省 token 消耗。
  • 上下文準確性:保持翻譯段落間的上下文連貫性,避免字幕斷裂。
  • 靈活整合:支援多種 LLM 提供商(OpenAI、Anthropic、Google、OpenRouter)及本地 OpenAI 相容端點。
  • 自訂詞彙表:支援 JSON/YAML 格式的詞彙表,確保專業術語翻譯的一致性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案