zh-plus/openlrc
Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。
解決的問題
Open-Lyrics 提供了一種簡化的方式,將音訊或影片檔案轉換為同步字幕(特別是 .lrc 檔案)。它透過結合高速語音轉文字與大型語言模型(LLM)的上下文潤飾能力,解決自動化轉錄中不準確或機械化的翻譯問題。
工作原理
該套件遵循多階段流程:
- 音訊預處理:使用音量歸一化和可選的雜訊抑制(透過 DPDFNet)來減少轉錄過程中的幻覺。
- 轉錄:使用
faster-whisper將音訊轉換為帶時間戳的文本。 - 翻譯與潤飾:將轉錄的文本傳送給 LLM(如 GPT-4、Claude 或 Gemini)進行翻譯與潤飾。使用上下文感知的提示,並可利用自訂詞彙表確保專業術語翻譯準確。
- 輸出:最終結果以同步字幕檔案形式儲存。
適用對象
- 建構字幕生成工具的開發者。
- 需要為音訊/影片內容生成高品質翻譯歌詞或字幕的內容創作者。
- 希望透過本地 ASR 與雲端 LLM 混合方式,自動化播客、歌曲或影片的轉錄與翻譯的使用者。
特色亮點
- 混合模型支援:提供「輕量翻譯模式」,允許使用者使用低成本模型進行初步翻譯,再用大型模型進行修正,以節省 token 消耗。
- 上下文準確性:保持翻譯段落間的上下文連貫性,避免字幕斷裂。
- 靈活整合:支援多種 LLM 提供商(OpenAI、Anthropic、Google、OpenRouter)及本地 OpenAI 相容端點。
- 自訂詞彙表:支援 JSON/YAML 格式的詞彙表,確保專業術語翻譯的一致性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案