zh-plus/openlrc
Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。
何を解決するか
Open-Lyrics は、オーディオまたは動画ファイルを同期サブタイトル(特に .lrc ファイル)に変換するためのスムーズな方法を提供します。自動音声認識における不正確または機械的な翻訳の問題を、高速な音声認識と大規模言語モデル(LLM)の文脈認識による仕上げ機能を組み合わせることで解決します。
動作方法
このライブラリは、複数段階のパイプラインに従います:
- オーディオ前処理:音量の正規化と、DPDFNet を通じたオプションのノイズ除去により、音声認識中の誤認識を低減します。
- 音声認識:
faster-whisperを使用して、タイムスタンプ付きのテキストに音声を変換します。 - 翻訳と仕上げ:認識されたテキストを、GPT-4、Claude、Gemini などの LLM に送信して翻訳および仕上げを行います。文脈に応じたプロンプトを使用し、カスタム用語集を活用することで、専門用語の正確な翻訳を保証できます。
- 出力:最終的な結果は、同期サブタイトルファイルとして保存されます。
対象ユーザー
- サブタイトル生成ツールを開発する開発者。
- オーディオ/動画コンテンツ用に高品質な翻訳歌詞や字幕が必要なコンテンツクリエイター。
- ローカル ASR とクラウドベースの LLM を組み合わせて、ポッドキャスト、楽曲、動画の音声認識と翻訳を自動化したいユーザー。
特徴
- マルチモデル対応:「軽量翻訳モード」により、初期翻訳に低コストモデル、修正に大規模モデルを使用することで、トークン消費を節約できます。
- 文脈的正確性:翻訳セグメント間の文脈を維持し、断片的なサブタイトルを回避します。
- 柔軟な統合:OpenAI、Anthropic、Google、OpenRouter などの複数の LLM プロバイダーと、ローカルの OpenAI 互換エンドポイントをサポートします。
- カスタム用語集:JSON/YAML 形式の用語集をサポートし、専門用語の翻訳の一貫性を確保します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト