zh-plus/openlrc

Transcribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPT,Claude等)来转录、翻译你的音频为字幕文件。

해결하는 문제

Open-Lyrics는 오디오 또는 비디오 파일을 동기화된 자막(특히 .lrc 파일)으로 변환하는 간편한 방법을 제공합니다. 자동 음성 인식에서 발생하는 정확하지 않거나 기계적인 번역 문제를 고속 음성-텍스트 변환과 대규모 언어 모델(LLM)의 문맥 기반 보정 기능을 결합함으로써 해결합니다.

작동 방식

이 라이브러리는 다단계 파이프라인을 따릅니다:

  1. 오디오 전처리: 음량 정규화와 DPDFNet을 통한 선택적 노이즈 제거를 사용하여 음성 인식 중 오류를 줄입니다.
  2. 음성 인식: faster-whisper를 사용해 타임스탬프가 포함된 텍스트로 오디오를 변환합니다.
  3. 번역 및 보정: 인식된 텍스트를 GPT-4, Claude, Gemini 등의 LLM에 보내 번역 및 보정을 수행합니다. 문맥 인식 프롬프트를 사용하며, 사용자 정의 용어집을 활용해 도메인 전문 용어를 정확히 번역할 수 있습니다.
  4. 출력: 최종 결과는 동기화된 자막 파일로 저장됩니다.

대상 사용자

  • 자막 생성 도구를 개발하는 개발자.
  • 오디오/비디오 콘텐츠용 고품질 번역 가사나 자막이 필요한 콘텐츠 제작자.
  • 로컬 ASR와 클라우드 기반 LLM을 혼합하여 팟캐스트, 노래, 비디오의 음성 인식 및 번역을 자동화하고자 하는 사용자.

주요 특징

  • 다중 모델 지원: "경량 번역 모드"를 통해 초기 번역에는 저비용 모델을, 보정에는 대규모 모델을 사용해 토큰 소비를 절약할 수 있습니다.
  • 문맥 정확성 유지: 번역 세그먼트 간의 문맥을 유지하여 단절된 자막을 방지합니다.
  • 유연한 통합: OpenAI, Anthropic, Google, OpenRouter 등 다양한 LLM 제공업체와 로컬 OpenAI 호환 엔드포인트를 지원합니다.
  • 사용자 정의 용어집: JSON/YAML 형식의 용어집을 지원해 전문 용어의 일관된 번역을 보장합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트