dseditor/QwenASRMiniTool

基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用

해결하는 문제

QwenASRMiniTool은 사용자가 오디오 파일, 비디오, 라이브 마이크 녹음에서 SRT 자막을 생성할 수 있는 로컬 음성 인식 도구입니다. 데이터는 컴퓨터 외부로 나가지 않으며, 비전문가를 위한 오프라인 전사 과정을 단순화합니다. 클라우드 기반 서비스의 무료이고 개인 정보 보호가 보장된 대안을 제공합니다.

작동 방식

이 도구는 WebView 기반 인터페이스를 사용하며, 다양한 하드웨어 환경에서 호환성을 보장하기 위해 여러 추론 백엔드를 지원합니다.

  • 추론 코어: CrispASR(Vulkan GPU를 통해)는 NVIDIA, AMD, Intel GPU에 대응하며, OpenVINO는 순수 CPU 실행에 사용됩니다.
  • 모델: Qwen3-ASR(일본 애니메이션 전용 버전 포함)와 **Whisper (Breeze-ASR-26)**를 활용하여 30개 언어에서 고정확도 전사를 제공합니다.
  • 처리: 비디오 파일에서 오디오를 추출하기 위해 FFmpeg를 사용하고, 라이브 녹음 시 휴지 시간을 감지하기 위해 Silero-VAD를 활용합니다.
  • 추가 기능: 단어 수준 타임스탬프(카라오케 모드)를 제공하는 ForcedAligner와 ONNX 기반 엔진을 통한 화자 분리 기능을 포함합니다.

대상 사용자

  • 회의, 팟캐스트, 강의의 개인적이고 오프라인 전사를 필요로 하는 개인.
  • 비디오나 가사에 단어 수준 정밀도로 자막을 생성하고 싶은 콘텐츠 크리에이터.
  • 고성능 GPU에서 기본 CPU까지 다양한 하드웨어 환경을 가진 사용자로, 즉시 사용 가능한 '아웃 오브 더 박스' ASR 도구를 원하는 사람.

주요 특징

  • 로컬 & 개인 정보 보호: 모든 처리는 디바이스 내에서 이루어지며, 데이터는 클라우드에 업로드되지 않습니다.
  • 하드웨어 독립성: Vulkan(NVIDIA/AMD/Intel)을 통한 GPU 가속과 OpenVINO를 통한 CPU 전용 모드를 지원합니다.
  • 카라오케 모드: 정확한 자막 정렬과 검토를 위한 단어 수준 하이라이트 제공.
  • 화자 분리: 전사 중에 다양한 화자를 자동으로 식별하고 라벨링합니다.
  • 배치 처리: 여러 오디오/비디오 파일을 순차적으로 가져와 처리할 수 있습니다.
  • API 및 원격 접근: OpenAI 호환 전사 API와 Cloudflare 터널을 통해 모바일 장치에서 안전한 원격 업로드를 가능하게 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트