meizhong986/WhisperJAV

ASR/STT subtitle generator. Uses Qwen3-ASR, local LLM, Whisper, TEN-VAD. Noise-robust for JAV

WhisperJAV – 일본 성인 비디오 자막 생성기

무엇인가요 – WhisperJAV는 일본 성인 비디오(JAV)의 오디오 트랙을 타임스탬프가 있는 자막 파일(.srt/.vtt)로 변환하는 데스크탑(및 CLI) 애플리케이션입니다. 모든 처리는 로컬에서 이루어지므로 미디어가 클라우드에 업로드되지 않습니다. 이 도구는 OpenAI Whisper 계열 모델(및 최신 일본어 최적화 ASR 모델)을 기반으로 한 맞춤형 파이프라인을 구축하여, JAV에서 흔히 볼 수 있는 매우 노이즈가 많고 장시간 지속되는 오디오에 대응합니다.


핵심 아이디어 및 특별한 도구가 필요한 이유

  1. 노이즈가 많고 SNR이 낮은 오디오 – 숨결, 신음소리, 배경 음악이 일반적인 Whisper 모델에게 일본어 음절처럼 보일 수 있습니다.
  2. 장시간 드리프트 – 긴 영상은 Whisper의 어텐션 메커니즘이 반복되거나 창조된 텍스트를 '환각'하게 만듭니다.
  3. 사전 처리의 역설 – 과도한 노이즈 제거는 정확한 음소 구분에 필요한 고주파 세부 정보를 제거할 수 있습니다.

WhisperJAV는 이 세 가지 실패 요인을 해결하기 위해 세 가지 엔지니어링 블록을 활용합니다:

  • 장면 기반 세그멘테이션 – 자연스러운 음향 경계에서 비디오를 자르므로 각 청크는 음향적으로 균일합니다.
  • VAD 클램핑 – 음성 활동 탐지기(VAD)는 ASR에게 정확한 음성 발생 구간을 알려주어, 침묵이나 비음성 소리에 대해 모델이 듣지 않도록 합니다.
  • 방어적 디코딩 및 일본어 인식 후처리 – 신뢰도 임계값, 환각 필터, 언어 특화 정리(조사 처리, 방언 패턴, 순수 신음선 제거, 타임스탬프 수정).

파이프라인 작동 방식 (고수준 흐름)

flowchart LR
    A[오디오 추출] --> B[장면 탐지]
    B --> C[음성 강화 (옵션)]
    C --> D[음성 세그멘테이션 (VAD)]
    D --> E[ASR 모델]
    E --> F[일본어 특화 후처리]
    F --> G[자막 파일 (.srt/.vtt)]
  1. 오디오 추출 – FFmpeg가 어떤 비디오 형식에서든 오디오 스트림을 추출합니다.
  2. 장면 탐지 – 의미적 클러스터링, 에너지 기반 auditok, 또는 신경망 Silero로 파일을 장면으로 분할합니다.
  3. 음성 강화 – 선택적 신경망 또는 고전적 노이즈 제거기(예: clearvoice, zipenhancer). 기본적으로는 비활성화되어 있으며, 과도한 정제는 Whisper 성능을 해칠 수 있기 때문입니다.
  4. VAD – 정확한 음성 구간을 결정하며, 이 구간이 최종 자막의 타임스탬프가 됩니다.
  5. ASR – 지원되는 인식기들(OpenAI Whisper, Faster-Whisper, Qwen-3-ASR, anime-whisper, HuggingFace 모델 등) 중 하나로 음성을 인식합니다.
  6. 후처리 – 일본어 특화 정리: 조사 중심으로 문장을 재구성, 순수 신음선 제거, 반복 제거, 극단적으로 긴 타임스탬프 수정.

주요 기능

기능 제공되는 가치
GUI 및 CLI 한 번의 클릭으로 사용 가능한 데스크탑 앱(whisperjav-gui) 또는 간단한 명령줄(whisperjav video.mp4)
다양한 처리 모드 balanced(기본), fidelity, fast, faster, qwen, anime-whisper, transformers, crispasr. 각 모드는 다른 ASR 엔진과 사전 처리의 공격성을 선택합니다.
감도 프리셋 conservative, balanced, aggressive – VAD가 조용한 음성에 반응하는 정도를 조절합니다.
이중 패스 앙상블 동일한 파일에 대해 완전히 다른 두 개의 파이프라인을 실행하고 결과를 병합(예: anime-whisper + Qwen3-ASR)하여 더 높은 재현율을 얻습니다.
믹스앤매치 모든 단계(장면 탐지기, 강화기, VAD, ASR)는 교체 가능; 코드 작성 없이 맞춤형 파이프라인을 구성할 수 있습니다.
AI 번역 전사 후, 로컬 LLM(Ollama) 또는 클라우드 API(Gemini, Claude 등)를 사용해 자막을 실시간으로 번역할 수 있습니다.
로컬 전용 작동 모든 처리는 사용자 기기에서 이루어지며, 미디어는 사용자의 컴퓨터를 떠나지 않습니다.
크로스플랫폼 설치 프로그램 독립형 Windows .exe 외에도, macOS(Apple Silicon) 및 Linux용 소스 설치 스크립트 제공
자동 하드웨어 감지 NVIDIA GPU를 감지하고 해당 CUDA 빌드를 설치; 필요 시 CPU 전용으로 포괄합니다.

일반적인 사용 사례

  • 개인 아카이빙 – 제3자 서비스에 의존하지 않고 개인 소장 JAV에 정확한 자막을 생성.
  • 연구 / 언어 분석 – 일상어, 방언, 발성 패턴 연구를 위한 시간 동기화 일본어 대화 데이터 확보.
  • 콘텐츠 모니터링 – 비디오를 사생활 보호하면서 금지어를 스캔할 수 있는 전사본을 빠르게 얻음.
  • 번역 워크플로우 – 일본어 전사본을 생성한 후, 로컬 LLM에 입력해 한 번의 명령으로 영어 자막을 생성.

설치 빠른 시작 (Windows 예시)

  1. 릴리스 페이지에서 최신 .exe를 다운로드.
  2. 실행 – 로컬 Python 환경 생성, PyTorch, FFmpeg, 필요한 모델 설치(초기 실행 시 약 3GB).
  3. 바로가기 실행 → GUI 표시됨. 비디오를 드래그 앤 드롭, 모드 선택 후 시작 클릭.

대안: README 상단의 Colab 또는 Kaggle 노트북을 사용해 설치 없이 클라우드 없이 실행 가능.


예시 명령줄

# 기본 전사, 기본 balanced 모드
whisperjav video.mp4

# 빠른 모드, 보수적인 VAD (매우 노이즈가 많은 클립에 적합)
whisperjav video.mp4 --mode faster --sensitivity conservative

# 사용자 정의 병합 전략을 사용한 이중 패스 앙상블
whisperjav video.mp4 \
    --ensemble \
    --pass1-pipeline anime-whisper --pass2-pipeline qwen \
    --merge-strategy smart_merge

결과 자막 파일(video.srt)은 원본 비디오와 동일한 위치에 생성됩니다.


제한 사항 및 주의사항

  • 도메인 특화 – 파이프라인과 필터는 JAV 스타일 오디오에 최적화되어 있으며, 다른 일본어 콘텐츠(뉴스, 팟캐스트 등)에서는 결과가 낮을 수 있습니다.
  • 모델 크기 및 VRAM – 고정밀 모드(whisper-large-v2, Qwen-3-ASR 1.7B)는 최소 8GB GPU 메모리 필요; 그렇지 않으면 CPU 전용으로 전환되며 훨씬 느립니다.
  • 환각은 완전히 제거 불가 – 방어적 디코딩을 적용해도, 극도로 낮은 품질의 녹화물에서는 가끔 창조된 문장이나 중복 텍스트가 나타날 수 있습니다.
  • 법적/윤리적 책임 – 소프트웨어는 사용자가 이미 소유한 미디어를 처리할 뿐이며, 저작권 침해 또는 동의 없는 콘텐츠 배포는 사용자의 책임입니다.

더 알아보기


WhisperJAV는 일반적인 음성-텍스트 모델(Whisper)에 도메인 인식 사전 처리, 세그멘테이션, 후처리를 추가하여, 특히 어려운 오디오 도메인에서 실용적으로 사용할 수 있도록 만든 실질적인 예입니다. 모든 처리는 장치 내에서 이루어지므로, 프라이버시를 중시하는 사용자에게 장시간 노이즈가 많은 비디오 콘텐츠에 대한 일본어 자막 생성을 실용적으로 제공합니다.


TL;DR – Windows .exe를 설치(또는 Colab 노트북을 실행)하고 GUI에 JAV 파일을 드롭, 모드(예: balanced)를 선택한 후 시작을 누르면, 비디오를 어디에도 업로드하지 않고 깔끔한 .srt 자막 파일을 얻을 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트