meizhong986/WhisperJAV

ASR/STT subtitle generator. Uses Qwen3-ASR, local LLM, Whisper, TEN-VAD. Noise-robust for JAV

WhisperJAV – 日本成人影片字幕生成器

是什麼 – WhisperJAV 是一個桌面(及 CLI)應用程式,將日本成人影片(JAV)的音訊軌轉換為帶時間戳的字幕檔案(.srt/.vtt)。所有處理皆在本機進行,因此媒體不會上傳至雲端。該工具以 OpenAI Whisper 系列模型(及更新的日本語優化 ASR 模型)為基礎,建構自訂流程,以應對 JAV 常見的高雜訊、長時段音訊。


核心理念與為何需要專用工具

  1. 高雜訊、低信噪比音訊 – 呼吸聲、呻吟聲與背景音樂常被一般 Whisper 模型誤認為日語音節。
  2. 長時段漂移 – 長片影片會導致 Whisper 的注意力機制「幻覺」出重複或虛構文字。
  3. 預處理悖論 – 過度去雜訊會削弱高頻細節,影響音素準確區分。

WhisperJAV 透過三個工程模組解決這三個失敗點:

  • 基於場景的分割 – 在自然聲學邊界處切割影片,使每個片段聲學特性一致。
  • VAD 限幅 – 語音活動檢測器(VAD)精確告知 ASR 語音發生區間,防止模型聽取沉默或非語音聲音。
  • 防禦性解碼與日語特化後處理 – 信心閾值、幻覺過濾器,以及語言特化清理(助詞處理、方言模式、純呻吟行刪除、時間修復)。

流程工作原理(高階流程)

flowchart LR
    A[音訊提取] --> B[場景檢測]
    B --> C[語音增強(可選)]
    C --> D[語音分割(VAD)]
    D --> E[ASR 模型]
    E --> F[日語特化後處理]
    F --> G[字幕檔案 (.srt/.vtt)]
  1. 音訊提取 – FFmpeg 從任意影片格式中提取音訊流。
  2. 場景檢測 – 采用語意聚類、基於能量的 auditok 或神經網絡 Silero 將檔案分割為場景。
  3. 語音增強 – 可選的神經或傳統去雜訊器(如 clearvoice, zipenhancer)。預設關閉,因過度清潔會損害 Whisper 性能。
  4. VAD – 確定精確的語音區間;這些區間成為最終字幕的時間戳。
  5. ASR – 支援的識別器(OpenAI Whisper、Faster-Whisper、Qwen-3-ASR、anime-whisper、HuggingFace 模型等)之一轉錄語音。
  6. 後處理 – 日語特化清理:圍繞助詞重組句子,刪除純呻吟行,去除重複,修復極長的時間間隔。

主要功能

功能 提供的價值
GUI 與 CLI 一鍵式桌面應用(whisperjav-gui)或簡單命令列(whisperjav video.mp4
多種處理模式 balanced(預設)、fidelityfastfasterqwenanime-whispertransformerscrispasr。每種模式選擇不同 ASR 引擎和預處理強度。
靈敏度預設 conservativebalancedaggressive – 調整 VAD 對安靜語音的標記積極性。
雙輪集成 對同一檔案運行兩個完全不同的流程並合併結果(如 anime-whisper + Qwen3-ASR),以提高召回率。
混搭組合 每個階段(場景檢測器、增強器、VAD、ASR)均可替換;無需編碼即可建構自訂流程。
AI 翻譯 轉錄後,使用本地 LLM(Ollama)或雲端 API(Gemini、Claude 等)進行字幕本地翻譯。
純本機運行 所有處理均在使用者機器上完成;媒體不會離開使用者電腦。
跨平台安裝包 獨立 Windows .exe,以及 macOS(Apple Silicon)和 Linux 的原始碼安裝腳本。
自動硬體檢測 – 檢測 NVIDIA GPU 並安裝對應 CUDA 版本;必要時回退至 CPU 僅模式。

典型使用情境

  • 個人歸檔 – 無需依賴第三方服務,為個人 JAV 收藏生成準確字幕。
  • 研究 / 語言分析 – 取得時間對齊的日語對話,用於口語、方言或發聲模式研究。
  • 內容審核 – 快速取得轉錄文本以掃描違禁語言,同時保持影片私密。
  • 翻譯工作流程 – 生成日語轉錄文本後,輸入本地 LLM 一鍵生成英文字幕。

安裝快速入門(Windows 範例)

  1. 發布頁 下載最新 .exe
  2. 執行它 – 建立本地 Python 環境,安裝 PyTorch、FFmpeg 和所需模型(首次執行約 3 GB)。
  3. 啟動捷徑 → GUI 出現。拖放影片,選擇模式,點擊 開始

替代方案:使用提供的 Colab 或 Kaggle 笔記本(README 頂部的徽章)實現零安裝、無雲運行。


範例命令列

# 基本轉錄,使用預設 balanced 模式
whisperjav video.mp4

# 快速模式,保守 VAD(適合極噪片段)
whisperjav video.mp4 --mode faster --sensitivity conservative

# 使用自訂合併策略的雙輪集成
whisperjav video.mp4 \
    --ensemble \
    --pass1-pipeline anime-whisper --pass2-pipeline qwen \
    --merge-strategy smart_merge

生成的字幕檔案(video.srt)將與原始影片同目錄。


限制與注意事項

  • 領域特化 – 流程與過濾器針對 JAV 風格音訊優化;其他日語內容(新聞、播客等)結果可能較差。
  • 模型大小與顯存 – 高精度模式(如 whisper-large-v2、Qwen-3-ASR 1.7B)需 ≥8 GB GPU 內存;否則回退至 CPU,速度顯著下降。
  • 幻覺無法完全消除 – 即使使用防禦性解碼,極低品質錄音仍可能出現虛構行或重複文字。
  • 法律/倫理責任 – 軟體僅處理使用者已擁有的媒體;分發受版權保護或非同意內容的責任由使用者承擔。

更多資訊來源


WhisperJAV 是通用語音轉文字模型(Whisper)透過領域感知預處理、分割與後處理封裝,使其適用於極具挑戰性音訊領域的具體範例。它完全在本機運行,為重視隱私的使用者提供了處理長時、高雜訊影片內容生成日語字幕的實用方式。


TL;DR – 安裝 Windows .exe(或執行 Colab 筆記本),將 JAV 檔案拖入 GUI,選擇模式(如 balanced),點擊開始,即可在不將影片上傳至任何地方的情況下獲得乾淨的 .srt 字幕檔案。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案