meizhong986/WhisperJAV
ASR/STT subtitle generator. Uses Qwen3-ASR, local LLM, Whisper, TEN-VAD. Noise-robust for JAV
WhisperJAV – 日本成人影片字幕生成器
是什麼 – WhisperJAV 是一個桌面(及 CLI)應用程式,將日本成人影片(JAV)的音訊軌轉換為帶時間戳的字幕檔案(.srt/.vtt)。所有處理皆在本機進行,因此媒體不會上傳至雲端。該工具以 OpenAI Whisper 系列模型(及更新的日本語優化 ASR 模型)為基礎,建構自訂流程,以應對 JAV 常見的高雜訊、長時段音訊。
核心理念與為何需要專用工具
- 高雜訊、低信噪比音訊 – 呼吸聲、呻吟聲與背景音樂常被一般 Whisper 模型誤認為日語音節。
- 長時段漂移 – 長片影片會導致 Whisper 的注意力機制「幻覺」出重複或虛構文字。
- 預處理悖論 – 過度去雜訊會削弱高頻細節,影響音素準確區分。
WhisperJAV 透過三個工程模組解決這三個失敗點:
- 基於場景的分割 – 在自然聲學邊界處切割影片,使每個片段聲學特性一致。
- VAD 限幅 – 語音活動檢測器(VAD)精確告知 ASR 語音發生區間,防止模型聽取沉默或非語音聲音。
- 防禦性解碼與日語特化後處理 – 信心閾值、幻覺過濾器,以及語言特化清理(助詞處理、方言模式、純呻吟行刪除、時間修復)。
流程工作原理(高階流程)
flowchart LR
A[音訊提取] --> B[場景檢測]
B --> C[語音增強(可選)]
C --> D[語音分割(VAD)]
D --> E[ASR 模型]
E --> F[日語特化後處理]
F --> G[字幕檔案 (.srt/.vtt)]
- 音訊提取 – FFmpeg 從任意影片格式中提取音訊流。
- 場景檢測 – 采用語意聚類、基於能量的
auditok或神經網絡Silero將檔案分割為場景。 - 語音增強 – 可選的神經或傳統去雜訊器(如
clearvoice,zipenhancer)。預設關閉,因過度清潔會損害 Whisper 性能。 - VAD – 確定精確的語音區間;這些區間成為最終字幕的時間戳。
- ASR – 支援的識別器(OpenAI Whisper、Faster-Whisper、Qwen-3-ASR、anime-whisper、HuggingFace 模型等)之一轉錄語音。
- 後處理 – 日語特化清理:圍繞助詞重組句子,刪除純呻吟行,去除重複,修復極長的時間間隔。
主要功能
| 功能 | 提供的價值 |
|---|---|
| GUI 與 CLI | 一鍵式桌面應用(whisperjav-gui)或簡單命令列(whisperjav video.mp4) |
| 多種處理模式 | balanced(預設)、fidelity、fast、faster、qwen、anime-whisper、transformers、crispasr。每種模式選擇不同 ASR 引擎和預處理強度。 |
| 靈敏度預設 | conservative、balanced、aggressive – 調整 VAD 對安靜語音的標記積極性。 |
| 雙輪集成 | 對同一檔案運行兩個完全不同的流程並合併結果(如 anime-whisper + Qwen3-ASR),以提高召回率。 |
| 混搭組合 | 每個階段(場景檢測器、增強器、VAD、ASR)均可替換;無需編碼即可建構自訂流程。 |
| AI 翻譯 | 轉錄後,使用本地 LLM(Ollama)或雲端 API(Gemini、Claude 等)進行字幕本地翻譯。 |
| 純本機運行 | 所有處理均在使用者機器上完成;媒體不會離開使用者電腦。 |
| 跨平台安裝包 | 獨立 Windows .exe,以及 macOS(Apple Silicon)和 Linux 的原始碼安裝腳本。 |
| 自動硬體檢測 – 檢測 NVIDIA GPU 並安裝對應 CUDA 版本;必要時回退至 CPU 僅模式。 |
典型使用情境
- 個人歸檔 – 無需依賴第三方服務,為個人 JAV 收藏生成準確字幕。
- 研究 / 語言分析 – 取得時間對齊的日語對話,用於口語、方言或發聲模式研究。
- 內容審核 – 快速取得轉錄文本以掃描違禁語言,同時保持影片私密。
- 翻譯工作流程 – 生成日語轉錄文本後,輸入本地 LLM 一鍵生成英文字幕。
安裝快速入門(Windows 範例)
- 從 發布頁 下載最新
.exe。 - 執行它 – 建立本地 Python 環境,安裝 PyTorch、FFmpeg 和所需模型(首次執行約 3 GB)。
- 啟動捷徑 → GUI 出現。拖放影片,選擇模式,點擊 開始。
替代方案:使用提供的 Colab 或 Kaggle 笔記本(README 頂部的徽章)實現零安裝、無雲運行。
範例命令列
# 基本轉錄,使用預設 balanced 模式
whisperjav video.mp4
# 快速模式,保守 VAD(適合極噪片段)
whisperjav video.mp4 --mode faster --sensitivity conservative
# 使用自訂合併策略的雙輪集成
whisperjav video.mp4 \
--ensemble \
--pass1-pipeline anime-whisper --pass2-pipeline qwen \
--merge-strategy smart_merge
生成的字幕檔案(video.srt)將與原始影片同目錄。
限制與注意事項
- 領域特化 – 流程與過濾器針對 JAV 風格音訊優化;其他日語內容(新聞、播客等)結果可能較差。
- 模型大小與顯存 – 高精度模式(如
whisper-large-v2、Qwen-3-ASR 1.7B)需 ≥8 GB GPU 內存;否則回退至 CPU,速度顯著下降。 - 幻覺無法完全消除 – 即使使用防禦性解碼,極低品質錄音仍可能出現虛構行或重複文字。
- 法律/倫理責任 – 軟體僅處理使用者已擁有的媒體;分發受版權保護或非同意內容的責任由使用者承擔。
更多資訊來源
- 文件網站 – 英文: https://meizhong986.github.io/WhisperJAV/ – 包含詳細指南、基準表格和故障排除提示。
- GitHub 倉庫 – https://github.com/meizhong986/WhisperJAV – 原始碼、問題追蹤、發布資產。
- 社群筆記本 – README 頂部的 Colab 和 Kaggle 徽章,用於快速實驗。
WhisperJAV 是通用語音轉文字模型(Whisper)透過領域感知預處理、分割與後處理封裝,使其適用於極具挑戰性音訊領域的具體範例。它完全在本機運行,為重視隱私的使用者提供了處理長時、高雜訊影片內容生成日語字幕的實用方式。
TL;DR – 安裝 Windows .exe(或執行 Colab 筆記本),將 JAV 檔案拖入 GUI,選擇模式(如 balanced),點擊開始,即可在不將影片上傳至任何地方的情況下獲得乾淨的 .srt 字幕檔案。
相關
- 專案
- 專案
- 專案
- 專案
- 專案