meizhong986/WhisperJAV
ASR/STT subtitle generator. Uses Qwen3-ASR, local LLM, Whisper, TEN-VAD. Noise-robust for JAV
WhisperJAV – 日本成人视频字幕生成器
是什么 – WhisperJAV 是一个桌面(及 CLI)应用程序,将日本成人视频(JAV)的音频轨道转换为带时间戳的字幕文件(.srt/.vtt)。所有处理均在本地进行,因此媒体不会上传至云端。该工具围绕 OpenAI Whisper 系列模型(及更新的日本语优化 ASR 模型)构建自定义流水线,以应对 JAV 常见的高噪声、长时音频。
核心理念与为何需要专用工具
- 高噪声、低信噪比音频 – 呼吸声、呻吟声和背景音乐常被普通 Whisper 模型误认为日语音节。
- 长时音频漂移 – 长片视频会导致 Whisper 的注意力机制“幻觉”出重复或虚构文本。
- 预处理悖论 – 过度去噪会削弱高频细节,影响音素准确区分。
WhisperJAV 通过三个工程模块解决这三个失败点:
- 基于场景的分割 – 在自然声学边界处切割视频,使每个片段声学特性一致。
- VAD 限幅 – 语音活动检测器(VAD)精确告知 ASR 语音发生区间,防止模型听沉默或非语音声音。
- 防御性解码与日语特化后处理 – 信心阈值、幻觉过滤器,以及语言特化清理(助词处理、方言模式、纯呻吟行删除、时间修复)。
流水线工作原理(高层流程)
flowchart LR
A[音频提取] --> B[场景检测]
B --> C[语音增强(可选)]
C --> D[语音分割(VAD)]
D --> E[ASR 模型]
E --> F[日语特化后处理]
F --> G[字幕文件 (.srt/.vtt)]
- 音频提取 – FFmpeg 从任意视频格式中提取音频流。
- 场景检测 – 采用语义聚类、基于能量的
auditok或神经网络Silero将文件分割为场景。 - 语音增强 – 可选的神经或经典去噪器(如
clearvoice,zipenhancer)。默认关闭,因过度清洁会损害 Whisper 性能。 - VAD – 确定精确的语音区间;这些区间成为最终字幕的时间戳。
- ASR – 支持的识别器(OpenAI Whisper、Faster-Whisper、Qwen-3-ASR、anime-whisper、HuggingFace 模型等)之一转录语音。
- 后处理 – 日语特化清理:围绕助词重组句子,删除纯呻吟行,去除重复,修复极长的时间间隔。
主要功能
| 功能 | 提供的价值 |
|---|---|
| GUI 与 CLI | 一键式桌面应用(whisperjav-gui)或简单命令行(whisperjav video.mp4) |
| 多种处理模式 | balanced(默认)、fidelity、fast、faster、qwen、anime-whisper、transformers、crispasr。每种模式选择不同 ASR 引擎和预处理强度。 |
| 灵敏度预设 | conservative、balanced、aggressive – 调整 VAD 对安静语音的标记积极性。 |
| 双轮集成 | 对同一文件运行两个完全不同的流水线并合并结果(如 anime-whisper + Qwen3-ASR),以提高召回率。 |
| 混搭组合 | 每个阶段(场景检测器、增强器、VAD、ASR)均可替换;无需编码即可构建自定义流水线。 |
| AI 翻译 | 转录后,使用本地 LLM(Ollama)或云 API(Gemini、Claude 等)进行字幕本地翻译。 |
| 纯本地运行 | 所有处理均在用户机器上完成;媒体不会离开用户计算机。 |
| 跨平台安装包 | 独立 Windows .exe,以及 macOS(Apple Silicon)和 Linux 的源码安装脚本。 |
| 自动硬件检测 | 检测 NVIDIA GPU 并安装对应 CUDA 版本;必要时回退至 CPU 仅模式。 |
典型使用场景
- 个人归档 – 无需依赖第三方服务,为个人 JAV 收藏生成准确字幕。
- 研究 / 语言分析 – 获取时间对齐的日语对话,用于口语、方言或发声模式研究。
- 内容审核 – 快速获取转录文本以扫描违禁语言,同时保持视频私密。
- 翻译工作流 – 生成日语转录文本后,输入本地 LLM 一键生成英文字幕。
安装快速入门(Windows 示例)
- 从 发布页 下载最新
.exe。 - 运行它 – 创建本地 Python 环境,安装 PyTorch、FFmpeg 和所需模型(首次运行约 3 GB)。
- 启动快捷方式 → GUI 出现。拖放视频,选择模式,点击 开始。
替代方案:使用提供的 Colab 或 Kaggle 笔记本(README 顶部的徽章)实现零安装、无云运行。
示例命令行
# 基本转录,使用默认 balanced 模式
whisperjav video.mp4
# 快速模式,保守 VAD(适合极噪片段)
whisperjav video.mp4 --mode faster --sensitivity conservative
# 使用自定义合并策略的双轮集成
whisperjav video.mp4 \
--ensemble \
--pass1-pipeline anime-whisper --pass2-pipeline qwen \
--merge-strategy smart_merge
生成的字幕文件(video.srt)将与原始视频同目录。
限制与注意事项
- 领域特化 – 流水线和过滤器针对 JAV 风格音频优化;其他日语内容(新闻、播客等)结果可能较差。
- 模型大小与显存 – 高精度模式(如
whisper-large-v2、Qwen-3-ASR 1.7B)需 ≥8 GB GPU 内存;否则回退至 CPU,速度显著下降。 - 幻觉无法完全消除 – 即使使用防御性解码,极低质量录音仍可能出现虚构行或重复文本。
- 法律/伦理责任 – 软件仅处理用户已拥有的媒体;分发受版权保护或非同意内容的责任由用户承担。
更多信息获取
- 文档网站 – 英文: https://meizhong986.github.io/WhisperJAV/ – 包含详细指南、基准表格和故障排除提示。
- GitHub 仓库 – https://github.com/meizhong986/WhisperJAV – 源码、问题追踪、发布资产。
- 社区笔记本 – README 顶部的 Colab 和 Kaggle 徽章,用于快速实验。
WhisperJAV 是通用语音转文本模型(Whisper)通过领域感知预处理、分割和后处理封装,使其适用于极具挑战性的音频领域的具体实例。它完全本地运行,为注重隐私的用户提供了处理长时、高噪声视频内容生成日语字幕的实用方式。
TL;DR – 安装 Windows .exe(或运行 Colab 笔记本),将 JAV 文件拖入 GUI,选择模式(如 balanced),点击开始,即可在不上传视频任何地方的情况下获得干净的 .srt 字幕文件。
相关
- 项目
- 项目
- 项目
- 项目
- 项目