meizhong986/WhisperJAV

ASR/STT subtitle generator. Uses Qwen3-ASR, local LLM, Whisper, TEN-VAD. Noise-robust for JAV

WhisperJAV – 日本成人视频字幕生成器

是什么 – WhisperJAV 是一个桌面(及 CLI)应用程序,将日本成人视频(JAV)的音频轨道转换为带时间戳的字幕文件(.srt/.vtt)。所有处理均在本地进行,因此媒体不会上传至云端。该工具围绕 OpenAI Whisper 系列模型(及更新的日本语优化 ASR 模型)构建自定义流水线,以应对 JAV 常见的高噪声、长时音频。


核心理念与为何需要专用工具

  1. 高噪声、低信噪比音频 – 呼吸声、呻吟声和背景音乐常被普通 Whisper 模型误认为日语音节。
  2. 长时音频漂移 – 长片视频会导致 Whisper 的注意力机制“幻觉”出重复或虚构文本。
  3. 预处理悖论 – 过度去噪会削弱高频细节,影响音素准确区分。

WhisperJAV 通过三个工程模块解决这三个失败点:

  • 基于场景的分割 – 在自然声学边界处切割视频,使每个片段声学特性一致。
  • VAD 限幅 – 语音活动检测器(VAD)精确告知 ASR 语音发生区间,防止模型听沉默或非语音声音。
  • 防御性解码与日语特化后处理 – 信心阈值、幻觉过滤器,以及语言特化清理(助词处理、方言模式、纯呻吟行删除、时间修复)。

流水线工作原理(高层流程)

flowchart LR
    A[音频提取] --> B[场景检测]
    B --> C[语音增强(可选)]
    C --> D[语音分割(VAD)]
    D --> E[ASR 模型]
    E --> F[日语特化后处理]
    F --> G[字幕文件 (.srt/.vtt)]
  1. 音频提取 – FFmpeg 从任意视频格式中提取音频流。
  2. 场景检测 – 采用语义聚类、基于能量的 auditok 或神经网络 Silero 将文件分割为场景。
  3. 语音增强 – 可选的神经或经典去噪器(如 clearvoice, zipenhancer)。默认关闭,因过度清洁会损害 Whisper 性能。
  4. VAD – 确定精确的语音区间;这些区间成为最终字幕的时间戳。
  5. ASR – 支持的识别器(OpenAI Whisper、Faster-Whisper、Qwen-3-ASR、anime-whisper、HuggingFace 模型等)之一转录语音。
  6. 后处理 – 日语特化清理:围绕助词重组句子,删除纯呻吟行,去除重复,修复极长的时间间隔。

主要功能

功能 提供的价值
GUI 与 CLI 一键式桌面应用(whisperjav-gui)或简单命令行(whisperjav video.mp4
多种处理模式 balanced(默认)、fidelityfastfasterqwenanime-whispertransformerscrispasr。每种模式选择不同 ASR 引擎和预处理强度。
灵敏度预设 conservativebalancedaggressive – 调整 VAD 对安静语音的标记积极性。
双轮集成 对同一文件运行两个完全不同的流水线并合并结果(如 anime-whisper + Qwen3-ASR),以提高召回率。
混搭组合 每个阶段(场景检测器、增强器、VAD、ASR)均可替换;无需编码即可构建自定义流水线。
AI 翻译 转录后,使用本地 LLM(Ollama)或云 API(Gemini、Claude 等)进行字幕本地翻译。
纯本地运行 所有处理均在用户机器上完成;媒体不会离开用户计算机。
跨平台安装包 独立 Windows .exe,以及 macOS(Apple Silicon)和 Linux 的源码安装脚本。
自动硬件检测 检测 NVIDIA GPU 并安装对应 CUDA 版本;必要时回退至 CPU 仅模式。

典型使用场景

  • 个人归档 – 无需依赖第三方服务,为个人 JAV 收藏生成准确字幕。
  • 研究 / 语言分析 – 获取时间对齐的日语对话,用于口语、方言或发声模式研究。
  • 内容审核 – 快速获取转录文本以扫描违禁语言,同时保持视频私密。
  • 翻译工作流 – 生成日语转录文本后,输入本地 LLM 一键生成英文字幕。

安装快速入门(Windows 示例)

  1. 发布页 下载最新 .exe
  2. 运行它 – 创建本地 Python 环境,安装 PyTorch、FFmpeg 和所需模型(首次运行约 3 GB)。
  3. 启动快捷方式 → GUI 出现。拖放视频,选择模式,点击 开始

替代方案:使用提供的 Colab 或 Kaggle 笔记本(README 顶部的徽章)实现零安装、无云运行。


示例命令行

# 基本转录,使用默认 balanced 模式
whisperjav video.mp4

# 快速模式,保守 VAD(适合极噪片段)
whisperjav video.mp4 --mode faster --sensitivity conservative

# 使用自定义合并策略的双轮集成
whisperjav video.mp4 \
    --ensemble \
    --pass1-pipeline anime-whisper --pass2-pipeline qwen \
    --merge-strategy smart_merge

生成的字幕文件(video.srt)将与原始视频同目录。


限制与注意事项

  • 领域特化 – 流水线和过滤器针对 JAV 风格音频优化;其他日语内容(新闻、播客等)结果可能较差。
  • 模型大小与显存 – 高精度模式(如 whisper-large-v2、Qwen-3-ASR 1.7B)需 ≥8 GB GPU 内存;否则回退至 CPU,速度显著下降。
  • 幻觉无法完全消除 – 即使使用防御性解码,极低质量录音仍可能出现虚构行或重复文本。
  • 法律/伦理责任 – 软件仅处理用户已拥有的媒体;分发受版权保护或非同意内容的责任由用户承担。

更多信息获取


WhisperJAV 是通用语音转文本模型(Whisper)通过领域感知预处理、分割和后处理封装,使其适用于极具挑战性的音频领域的具体实例。它完全本地运行,为注重隐私的用户提供了处理长时、高噪声视频内容生成日语字幕的实用方式。


TL;DR – 安装 Windows .exe(或运行 Colab 笔记本),将 JAV 文件拖入 GUI,选择模式(如 balanced),点击开始,即可在不上传视频任何地方的情况下获得干净的 .srt 字幕文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目