agan-j/xiaoniu

小牛视频翻译 是一款支持本地视频翻译、字幕翻译和 YouTube 视频翻译下载的 AI 工具,集成自动语音识别与多语言翻译功能,助力创作者高效完成视频翻译,应用于视频本地化与视频出海场景。

What it solves

Xiaoniu AI Video Translation 旨在帮助内容创作者,尤其是为 TikTok、YouTube、抖音等平台制作短剧和宣传视频的创作者,克服语言障碍,实现全球分发。它通过自动翻译语音和字幕,同时保持原始音频氛围和视觉同步,解决了制作高质量本地化视频的问题。

How it works

该工具使用多阶段 AI 流程处理视频:

  1. Translation Pipeline: 采用专有的「5 步骤方法」(Core Understanding → Contextual Translation → Cultural Adjustment → Reflection/Adjustment → Final Proofreading) 以及基于 100 万段视频字幕训练的自定义翻译模型,确保翻译自然且具情境感。
  2. Audio Processing: 将人声与背景音乐分离,克隆原说话者的声音(使用 CosyVoice、IndexTTS、ElevenLabs 等模型),并生成目标语言的新语音。
  3. Visual Synchronization: 通过深度学习将生成的音频与说话者的唇部动作对齐(唇形同步),并调整音频速率以匹配视觉节奏,且不会降低视频帧率。
  4. Subtitle Management: 自动生成并翻译字幕,提供 Web UI 让用户实时手动校正文本和语音。

Who it’s for

  • Short Drama Creators: 需要将内容输出至国际市场,且需要精准的多角色声音克隆和唇形同步。
  • Enterprise Marketers: 在全球社交媒体平台上推广产品的企业。
  • Video Editors: 需要字幕擦除、配音生成和高保真音频净化工具的用户。

Highlights

  • High-Fidelity Voice Cloning: 支持先进的克隆模型(ElevenLabs、CosyVoice、IndexTTS),具情感表达和多角色识别。
  • Lip-Sync Technology: 精准同步翻译后的音频与口型动作及视觉节奏。
  • Proprietary Translation Model: 以百万字幕训练的定制模型,避免直译并处理文化差异。
  • Comprehensive Audio Tooling: 包含背景音乐分离、降噪与 AI 驱动的波形指纹修复。
  • Multi-Platform Support: 支持本地视频和 YouTube 内容,提供 Web UI 进行微调。
  • Cross-Platform Availability: 可在 Windows(CPU/GPU)和 Mac(Intel/M-series)上使用。