cyberofficial/Synthalingua

Synthalingua - Real Time Translation

它解决了什么问题

Synthalingua 是一个自托管工具,旨在打破实时音频和视频中的语言障碍。它允许用户以近乎实时的方式将各种语言的音频转录并翻译成英语(或其他多语言输出),专门针对观看直播(例如 VTubers)或处理带有同步字幕的视频文件等使用场景。

工作原理

该工具利用 AI 模型——包括 Whisper、FasterWhisper 和 OpenVINO——来处理来自麦克风、HLS 流(YouTube、Twitch)或本地文件的音频输入。它同时利用 GPU(Nvidia CUDA、AMD ROCm)和 CPU 资源进行转录和翻译。它包含一个基于 Web 的视频播放器用于实时字幕显示,并可以导出 SRT 或 VTT 格式的字幕。

适用人群

它主要面向爱好者、学生和外国内容粉丝(如 VTuber 观众),他们希望在不依赖专业翻译服务的情况下理解直播或视频。

亮点

  • 实时翻译:支持实时 HLS 流、麦克风输入和本地文件。
  • 交互式视频 UI:带有同步字幕和可定制样式的 Web 播放器。
  • 灵活的硬件支持:可在 CPU、Nvidia GPU (CUDA) 以及 Intel iGPU/dGPU/NPU 上运行。
  • 噪声与垃圾信息过滤:包含黑名单和重复抑制功能,以过滤掉幻觉或不需要的短语。
  • 集成选项:可以通过 Webhooks 将翻译结果发送到 Discord,或通过本地 Web 服务器进行展示。
  • 字幕生成:能够将字幕压制进视频或作为轨道嵌入,并可以使用 Demucs 进行可选的人声分离。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目