cyberofficial/Synthalingua
Synthalingua - Real Time Translation
它解决了什么问题
Synthalingua 是一个自托管工具,旨在打破实时音频和视频中的语言障碍。它允许用户以近乎实时的方式将各种语言的音频转录并翻译成英语(或其他多语言输出),专门针对观看直播(例如 VTubers)或处理带有同步字幕的视频文件等使用场景。
工作原理
该工具利用 AI 模型——包括 Whisper、FasterWhisper 和 OpenVINO——来处理来自麦克风、HLS 流(YouTube、Twitch)或本地文件的音频输入。它同时利用 GPU(Nvidia CUDA、AMD ROCm)和 CPU 资源进行转录和翻译。它包含一个基于 Web 的视频播放器用于实时字幕显示,并可以导出 SRT 或 VTT 格式的字幕。
适用人群
它主要面向爱好者、学生和外国内容粉丝(如 VTuber 观众),他们希望在不依赖专业翻译服务的情况下理解直播或视频。
亮点
- 实时翻译:支持实时 HLS 流、麦克风输入和本地文件。
- 交互式视频 UI:带有同步字幕和可定制样式的 Web 播放器。
- 灵活的硬件支持:可在 CPU、Nvidia GPU (CUDA) 以及 Intel iGPU/dGPU/NPU 上运行。
- 噪声与垃圾信息过滤:包含黑名单和重复抑制功能,以过滤掉幻觉或不需要的短语。
- 集成选项:可以通过 Webhooks 将翻译结果发送到 Discord,或通过本地 Web 服务器进行展示。
- 字幕生成:能够将字幕压制进视频或作为轨道嵌入,并可以使用 Demucs 进行可选的人声分离。
相关
- 项目
- 项目
- 项目
- 项目
- 项目