oboroge0/hayamimi
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
解决的问题
hayamimi 提供完全在 CPU 上运行、内存占用极低(低于 2GB RAM)的实时多语言语音转文本(STT)。它解决了高精度转录通常伴随的高延迟和高硬件要求问题,使用户无需 GPU 或云 API 即可实现低延迟的实时字幕和翻译。
工作原理
hayamimi 不依赖单一通用模型,而是采用路由系统,将每个语音片段导向最适合该语言的专用、量化(INT8)ONNX 模型。它使用 sherpa-onnx 进行推理,避免使用 PyTorch 和 CUDA。整个流程包括:
- 语言识别(LID): 使用
whisper-tiny检测输入音频的语言。 - 专用路由: 将音频路由至专用模型,如 ReazonSpeech(日语)、Paraformer(中文)、SenseVoice(韩语/粤语)或 Parakeet(英语及 24 种欧盟语言)。
- 双阶段优化: 在静音期结束后,对最近的语音片段重新解码以提高准确性。
- 后处理: 包括通过 CAM++ 和 pyannote 实现的说话人标注、CJK 数字规范化,以及通过 FuguMT 或 M2M-100 实现的实时翻译。
- 输入灵活性: 支持麦克风、WAV 文件、WebSocket 网络音频,以及 Windows 特有的系统音频回环输入。
适用人群
- 主播: 需要低延迟 OBS 叠加层实现直播字幕的用户。
- 开发者: 希望通过其
EventHub和 API 将轻量级、私密的 STT 引擎嵌入其他应用的用户。 - 会议记录者: 需要同时转录自身语音和系统音频(通话/视频)的用户。
核心亮点
- 超低延迟: 终端文本通常在语音结束后约 100ms 内出现。
- CPU 优化: 在无 GPU 的 6 核桌面 CPU 上可实现 10–50 倍实时性能。
- 高准确率: 在日语广播音频上实现 3.8% 的 CER,显著优于
whisper-large-v3-turbo在该场景下的表现。 - 内存高效: 使用 LRU 缓存将常驻模型控制在可配置的上限内(默认 <2GB)。
- 集成工具: 内置浏览器仪表板和适用于 OBS 的叠加层。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目