nishuzumi/gemini-teacher
English pronunciation correction teacher built with gemini
解决的问题
提供一个实时英语口语练习工具,通过即时的AI驱动反馈,帮助用户提升发音和语法水平。
工作原理
该应用使用 Google Gemini AI API 处理语音输入。它能够实时识别英语口语,并提供发音评估、语法修正以及基于场景的对话练习,无需额外的文本转语音(TTS)引擎,因为它利用了 Gemini Live API 的原生音频输出功能。
适用人群
希望在模拟对话环境中练习口语,并获得针对性发音指导和语法修正的英语学习者。
主要亮点
- 实时语音识别与AI驱动的发音评估。
- 语法修正与针对性发音指导。
- 基于场景的对话练习,支持智能场景切换。
- 通过 Gemini Live API 实现原生音频输出。
相关
- 项目
diodiogod/TTS-Audio-SuiteTTS Audio Suite 是一个 ComfyUI 扩展,整合了 19 个文本转语音、语音转换和音频编辑引擎(例如 F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)。它提供字幕感知生成、分段标签、可视化波形分析、静音语音时间对齐,以及内置的 RVC 模型训练功能,所有功能均通过运行时隔离实现不同引擎依赖项的独立管理。
- 项目
openvinotoolkit/nncfNNCF(神经网络压缩框架)是一个开源的 Python 库,为 PyTorch、TorchFX、ONNX 和 OpenVINO 模型添加训练后和训练时压缩(量化、权重压缩、剪枝等),实现更小、更快的推理,且精度损失极小。
- 项目
aTrainTranscription/aTrainaTrain 是一个在您电脑上离线运行 Whisper(通过 faster-whisper)的转录应用,支持说话人分离、99 语言,导出格式兼容 MAXQDA、ATLAS.ti 和 NVivo。它以 Linux/Windows 桌面应用形式分发,也提供 pip 可安装的 CLI 版本,支持可选的 CUDA GPU 加速以提升处理速度。
- 项目