nishuzumi/gemini-teacher
English pronunciation correction teacher built with gemini
What it solves
It provides a real-time English speaking practice tool that helps users improve their pronunciation and grammar through immediate AI-driven feedback.
How it works
The application uses the Google Gemini AI API to process voice input. It recognizes spoken English in real-time and provides pronunciation assessments, grammar corrections, and scenario-based conversation practice without requiring a separate text-to-speech (TTS) engine, as it leverages Gemini Live API's native audio output.
Who it’s for
English learners who want to practice speaking and receive targeted pronunciation guidance and grammar corrections in a simulated conversational environment.
Highlights
- Real-time voice recognition and AI-driven pronunciation evaluation.
- Grammar correction and targeted pronunciation guidance.
- Scenario-based conversation practice with intelligent scene switching.
- Native audio output via Gemini Live API.
Related
- Project
diodiogod/TTS-Audio-SuiteTTS Audio Suite is a ComfyUI extension that unifies 19 text‑to‑speech, voice‑conversion and audio‑editing engines (e.g., F5‑TTS, DramaBox, Higgs Audio, Qwen3‑TTS, RVC). It offers subtitle‑aware generation, per‑segment tags, visual waveform analysis, silent‑speech timing, and built‑in RVC model training, all with runtime isolation for different engine dependencies.
- Project
openvinotoolkit/nncfNNCF (Neural Network Compression Framework) is an open‑source Python library that adds post‑training and training‑time compression (quantization, weight compression, pruning, etc.) to PyTorch, TorchFX, ONNX, and OpenVINO models, enabling smaller, faster inference with minimal accuracy loss.
- Project
aTrainTranscription/aTrainaTrain is an offline transcription app that runs Whisper (via faster‑whisper) on your computer, offering speaker diarisation, 99‑language support, and export formats compatible with MAXQDA, ATLAS.ti, and NVivo. It’s distributed as a desktop app for Linux/Windows and as a pip‑installable CLI, with optional CUDA GPU acceleration for faster processing.
- Project
modal-labs/quillmanA voice chat application powered by the Moshi speech-to-speech model, providing low-latency, bidirectional audio streaming for human-like interaction.