nishuzumi/gemini-teacher
English pronunciation correction teacher built with gemini
解決的問題
提供一個即時英語口說練習工具,透過即時的AI驅動反饋,幫助使用者提升發音與文法能力。
運作方式
此應用程式使用 Google Gemini AI API 處理語音輸入。它能即時識別英語口語,並提供發音評估、文法修正以及情境式對話練習,無需額外的語音合成(TTS)引擎,因其利用 Gemini Live API 的原生音訊輸出功能。
適用對象
希望在模擬對話環境中練習口說,並獲得針對性發音指導與文法修正的英語學習者。
主要特色
- 即時語音辨識與AI驅動的發音評估。
- 文法修正與針對性發音指導。
- 支援智慧場景切換的情境式對話練習。
- 透過 Gemini Live API 實現原生音訊輸出。
相關
- 專案
diodiogod/TTS-Audio-SuiteTTS Audio Suite 是一個 ComfyUI 擴充,整合了 19 個文字轉語音、語音轉換與音訊編輯引擎(例如 F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)。它提供字幕感知生成、分段標籤、視覺化波形分析、靜音語音時間對齊,以及內建的 RVC 模型訓練功能,所有功能皆透過執行時隔離,確保不同引擎的相依性不會衝突。
- 專案
openvinotoolkit/nncfNNCF(神經網路壓縮框架)是一個開源的 Python 庫,為 PyTorch、TorchFX、ONNX 和 OpenVINO 模型新增訓練後與訓練期間的壓縮(量化、權重壓縮、剪枝等),在極小精度損失下實現更小、更快的推論。
- 專案
aTrainTranscription/aTrainaTrain 是一個在您電腦上離線運行 Whisper(透過 faster-whisper)的轉錄應用,支援說話人分離、99 種語言,匯出格式相容 MAXQDA、ATLAS.ti 和 NVivo。它以 Linux/Windows 桌面應用形式分發,也提供 pip 可安裝的 CLI 版本,支援可選的 CUDA GPU 加速以提升處理速度。
- 專案