nishuzumi/gemini-teacher
English pronunciation correction teacher built with gemini
解決する課題
リアルタイムの英語発音練習ツールを提供し、即時のAI駆動のフィードバックを通じてユーザーの発音と文法を向上させます。
動作方法
アプリケーションはGoogle Gemini AI APIを使用して音声入力を処理します。リアルタイムで英語の発話を認識し、発音評価、文法修正、シナリオベースの会話練習を提供します。別途音声合成(TTS)エンジンは不要です。Gemini Live APIのネイティブ音声出力機能を利用しています。
対象ユーザー
シミュレートされた会話環境で、的確な発音指導と文法修正を受けながら英語の会話練習をしたい英語学習者。
特徴
- リアルタイム音声認識とAI駆動の発音評価。
- 文法修正と的確な発音指導。
- インテリジェントなシーン切り替えを備えたシナリオベースの会話練習。
- Gemini Live APIによるネイティブ音声出力。
関連
- プロジェクト
diodiogod/TTS-Audio-SuiteTTS Audio Suite は、19のテキストから音声、ボイス変換、オーディオ編集エンジン(例:F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)を統合する ComfyUI 拡張です。字幕対応生成、セグメントごとのタグ、波形の可視化、サイレントスピーチのタイミング解析、組み込みのRVCモデル学習機能を備え、各エンジンの依存関係をランタイム分離で管理します。
- プロジェクト
openvinotoolkit/nncfNNCF(Neural Network Compression Framework)は、PyTorch、TorchFX、ONNX、OpenVINOモデルに事後訓練および訓練時圧縮(量子化、重み圧縮、削減など)を追加するオープンソースのPythonライブラリであり、精度の損失を最小限に抑えつつ、より小さく高速な推論を実現します。
- プロジェクト
aTrainTranscription/aTrainaTrain は、あなたのコンピュータ上で Whisper(faster-whisper を経由)をオフラインで実行する音声認識アプリです。スピーカー・ディアライゼーション、99言語対応、MAXQDA、ATLAS.ti、NVivo と互換性のあるエクスポート形式を提供します。Linux/Windows 向けデスクトップアプリとして配布され、pip でインストール可能な CLI バージョンも用意されており、CUDA GPU によるオプションのアクセラレーションで処理速度を向上させられます。
- プロジェクト
modal-labs/quillmanMoshi 音声対音声モデルを活用し、低遅延かつ双方向のオーディオストリーミングを提供することで、人間のようなインタラクションを実現する音声チャットアプリケーションです。