nishuzumi/gemini-teacher
English pronunciation correction teacher built with gemini
해결하는 문제
사용자가 즉각적인 AI 기반 피드백을 통해 발음과 문법을 향상시킬 수 있는 실시간 영어 발음 연습 도구를 제공합니다.
작동 방식
이 애플리케이션은 Google Gemini AI API를 사용하여 음성 입력을 처리합니다. 실시간으로 영어 발음을 인식하고, 발음 평가, 문법 수정, 시나리오 기반 대화 연습을 제공합니다. 별도의 텍스트-to-음성(TTS) 엔진이 필요 없으며, Gemini Live API의 내장 음성 출력 기능을 활용합니다.
대상 사용자
시뮬레이션된 대화 환경에서 정확한 발음 안내와 문법 수정을 받으며 영어 회화 연습을 원하는 영어 학습자.
주요 기능
- 실시간 음성 인식 및 AI 기반 발음 평가.
- 문법 수정 및 정확한 발음 안내.
- 지능적인 장면 전환을 갖춘 시나리오 기반 대화 연습.
- Gemini Live API를 통한 네이티브 음성 출력.
관련
- 프로젝트
diodiogod/TTS-Audio-SuiteTTS Audio Suite는 F5‑TTS, DramaBox, Higgs Audio, Qwen3‑TTS, RVC 등 19개의 텍스트-음성, 음성 변환 및 오디오 편집 엔진을 통합하는 ComfyUI 확장입니다. 자막 인식 생성, 세그먼트별 태그, 시각적 파형 분석, 사이렌트 스피치 타이밍, 내장된 RVC 모델 학습 기능을 제공하며, 각 엔진의 런타임 격리로 의존성 충돌을 방지합니다.
- 프로젝트
openvinotoolkit/nncfNNCF(신경망 압축 프레임워크)는 PyTorch, TorchFX, ONNX, OpenVINO 모델에 사후 훈련 및 훈련 중 압축(양자화, 가중치 압축, 프루닝 등)을 추가하는 오픈소스 파이썬 라이브러리로, 정확도 손실을 최소화하면서 더 작고 빠른 추론을 가능하게 합니다.
- 프로젝트
aTrainTranscription/aTrainaTrain은 컴퓨터에서 Whisper(더 빠른 Whisper를 통해)를 오프라인으로 실행하는 음성 인식 앱입니다. 스피커 다이어라이제이션, 99개 언어 지원, MAXQDA, ATLAS.ti, NVivo와 호환되는 내보내기 형식을 제공합니다. Linux/Windows용 데스크톱 앱으로 배포되며, pip로 설치 가능한 CLI 버전도 있으며, CUDA GPU 가속을 통해 더 빠른 처리가 가능합니다.
- 프로젝트
modal-labs/quillmanMoshi 음성 대 음성 모델을 기반으로 하여, 인간과 같은 상호작용을 위해 저지연, 양방향 오디오 스트리밍을 제공하는 음성 채팅 애플리케이션입니다.