tover0314-w/opentypeless
Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.
해결하는 문제
OpenTypeless는 음성 입력을 고품질 텍스트로 변환하는 크로스플랫폼 데스크톱 애플리케이션입니다. 표준 음성 인식 도구의 한계를 해결하기 위해 AI 기반의 '정제' 레이어를 추가하여, 사용자가 자연스럽게 말할 수 있도록 하면서도 AI가 사용 중인 특정 애플리케이션(예: 이메일, 채팅, 코드 에디터)의 톤과 구조에 맞게 텍스트를 재작성할 수 있게 합니다.
작동 방식
사용자는 글로벌 핫키를 통해 앱을 트리거하여 오디오를 캡처합니다. 시스템은 다음과 같은 특정 파이프라인을 따릅니다:
- 음성 인식: 오디오가 선택한 음성-텍스트(STT) 제공자(Groq, Deepgram, 또는 OpenAI Whisper 등)로 전송됩니다.
- 맥락 분석: 앱은 로컬에서 활성화된 애플리케이션을 감지하여 적절한 글쓰기 스타일을 결정합니다.
- AI 정제: 활성화된 경우, 원시 텍스트는 앱 전용 메타데이터와 함께 대규모 언어 모델(LLM)로 전송되어 재작성되거나 번역됩니다.
- 출력: 최종 텍스트는 활성 애플리케이션에 직접 입력되거나 클립보드에 복사됩니다.
대상 사용자
macOS, Windows, Linux 사용자 중 다양한 애플리케이션에서 글쓰기 워크플로를 가속화하고 싶은 전문 사용자, 또는 전통적인 채팅 인터페이스 대신 음성 중심의 질문-응답을 선호하는 사용자에게 적합합니다.
주요 기능
- 앱 인식 글쓰기: 감지된 활성 애플리케이션에 따라 자동으로 톤과 구조를 조정합니다.
- 무엇이든 질문하기: 채팅 앱 없이도 한 번의 음성 입력으로 간결한 답변을 제공하는 플로팅 노트 기반의 음성 Q&A 기능입니다.
- 선택된 텍스트 편집: 어떤 앱에서든 텍스트를 선택하고 음성 지시를 통해 재작성, 요약, 번역할 수 있습니다.
- 유연한 제공자 지원: 다양한 STT 및 LLM 제공자(예: Ollama를 통한 로컬 호스팅 포함)에 대해 '자신의 키 사용(BYOK)'을 지원하거나 관리형 클라우드 옵션을 제공합니다.
- 사용자 정의 사전: 반복적인 인식 오류를 수정하기 위한 로컬 수정 규칙 및 용어 관리 기능을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트