xifan2333/fcitx5-vinput
Voice input for Fcitx5 — local and cloud ASR, LLM rewriting, cross-distro packages
해결하는 문제
이 프로젝트는 Linux에서 Fcitx5 입력기 프레임워크에 음성 입력 기능을 제공하여 사용자가 타이핑 대신 음성으로 텍스트를 입력할 수 있도록 합니다. 개인 정보 보호와 속도를 중시하는 오프라인 모드 또는 더 높은 정확도를 원하는 클라우드 기반 서비스를 선택할 수 있는 유연한 음성-텍스트 변환 시스템의 필요성을 충족시킵니다.
작동 방식
자동 음성 인식(ASR)을 Fcitx5에 통합합니다. sherpa-onnx 모델을 사용한 로컬 ASR 또는 OpenAI, ElevenLabs 등 다양한 제공업체를 통한 클라우드 기반 ASR를 지원합니다. 단순한 음성 전사 외에도 대규모 언어 모델(LLM)을 활용해 오류 수정, 서식 조정, 번역 등의 후처리를 수행할 수 있습니다. 또한 "명령 모드"에서는 선택한 텍스트에 음성 명령을 통해 텍스트를 수정할 수 있습니다.
대상 사용자
Fcitx5 입력기를 사용하는 Linux 사용자 중 음성 입력과 음성 기반 텍스트 편집을 작업 흐름에 통합하고자 하는 사용자입니다.
주요 기능
- 하이브리드 ASR: 오프라인 로컬 모델과 다양한 클라우드 ASR 제공업체를 모두 지원합니다.
- LLM 통합: 서식 조정 및 번역과 같은 후처리 작업에 LLM을 활용합니다.
- 유연한 트리거: 토글 기반 녹음과 푸시 투 톡 모드를 모두 제공합니다.
- 명령 모드: 선택한 텍스트를 음성 명령으로 수정할 수 있습니다.
- 광범위한 배포: Arch, Fedora, Ubuntu/Debian, Nix, Flatpak용 패키지를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트