xifan2333/fcitx5-vinput

Voice input for Fcitx5 — local and cloud ASR, LLM rewriting, cross-distro packages

解決的問題

為 Linux 上的 Fcitx5 輸入法框架提供語音輸入功能,讓使用者能以語音取代鍵盤輸入文字。解決對彈性語音轉文字系統的需求,此系統可離線運作以保障隱私與速度,或透過雲端服務取得更高準確度。

運作方式

本專案將自動語音辨識(ASR)整合至 Fcitx5。支援使用 sherpa-onnx 模型的本地 ASR,或透過 OpenAI、ElevenLabs 等提供者之雲端 ASR。除了基本轉錄外,還可利用大型語言模型(LLM)對轉錄文字進行後處理,例如錯誤修正、格式化或翻譯。亦具備「指令模式」,使用者可選取文字並以語音發出指令進行修改。

適用對象

使用 Fcitx5 輸入法的 Linux 使用者,希望將語音輸入與語音驅動的文字編輯整合至工作流程中。

主要特色

  • 混合式 ASR:支援離線本地模型與多種雲端 ASR 提供者。
  • LLM 整合:利用 LLM 執行格式化、翻譯等後處理任務。
  • 彈性觸發:提供切換式錄音與按壓說話(push-to-talk)模式。
  • 指令模式:允許使用者以語音指令修改選取的文字。
  • 廣泛分發:提供 Arch、Fedora、Ubuntu/Debian、Nix 與 Flatpak 的套件。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案