xifan2333/fcitx5-vinput

Voice input for Fcitx5 — local and cloud ASR, LLM rewriting, cross-distro packages

何を解決するか

Fcitx5 入力メソッドフレームワークにおける音声入力機能を提供し、ユーザーが入力する際のキーボード入力の代わりに音声でテキストを入力できるようにします。プライバシーと高速性を重視するオフライン運用、またはより高い精度を求めるクラウドサービスを利用できる柔軟な音声認識システムの必要性に対応しています。

動作方法

このプロジェクトは、自動音声認識(ASR)を Fcitx5 に統合しています。sherpa-onnx モデルを使用したローカル ASR または OpenAI、ElevenLabs など複数のプロバイダーによるクラウドベースの ASR をサポートしています。単なる音声認識にとどまらず、大規模言語モデル(LLM)を活用して、誤字訂正、書式整備、翻訳などの後処理を実行できます。また、「コマンドモード」では、選択したテキストに対して音声で指示を出すことで編集が可能になります。

対象ユーザー

Fcitx5 を使用する Linux ユーザーで、ワークフローに音声入力や音声駆動型テキスト編集を統合したい方。

特徴

  • ハイブリッド ASR:オフラインのローカルモデルと複数のクラウド ASR プロバイダーをサポート。
  • LLM 統合:書式整備や翻訳などの後処理に LLM を活用。
  • 柔軟なトリガー:トグル式録音とプッシュ・トゥ・トークモードの両方を提供。
  • コマンドモード:選択したテキストを音声指示で編集可能。
  • 広範な配布:Arch、Fedora、Ubuntu/Debian、Nix、Flatpak に対応したパッケージを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト