FatihMakes/Mark-LIII

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

解決する課題

Mark LIII は、手を離してリアルタイムで音声操作が可能なクロスプラットフォームの個人用AIアシスタントです。Gemini Live API を活用することで、サブスクリプションの必要性を排除し、ユーザーがデジタル自律性を保ちながら、Windows、macOS、Linux のコンピュータを音声コマンドで制御できます。

動作方法

このプロジェクトは、低遅延の音声ストリーミングと会話に Gemini 3.1 Flash Live エンジンを使用しています。オンデバイスで音声を処理するローカルのウェイクワード検出器("Hey Jarvis")を備えており、プライバシー保護とクラウドコストの削減を実現します。モジュール式アーキテクチャにより、スキルやプラグインは自己記述型のファイルとして設計されており、コアコードを変更せずに新しい機能を追加できます。また、システムプロンプトの肥大化を防ぐために、ローカル検索ベースのメモリシステムを実装しています。

対象ユーザー

有料サブスクリプションサービスに依存せずに、OSの制御、ファイル管理、さまざまなウェブサービスとの統合が可能な、非常にカスタマイズ可能な音声駆動型AIアシスタントを探しているユーザー向けです。

主な特徴

  • 手を離した操作: ローカルで動作する "Hey Jarvis" ウェイクワード検出と、自動スリープ機能。
  • システム統合: アプリの起動、システム設定(音量、明るさ、WiFi)の調整、ファイル管理が可能。変更は「元に戻す」機能で取り消し可能。
  • 拡張可能なプラグインシステム: plugins フォルダに .py ファイルを配置するだけで、新しいスキルを追加可能。
  • 視覚認識機能: Geminiセッションに統合されたリアルタイムの画面キャプチャとウェブカメラの視覚情報。
  • 永続的メモリ: 専用UIパネルを備えたローカルメモリストアで、個人的な事実を保存・参照可能。
  • 低遅延: より速い最初の音声応答を実現する Gemini 3.1 Flash Live で駆動。
  • クロスプラットフォーム: Windows、macOS、Linux に対応。OSごとの依存関係を適切に処理。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト