FatihMakes/Mark-LI
Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.
何を解決するか
Mark LI は、ユーザーのデジタル拡張として機能するクロスプラットフォーム個人用AIアシスタントです。リアルタイムの音声と視覚的インタラクションを通じて、手を離した状態でコンピュータを制御し、日常のタスクを管理できます。シンプルなプラグインシステムにより、ユーザーが新しい機能を追加できるため、継続的な手動設定の必要がありません。
動作方法
Gemini Live API を基盤として構築されており、ネイティブの音声ストリーミングにより低遅延な会話と感情的な対話を実現しています。これにより、ユーザーの声に含まれる感情を検知できます。プラグインアーキテクチャを採用しており、特定のフォルダに .py ファイルをドロップするだけで新しいスキルを追加でき、コアエンジンの変更は不要です。リアルタイムの画面キャプチャとウェブカメラの視覚情報と、システム制御、ウェブ検索、アプリ管理のための組み込みアクションを統合し、すべて PyQt6 ベースのHUDで管理されます。
対象ユーザー
Windows、macOS、Linux の OS を音声、視覚、拡張可能なプラグインを通じて制御できる、JARVIS風のAIアシスタントを探しているユーザー。
特徴
- プラグインシステム: プラグインフォルダに単一の Python ファイルをドロップするだけで新しいスキルを追加でき、組み込みのクラッシュ隔離機能を備えています。
- 感情対話: ユーザーの声に含まれる感情に基づいて、アシスタントのトーンを自動調整します。
- 能動的音声認識: 直接的なコマンドと背景の会話の区別が可能で、誤作動を防ぎます。
- システム制御: 音声によるハードウェア設定(音量、明るさ)、アプリの起動、デスクトップ管理が可能。
- 視覚認識: リアルタイムの画面およびウェブカメラ映像を Gemini セッションに流し込み、視覚的情報を提供します。
- 無制限のセッション: スライディングウィンドウによるコンテキスト圧縮を使用し、会話の流れを失うことなく長時間のやり取りが可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト