FatihMakes/Mark-LIV

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

🎯 MARK LIVとは?

MARK LIVは、Windows、macOS、Linuxで動作するクロスプラットフォームの音声ファースト個人AIアシスタントです。ユーザーと会話をし、声を聞き取り、画面やウェブカメラを確認し、コンピュータを制御(アプリの起動、音量調整、ファイル移動、メッセージ送信など)することができます。最大の特徴は、ソフトウェアレンダリングによる3Dの顔です。これはPyQt 6の QPainter で描画されており、リップシンク、瞬き、眼球運動をリアルタイムで行います。GPUや追加のグラフィックライブラリは一切不要です。

このアシスタントは、超低遅延で音声とテキストの双方向ストリーミングを行う Google Gemini 3.1 Flash Live(「Gemini Live API」)によって駆動されます。アシスタント自身の知識(名前、OS、インストール済みプラグイン、制限事項など)は、ハードコーディングではなく、起動時にライブシステムから生成されます。


✨ 主な機能(READMEより)

機能 内容
ホログラフィックアバター HUD上のアニメーションする顔。計測された顔の幾何学構造に基づき、ソフトウェアのみでレンダリング(GPU不要)。
リアルリップシンク 音声フォルマントトランスクリプトから毎秒約50の口の形を生成し、正しい音素を形成。
言語非依存の口の形 ラテン文字、キリル文字、ギリシャ文字など多くのスクリプトに対応。信頼性の低い綴りの場合は音声のみの形状にフォールバック。
表情豊かな演技 文脈に合わせて眉が動き、目がサッカードし、自然な瞬きを行い、強調音節で頷く。
ステータスライトとしての顔 思考中は視線を外し、聞いているときは目を合わせ、眠っているときは目を閉じ、新しいコンテンツには視線を向ける。
プッシュ・トゥ・トーク (Ctrl+Space) Windowsではグローバルホットキー、他OSではウィンドウスコープ。キーを押している間のみマイクが有効。
自己エコーガード マイク入力からアシスタント自身の声を検出し除去することで、自己応答を防止。
実行時の自己知識 セッションごとに名前、OS、能力、制限を含むプロンプトを生成。プラグインの追加/削除時に自動更新。
ウェイクワード ローカルでの「Hey Jarvis」検出。アイドル時はスリープし、スリープ中は音声をストリーミングしない。
即時確認 長いタスクを開始する際、ユーザーの言語で簡潔かつ文脈を理解した返答を行う。
無制限のセッション スライディングウィンドウによるコンテキスト圧縮で、長時間の会話でも以前の文脈を保持。
プラグインシステム .py ファイルを plugins/ に置くだけで、次回の起動時に自動認識し run() 関数を呼び出し可能。
呼び出し可能/永続メモリ 事実は memory/long_term.json に保存。UIのメモリパネルから閲覧・削除が可能。
取り消し (Undo) アシスタントが行ったファイルの移動、名前変更、作成、書き込み、設定変更を元に戻す。
リアル確認 不可逆な操作(シャットダウン、再起動、Wi-Fi変更)にはユーザーの明示的なボタン押下が必要。
オーディオデバイス選択 OSが機能していると報告したマイク/スピーカーのみを表示。名前で選択可能。
セッションの継続性 デバイス変更、音声変更、接続切断が発生しても会話はリセットされない。
ライブテーマとHUD 色相環や16進数コードでHUD全体を再着色。アバターも即座に反映。
マルチモードウェブ検索 news, research, price, compare, search – Geminiを基盤とし、DuckDuckGoにフォールバック。
システム制御 アプリ起動、音量/輝度調整、Wi-Fi切り替え、電源操作などを音声で実行。
視覚認識 必要に応じて画面キャプチャやウェブカメラのフレームをGeminiに送信し、ラベル付けを行う。
バックグラウンド監視 トピック監視(例:毎日のニュース)と自然言語によるアラート。
ハードウェア監視 CPU、RAM、GPU、温度の継続的なテレメトリと音声アラート。
リモートダッシュボード QRコードでスマホとペアリングし、遠隔操作が可能。
クリップボードインテリジェンス テキストコピー → 翻訳、要約、説明、修正などを提供するフローティングパネル。
アシスタントのカスタマイズ UIから名前、声、色などを変更可能。即座に反映。
その他ユーティリティ フライト検索、ゲーム更新、ファイル処理、コードヘルパー、ブラウザ制御、メッセージング(WhatsApp/Telegram)、YouTube制御、スマートリマインダー、天気予報など。

📦 実行方法(READMEより)

  1. リポジトリをクローンし、Pythonの依存関係をインストール(PyQt6numpy を使用。追加のグラフィックライブラリは不要)。READMEでは、追加の依存関係がゼロであることを強調しています。
  2. Gemini Live APIキーを取得(リアルタイム音声ストリーミングに必須)。有効なキーがないと動作しません。
  3. メインのPythonエントリーポイントを実行(典型的なプロジェクトでは python main.py など)。画面中央にHUDが表示されます。
  4. オーディオデバイスを設定(内蔵の選択ツールを使用)。
  5. ウェイクワード(「Hey Jarvis」)を使用するか、Ctrl+Space を押して話しかけます。アシスタントが音声とアニメーションで応答します。
  6. プラグインを追加.py ファイルを plugins/ フォルダに配置)。再起動すると新しいスキルが利用可能になります。
  7. メモリパネルやテーマ設定、各種コマンドカテゴリをUIから探索します。

🛠️ 技術的な詳細(READMEより)

  • レンダリング – 頭蓋骨、首、顎、リグは起動時に手続き的に生成。ディスク上には25 KBの顔面メッシュアセットのみを保存。すべて QPainter で描画されるため、ハードウェアを問わず(ヘッドレスVMでも)同一の外観を保証。
  • リップシンクアルゴリズム – フォルマントベースの音声分析(20msスライス)とトランスクリプトを組み合わせ、言語に依存しない口の形を決定。
  • グローバルホットキー (Windows) – 毎秒30回の仮想キーコードポーリングで実装。追加ライブラリは不要。macOS/Linuxはウィンドウスコープにフォールバック。
  • 自己エコーガード – デバイスの遅延を測定し、マイク入力からアシスタント自身の出力を差し引くことで、誤った自己応答を防止。
  • メモリ構造 – 事実はローカルに保存。各ターンでコンパクトな「コア」とキーインデックスのみをGeminiプロンプトに注入。不足した事実は recall_memory ツールでオンデマンド取得。
  • 取り消しシステム – ファイルシステム変更と設定変更を追跡。UIボタンでロールバック可能。
  • GPU不要 – すべてソフトウェアレンダリングのため、専用グラフィックカードのないマシンでも動作。

⚠️ 制限事項と既知の問題(READMEより)

  • 自己エコーガードは機能しますが、アシスタントの発話中に割り込む機能は、ハードウェア依存度が高いため本リリースでは意図的に無効化されています。
  • 音声綴りのない言語(アラビア語、中国語、日本語など)のサポートは、音声のみの形状にフォールバックするため、リップシンクの精度が低下します。
  • グローバルホットキーはWindowsのみ。macOS/Linuxでは、アシスタントウィンドウがフォーカスされている時のみプッシュ・トゥ・トークが機能します。
  • メモリインデックスサイズ – メモリがプロンプト予算を超えるとインデックスが切り捨てられ、保存されている事実を「知らない」と回答する場合があります。
  • GPUアクセラレーションなし – 意図的な仕様ですが、ハイエンドハードウェアではシェーダーベースの3Dモデルより見劣りする可能性があります。
  • Gemini Live APIへの依存 – 応答性と機能はGeminiサービスの可用性とクォータに依存します。

📚 詳細情報

  • YouTubeセットアップ動画https://www.youtube.com/@FatihMakes (READMEにリンクあり)。
  • ソースコード – プロンプトテンプレート (core/prompt.txt)、プラグインアーキテクチャ、レンダリングロジックが含まれています。
  • Gemini Live APIドキュメント – APIキー取得とストリーミング制限に関する外部リソース。

要約: MARK LIVは、驚くほど表情豊かなソフトウェアレンダリングの顔をステータスインジケーターとして備えた、フル機能の音声駆動AIアシスタントです。Gemini Liveモデルを基盤とし、主要なデスクトップOSで動作し、追加のグラフィック依存関係なしで拡張可能なPythonプラグインシステムを備えています。READMEには機能、設計思想、既知の癖が網羅されており、AIアシスタント分野における真の最先端技術プロジェクトです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト