FatihMakes/Mark-LIV

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

🎯 什麼是 MARK LIV

MARK LIV 是一款跨平台、語音優先的個人 AI 助理,可在 Windows、macOS 和 Linux 上執行。它能與你對話、聆聽你的聲音、查看你的螢幕或網路攝影機,並能控制電腦(開啟應用程式、調整音量、移動檔案、傳送訊息等)。其最顯眼的視覺元素是一個軟體渲染的 3D 人臉,能即時進行口型同步、眨眼和眼球轉動——所有這些皆透過 PyQt 6 的 QPainter 繪製,因此無需 GPU 或額外的圖形函式庫。

該助理採用 Google Gemini 3.1 Flash Live(即「Gemini Live API」)驅動,以超低延遲進行音訊與文字的雙向串流。助理關於自身的所有知識(名稱、作業系統、已安裝插件,甚至其限制)皆在啟動時從即時系統生成,而非硬編碼。


✨ 核心功能(如 README 所列)

功能 描述
全息頭像 HUD 中的動畫人臉;具備真實測量的臉部幾何結構,完全由軟體渲染(無 GPU)。
真實口型同步 每秒約 50 個嘴型,源自音訊共振峰轉錄內容,確保嘴型符合正確的音素。
語言無關嘴型 一套規則適用於拉丁、西里爾、希臘及許多其他文字;缺乏可靠拼寫的文字將回退至僅依賴音訊的塑形。
臉部表情 眉毛隨語句變化,眼睛進行掃視,自然眨眼,在重音音節點頭。
臉部作為狀態燈 思考時移開視線,聆聽時對視,睡眠時閉眼,查看新內容時向下瞥視。
按鍵通話 (Ctrl+Space) Windows 上為全域熱鍵,其他平台為視窗範圍;麥克風在按鍵按下前保持關閉。
自我回音防護 從麥克風輸入中偵測並剔除助理自身的聲音,防止其自問自答。
執行時期自我知識 每次會話生成包含名稱、作業系統、能力與明確限制的提示詞;新增/移除插件時自動更新。
喚醒詞 本地「Hey Jarvis」偵測;閒置時進入睡眠,睡眠期間絕不串流音訊。
即時確認 在執行較長任務時,立即以使用者的語言說出簡短且具情境意識的回應。
無限會話 滑動視窗上下文壓縮技術,讓單次對話可持續數小時而不遺失早期上下文。
插件系統 將單一 .py 檔案放入 plugins/;助理會在下次啟動時發現並可呼叫其 run() 函式。
可回溯/持久記憶 事實儲存在 memory/long_term.json;UI 提供記憶面板,可檢視或刪除條目。
復原 撤銷助理執行的檔案移動、重新命名、建立、寫入及設定變更。
真實確認 不可逆的操作(關機、重啟、Wi-Fi 變更)需要使用者明確按下按鈕。
音訊裝置選擇器 僅列出作業系統回報為功能正常的麥克風/喇叭;可按名稱選擇。
會話連續性 更換裝置、語音或連線中斷不會重置對話。
即時主題與 HUD 透過色相環或十六進位代碼重新為整個 HUD 上色;頭像會立即變色。
多模式網頁搜尋 newsresearchpricecomparesearch – 以 Gemini 為基礎,並提供 DuckDuckGo 回退。
系統控制 透過語音啟動應用程式、調整音量/亮度、切換 Wi-Fi、電源操作等。
視覺感知 依需求擷取螢幕與網路攝影機畫面並傳送至 Gemini 進行標記。
背景監控 可設定主題監控(例如每日新聞)並提供自然語言警示。
硬體監控 持續的 CPU、RAM、GPU、溫度遙測,並提供語音警示。
遠端儀表板 透過 QR 碼配對手機以遠端控制助理。
剪貼簿智慧 複製文字 → 浮動面板提供翻譯、摘要、解釋、修正等功能。
助理自訂 從 UI 變更名稱、語音、顏色等;變更立即生效。
其他多種工具 航班搜尋、遊戲更新、檔案處理、程式碼助手、瀏覽器控制、訊息(WhatsApp/Telegram)、YouTube 控制、智慧提醒、天氣報告等。

📦 如何執行(根據 README 中的資訊)

  1. 複製儲存庫並安裝列出的 Python 依賴項(專案已使用 PyQt6numpy;無需額外圖形函式庫)。README 強調該應用程式除了自身需求外,零額外依賴
  2. 取得 Gemini Live API 金鑰(即時語音串流所需)。若無有效金鑰,助理將無法運作。
  3. 執行主要的 Python 入口點(README 未命名該腳本,但典型專案通常使用 python main.py 之類)。UI 將出現,HUD 位於螢幕中央。
  4. 設定音訊裝置:若預設麥克風或喇叭不正確,請透過內建選擇器設定。
  5. 使用喚醒詞(「Hey Jarvis」)或按住 Ctrl+Space 開始說話。助理將以語音和動畫臉部表情回應。
  6. 新增插件:將 .py 檔案放入 plugins/ 資料夾;重新啟動應用程式,新技能即可使用。
  7. 探索記憶面板、主題選項以及 UI 中的各種指令類別(系統控制、網頁搜尋等)。

🛠️ 值得注意的技術細節(來自 README)

  • 渲染 – 頭像的頭骨、頸部、下顎和骨架在啟動時程序化生成;磁碟上僅儲存 25 KB 的臉部網格資產。所有繪圖皆由 QPainter 完成,確保在任何硬體(甚至是無頭虛擬機)上外觀一致。
  • 口型同步演算法 – 結合基於共振峰的音訊分析(20 ms 切片)與轉錄內容來決定嘴型,實現語言無關的發音。
  • 全域熱鍵 (Windows) – 透過每秒輪詢 30 次虛擬鍵碼實現;不使用額外函式庫。macOS/Linux 回退至視窗範圍熱鍵。
  • 自我回音防護 – 測量音訊裝置延遲並從麥克風輸入中減去助理自身的輸出,防止意外的自我回應。
  • 記憶架構 – 完整事實儲存在本地;每次輪詢僅將精簡的「核心」與鍵值索引注入 Gemini 提示詞。缺失的事實透過 recall_memory 工具按需擷取。
  • 復原系統 – 追蹤檔案系統變更與設定修改;單一 UI 按鈕即可復原。
  • 無需 GPU – 由於一切皆為軟體渲染,助理可在沒有獨立顯示卡的機器上執行。

⚠️ 限制與待解決問題(如 README 所述)

  • 自我回音防護雖有效,但在此版本中刻意停用了在助理說話中途打斷的功能,因為這高度依賴硬體。
  • 缺乏語音拼寫的語言支援(阿拉伯文、中文、日文等)會回退至僅依賴音訊的塑形,導致口型同步細節較少。
  • 全域熱鍵僅在 Windows 上有效;在 macOS/Linux 上,按鍵通話僅在助理視窗獲得焦點時有效。
  • 記憶索引大小 – 若記憶超過提示詞預算,索引可能會被截斷,導致助理聲稱「不知道」實際上已儲存的事實。
  • 無 GPU 加速 – 這是刻意的,這意味著頭像在高階硬體上可能看起來不如基於著色器的 3D 模型精緻。
  • 依賴 Gemini Live API – 助理的反應速度與能力取決於 Gemini 服務的可用性與配額。

📚 深入了解

  • YouTube 設定影片https://www.youtube.com/@FatihMakes (README 中連結)。
  • 原始碼 – 儲存庫本身包含提示詞模板 (core/prompt.txt)、插件架構與渲染邏輯。
  • Gemini Live API 文件 – 取得 API 金鑰與了解串流限制的外部資源。

簡而言之: MARK LIV 是一款功能齊全、語音驅動的 AI 助理,增加了一個極具表現力的軟體渲染人臉作為狀態指示器。它建立在 Gemini Live 模型之上,可在所有主流桌面作業系統上運作,無需額外的圖形依賴,並可透過簡單的 Python 插件系統進行擴充。README 提供了功能、設計選擇與已知怪癖的詳盡概述,使其成為 AI 助理領域中真正的尖端技術專案。

相關

  • 專案
  • 專案
  • 專案
  • 專案