FatihMakes/Mark-LIV

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

🎯 什么是 MARK LIV

MARK LIV 是一款跨平台、语音优先的个人 AI 助理,可在 Windows、macOS 和 Linux 上运行。它能与你对话、聆听你的声音、查看你的屏幕或网络摄像头,并能控制电脑(打开应用程序、调整音量、移动文件、发送消息等)。其最显眼的视觉元素是一个软件渲染的 3D 人脸,能实时进行口型同步、眨眼和眼球转动——所有这些皆通过 PyQt 6 的 QPainter 绘制,因此无需 GPU 或额外的图形库。

该助理采用 Google Gemini 3.1 Flash Live(即“Gemini Live API”)驱动,以超低延迟进行音频与文本的双向流式传输。助理关于自身的所有知识(名称、操作系统、已安装插件,甚至其限制)皆在启动时从实时系统生成,而非硬编码。


✨ 核心功能(如 README 所列)

功能 描述
全息头像 HUD 中的动画人脸;具备真实测量的脸部几何结构,完全由软件渲染(无 GPU)。
真实口型同步 每秒约 50 个嘴型,源自音频共振峰转录内容,确保嘴型符合正确的音素。
语言无关嘴型 一套规则适用于拉丁、西里尔、希腊及许多其他文字;缺乏可靠拼写的文字将回退至仅依赖音频的塑形。
脸部表情 眉毛随语句变化,眼睛进行扫视,自然眨眼,在重音音节点头。
脸部作为状态灯 思考时移开视线,聆听时对视,睡眠时闭眼,查看新内容时向下瞥视。
按键通话 (Ctrl+Space) Windows 上为全局热键,其他平台为窗口范围;麦克风在按键按下前保持关闭。
自我回音防护 从麦克风输入中检测并剔除助理自身的声音,防止其自问自答。
运行时自我知识 每次会话生成包含名称、操作系统、能力与明确限制的提示词;新增/移除插件时自动更新。
唤醒词 本地“Hey Jarvis”检测;闲置时进入睡眠,睡眠期间绝不流式传输音频。
即时确认 在执行较长任务时,立即以使用者的语言说出简短且具情境意识的回复。
无限会话 滑动窗口上下文压缩技术,让单次对话可持续数小时而不丢失早期上下文。
插件系统 将单一 .py 文件放入 plugins/;助理会在下次启动时发现并可调用其 run() 函数。
可回溯/持久记忆 事实存储在 memory/long_term.json;UI 提供记忆面板,可查看或删除条目。
撤销 撤销助理执行的文件移动、重命名、创建、写入及设置变更。
真实确认 不可逆的操作(关机、重启、Wi-Fi 变更)需要使用者明确按下按钮。
音频设备选择器 仅列出操作系统报告为功能正常的麦克风/扬声器;可按名称选择。
会话连续性 更换设备、语音或连接中断不会重置对话。
实时主题与 HUD 通过色相环或十六进制代码重新为整个 HUD 上色;头像会立即变色。
多模式网页搜索 newsresearchpricecomparesearch – 以 Gemini 为基础,并提供 DuckDuckGo 回退。
系统控制 通过语音启动应用程序、调整音量/亮度、切换 Wi-Fi、电源操作等。
视觉感知 按需截取屏幕与网络摄像头画面并发送至 Gemini 进行标记。
后台监控 可设置主题监控(例如每日新闻)并提供自然语言警示。
硬件监控 持续的 CPU、RAM、GPU、温度遥测,并提供语音警示。
远程仪表板 通过 QR 码配对手机以远程控制助理。
剪贴板智能 复制文本 → 浮动面板提供翻译、摘要、解释、修正等功能。
助理自定义 从 UI 变更名称、语音、颜色等;变更立即生效。
其他多种工具 航班搜索、游戏更新、文件处理、代码助手、浏览器控制、消息(WhatsApp/Telegram)、YouTube 控制、智能提醒、天气报告等。

📦 如何运行(根据 README 中的信息)

  1. 克隆存储库并安装列出的 Python 依赖项(项目已使用 PyQt6numpy;无需额外图形库)。README 强调该应用程序除了自身需求外,零额外依赖
  2. 获取 Gemini Live API 密钥(实时语音流所需)。若无有效密钥,助理将无法运作。
  3. 运行主要的 Python 入口点(README 未命名该脚本,但典型项目通常使用 python main.py 之类)。UI 将出现,HUD 位于屏幕中央。
  4. 设置音频设备:若默认麦克风或扬声器不正确,请通过内置选择器设置。
  5. 使用唤醒词(“Hey Jarvis”)或按住 Ctrl+Space 开始说话。助理将以语音和动画脸部表情回复。
  6. 新增插件:将 .py 文件放入 plugins/ 文件夹;重新启动应用程序,新技能即可使用。
  7. 探索记忆面板、主题选项以及 UI 中的各种指令类别(系统控制、网页搜索等)。

🛠️ 值得注意的技术细节(来自 README)

  • 渲染 – 头像的头骨、颈部、下颚和骨架在启动时程序化生成;磁盘上仅存储 25 KB 的脸部网格资产。所有绘图皆由 QPainter 完成,确保在任何硬件(甚至是无头虚拟机)上外观一致。
  • 口型同步算法 – 结合基于共振峰的音频分析(20 ms 切片)与转录内容来决定嘴型,实现语言无关的发音。
  • 全局热键 (Windows) – 通过每秒轮询 30 次虚拟键码实现;不使用额外库。macOS/Linux 回退至窗口范围热键。
  • 自我回音防护 – 测量音频设备延迟并从麦克风输入中减去助理自身的输出,防止意外的自我回复。
  • 记忆架构 – 完整事实存储在本地;每次轮询仅将精简的“核心”与键值索引注入 Gemini 提示词。缺失的事实通过 recall_memory 工具按需获取。
  • 撤销系统 – 追踪文件系统变更与设置修改;单一 UI 按钮即可撤销。
  • 无需 GPU – 由于一切皆为软件渲染,助理可在没有独立显卡的机器上运行。

⚠️ 限制与待解决问题(如 README 所述)

  • 自我回音防护虽有效,但在此版本中刻意停用了在助理说话中途打断的功能,因为这高度依赖硬件。
  • 缺乏语音拼写的语言支持(阿拉伯文、中文、日文等)会回退至仅依赖音频的塑形,导致口型同步细节较少。
  • 全局热键仅在 Windows 上有效;在 macOS/Linux 上,按键通话仅在助理窗口获得焦点时有效。
  • 记忆索引大小 – 若记忆超过提示词预算,索引可能会被截断,导致助理声称“不知道”实际上已存储的事实。
  • 无 GPU 加速 – 这是刻意的,这意味着头像在高端硬件上可能看起来不如基于着色器的 3D 模型精致。
  • 依赖 Gemini Live API – 助理的反应速度与能力取决于 Gemini 服务的可用性与配额。

📚 深入了解

  • YouTube 设置视频https://www.youtube.com/@FatihMakes (README 中链接)。
  • 源代码 – 存储库本身包含提示词模板 (core/prompt.txt)、插件架构与渲染逻辑。
  • Gemini Live API 文档 – 获取 API 密钥与了解流式传输限制的外部资源。

简而言之: MARK LIV 是一款功能齐全、语音驱动的 AI 助理,增加了一个极具表现力的软件渲染人脸作为状态指示器。它建立在 Gemini Live 模型之上,可在所有主流桌面操作系统上运行,无需额外的图形依赖,并可通过简单的 Python 插件系统进行扩展。README 提供了功能、设计选择与已知怪癖的详尽概述,使其成为 AI 助理领域中真正的尖端技术项目。

相关

  • 项目
  • 项目
  • 项目
  • 项目