LYiHub/pub-local-jarvis
Windows 本地多模态 AI 桌面桌宠,支持屏幕与音频感知。
解决的问题
AI Jarvis 是一个适用于 Windows 的本地多模态桌面助手,无需将数据上传至云端即可提供实时陪伴与实用功能。它通过持续感知屏幕和系统音频,解决了 AI 助手与用户实际活动脱节的问题,从而提供上下文相关的帮助、游戏提示或教育笔记。
工作原理
该系统使用 MiniCPM-o 4.5 GGUF 模型,整合了大语言模型(LLM)、视觉模型(VPM)和音频模型(APM)。它通过 DXGI 捕获屏幕帧,通过 WASAPI 捕获系统音频,频率约为每秒一次。与简单的问答格式不同,该模型以全双工模式运行,根据当前场景判断是继续监听(LISTEN)还是提供简短、上下文感知的回应(SPEAK)。
适用人群
- 希望通过透明叠加层获得实时、非侵入式提示和互动的 游戏玩家。
- 需要自动录制课程、关键帧捕捉和 Markdown 格式知识摘要的 学生。
- 寻求隐私优先的 AI 伴侣,能够“看见”和“听见”其桌面活动的 普通 Windows 用户。
核心亮点
- 本地多模态推理:在设备上处理屏幕和音频,兼顾速度与隐私。
- 主动对话:可通过
Ctrl+M触发聊天窗口,询问当前屏幕状态相关问题。 - 课程记录:自动从在线课程生成包含关键图像和知识要点的 Markdown 笔记。
- 游戏伴侣:通过透明弹幕式聊天叠加层提供场景化提示与互动。
- 本地记忆:组织活动时间线和每日摘要,不长期存储原始屏幕或音频数据。
- 隐私模式:通过双击桌面宠物可暂停屏幕和音频感知。
相关
- 项目
- 项目
- 项目
- 项目
- 项目