LYiHub/pub-local-jarvis

Windows 本地多模态 AI 桌面桌宠,支持屏幕与音频感知。

解決的問題

AI Jarvis 是一款適用於 Windows 的本地多模態桌面助理,無需將資料上傳至雲端即可提供即時陪伴與實用功能。它透過持續感知螢幕與系統音訊,解決了 AI 助理與使用者實際活動脫節的問題,進而提供情境相關的協助、遊戲提示或教育筆記。

工作原理

此系統使用 MiniCPM-o 4.5 GGUF 模型,整合大型語言模型(LLM)、視覺模型(VPM)與音訊模型(APM)。它透過 DXGI 捕捉螢幕畫面,透過 WASAPI 捕捉系統音訊,頻率約每秒一次。與簡單的問答格式不同,該模型以全雙工模式運作,根據當前場景判斷是繼續聆聽(LISTEN)還是提供簡短、情境感知的回應(SPEAK)。

適用對象

  • 希望透過透明覆疊層獲得即時、非侵入式提示與互動的 玩家
  • 需要自動錄製課程、關鍵幀捕捉與 Markdown 格式知識摘要的 學生
  • 尋求注重隱私的 AI 伴侶,能「看見」與「聽見」其桌面活動的 一般 Windows 使用者

核心亮點

  • 本地多模態推理:在裝置上處理螢幕與音訊,兼顧速度與隱私。
  • 主動對話:可透過 Ctrl+M 觸發聊天視窗,詢問當前螢幕狀態相關問題。
  • 課程記錄:自動從線上課程生成包含關鍵影像與知識要點的 Markdown 記錄。
  • 遊戲夥伴:透過透明彈幕式聊天覆疊層提供情境化提示與互動。
  • 本地記憶:組織活動時間軸與每日摘要,不長期儲存原始螢幕或音訊資料。
  • 隱私模式:透過雙擊桌面寵物可暫停螢幕與音訊感知。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案