LYiHub/pub-local-jarvis
Windows 本地多模态 AI 桌面桌宠,支持屏幕与音频感知。
해결하는 문제
AI Jarvis는 클라우드에 데이터를 업로드할 필요 없이 실시간으로 동반자 기능과 실용성을 제공하는 Windows용 로컬 멀티모달 데스크톱 어시스턴트입니다. AI 어시스턴트가 사용자의 실제 활동에서 분리되어 있는 문제를 해결하기 위해, 화면과 시스템 오디오를 지속적으로 인식하여 문맥 기반의 도움, 게임 팁, 교육 노트를 제공합니다.
작동 방식
이 시스템은 MiniCPM-o 4.5 GGUF 모델을 사용하며, 대규모 언어 모델(LLM), 비전 모델(VPM), 오디오 모델(APM)을 통합합니다. 화면 프레임은 DXGI를 통해, 시스템 오디오는 WASAPI를 통해 약 1초마다 캡처합니다. 단순한 Q&A 형식이 아니라, 전체 이중 방향 모드로 작동하여 현재 장면에 따라 계속 듣기(LISTEN)를 결정하거나, 짧고 문맥에 맞는 응답을 제공하기(SPEAK)를 결정합니다.
대상 사용자
- 투명 오버레이를 통해 실시간으로 방해받지 않는 힌트와 상호작용을 원하는 게이머.
- 온라인 강의에서 자동으로 강의 기록, 키프레임 캡처, 마크다운 형식의 지식 요약이 필요한 학생.
- 데스크톱 활동을 '보거나' '들을' 수 있는 프라이버시 중심의 AI 동반자를 원하는 일반 Windows 사용자.
주요 기능
- 로컬 멀티모달 추론: 화면과 오디오를 디바이스 내에서 처리하여 속도와 프라이버시를 보장.
- 활성 대화: 현재 화면 상태에 대해 질문할 수 있는 채팅 창을
Ctrl+M으로 트리거 가능. - 강의 기록: 온라인 수업에서 키프레임 이미지와 핵심 지식 포인트를 포함한 마크다운 노트를 자동 생성.
- 게임 동반자: 투명한 버블 채팅 오버레이를 통해 장면에 맞는 팁과 상호작용 제공.
- 로컬 메모리: 원시 화면 또는 오디오 데이터를 장기간 저장하지 않고, 활동 타임라인과 일일 요약을 정리.
- 프라이버시 모드: 데스크톱 펫을 더블클릭하여 화면과 오디오 인식을 일시 중지 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트