FatihMakes/Mark-LIII

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

해결하는 문제

Mark LIII는 손을 떼고 실시간 음성 상호작용과 시스템 제어가 가능한 크로스플랫폼 개인용 AI 어시스턴트입니다. 구독 서비스에 의존하지 않고 Gemini Live API를 활용하여 사용자가 Windows, macOS, Linux 컴퓨터를 음성 명령으로 제어하면서도 디지털 자율성을 유지할 수 있습니다.

작동 방식

이 프로젝트는 저지연 음성 스트리밍과 대화를 위해 Gemini 3.1 Flash Live 엔진을 사용합니다. 로컬 웨이크워드 감지기("Hey Jarvis")를 통해 오디오를 디바이스 내에서 처리하여 프라이버시를 보호하고 클라우드 비용을 줄입니다. 모듈식 아키텍처를 기반으로 하며, 스킬과 플러그인은 자체 설명 파일로 구성되어 핵심 코드를 수정하지 않고도 새로운 기능을 추가할 수 있습니다. 또한 시스템 프롬프트의 부피 증가를 방지하기 위해 로컬 검색 기반의 메모리 시스템을 구현했습니다.

대상 사용자

유료 구독 서비스에 의존하지 않고 OS 제어, 파일 관리, 다양한 웹 서비스 통합이 가능한 매우 커스터마이징 가능한 음성 기반 AI 어시스턴트를 찾는 사용자에게 적합합니다.

주요 특징

  • 손을 떼고 제어: 로컬에서 동작하는 "Hey Jarvis" 웨이크워드 감지 및 자동 절전 기능.
  • 시스템 통합: 앱 실행, 시스템 설정(음량, 밝기, WiFi) 조정, 파일 관리가 가능하며, 되돌릴 수 있는 "취소" 기능 제공.
  • 확장 가능한 플러그인 시스템: plugins 폴더에 .py 파일을 넣기만 하면 새로운 스킬을 추가 가능.
  • 시각 인식: Gemini 세션에 통합된 실시간 화면 캡처 및 웹캠 비전 기능.
  • 지속적 메모리: 전용 UI 패널을 갖춘 로컬 메모리 저장소로 저장된 개인 정보를 관리 가능.
  • 저지연: 더 빠른 첫 응답 시간을 제공하는 Gemini 3.1 Flash Live 기반.
  • 크로스플랫폼: Windows, macOS, Linux에 네이티브 지원하며 OS별 종속성 처리 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트