FatihMakes/Mark-LI

Newest, latest and most advanced model that is able to control computers and even more. We're improving that model day by day, so follow up to know and see new models.

해결하는 문제

Mark LI는 사용자의 디지털 확장으로 작동하는 크로스플랫폼 개인용 AI 어시스턴트입니다. 실시간 음성과 시각적 상호작용을 통해 컴퓨터를 손을 떼고 제어하고 일상적인 작업을 관리할 수 있도록 도와줍니다. 간단한 플러그인 시스템을 통해 사용자가 새로운 기능을 추가할 수 있어 지속적인 수동 설정이 필요하지 않습니다.

작동 방식

Gemini Live API를 기반으로 구축되었으며, 낮은 지연 시간의 대화와 정서적 대화를 위해 네이티브 오디오 스트리밍을 사용합니다. 이로 인해 사용자의 목소리에서 감정을 감지할 수 있습니다. 사용자는 특정 폴더에 .py 파일을 드롭하여 코어 엔진을 수정하지 않고도 새로운 기능을 추가할 수 있는 플러그인 아키텍처를 통합하고 있습니다. 실시간 화면 캡처와 웹캠 비전을 시스템 제어, 웹 검색, 애플리케이션 관리용 내장 액션과 결합하여 PyQt6 기반의 HUD에서 모두 관리합니다.

대상 사용자

Windows, macOS, Linux 운영체제를 음성, 시각, 확장 가능한 플러그인을 통해 제어할 수 있는 JARVIS 스타일의 AI 어시스턴트를 찾는 사용자들입니다.

주요 기능

  • 플러그인 시스템: 플러그인 폴더에 단일 Python 파일을 드롭하여 새로운 기능을 추가할 수 있으며, 내장된 크래시 격리 기능을 제공합니다.
  • 정서적 대화: 사용자의 목소리에서 감지된 감정에 따라 대화 톤을 자동 조정합니다.
  • 수동 오디오 인식: 직접 명령과 배경 대화를 구분하여 실수로 트리거되는 것을 방지합니다.
  • 시스템 제어: 음성 기반으로 하드웨어 설정(볼륨, 밝기), 애플리케이션 실행, 데스크톱 관리가 가능합니다.
  • 시각 인식: 실시간 화면 및 웹캠 피드를 Gemini 세션에 전달하여 시각적 맥락을 제공합니다.
  • 무제한 세션: 슬라이딩 윈도우 기반의 컨텍스트 압축을 사용하여 대화의 흐름을 잃지 않고 긴 대화를 유지합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트