AnubhavChaturvedi-GitHub/jarvis-ai-assistant

Voice-controlled AI desktop assistant in Python. Speech recognition, text to speech, real-time web search, image generation, computer vision and WhatsApp automation, inspired by Iron Man's JARVIS.

해결하는 문제

J.A.R.V.I.S는 자연스러운 음성 인터페이스를 통해 컴퓨터 작업을 자동화하고 정보를 제공하도록 설계된 음성 제어 데스크톱 어시스턴트입니다. 사용자가 음성 명령을 통해 시스템을 제어하고 AI 기능을 사용할 수 있게 함으로써 수동 타이핑과 클릭의 필요성을 제거합니다.

작동 원리

이 시스템은 다양한 모달리티를 처리하는 교체 가능한 서브시스템의 집합으로 구축되었습니다. 중앙 진입점(jarvis.py)이 사용자 의도를 특정 모듈로 라우팅합니다:

  • 음성 처리: 커스텀 음성-텍스트 변환 엔진(NetHyTechSTT)과 음성 응답을 위한 텍스트-음성 변환 모듈을 사용합니다.
  • 추론: Brain(co_brain.py)이 대화 메모리와 언어 모델 추론을 관리합니다.
  • 기능: 전용 모듈이 실시간 웹 검색, 이미지 생성, 카메라 기반 이미지 이해(Vision) 및 데스크톱 자동화(앱 열기 및 시스템 작업 실행)를 처리합니다.
  • 통합: 브라우저 및 WhatsApp 자동화를 위해 Selenium과 PyWhatKit을 사용합니다.

대상 사용자

데스크톱용 아이언맨 스타일의 핸즈프리 AI 어시스턴트를 원하는 사용자, 새로운 기능을 확장하기 위한 모듈형 Python 기반 어시스턴트 프레임워크를 찾는 개발자.

주요 특징

  • 모듈형 아키텍처: 서브시스템이 분리되어 있어 사용자가 필요한 부분만 사용할 수 있습니다.
  • 멀티모달 기능: 음성, 텍스트, 이미지 생성 및 컴퓨터 비전을 결합합니다.
  • 오프라인 친화적: 유료 API가 필요 없는 커스텀 음성-텍스트 변환 엔진을 포함합니다.
  • 시스템 자동화: 데스크톱을 제어하고, 애플리케이션을 열고, 핸즈프리로 WhatsApp 메시지를 보낼 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트