valentinfrlch/ha-llmvision
Visual intelligence for your home.
LLM Vision – Home Assistant를 위한 시각적 지능
개요 – 스마트 홈을 "see"할 수 있게 해주는 Home Assistant 통합 기능입니다. 스냅샷, 비디오 클립 또는 라이브 카메라 피드를 멀티모달 대규모 언어 모델(LLM)로 보내 자연어 설명, 답변 또는 요약을 반환합니다. 결과는 센서로 저장되며 대시보드에 표시하거나 Home Assistant의 Assist를 통해 조회할 수 있습니다.
주요 기능
- 멀티모달 LLM 지원 – OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Groq, Ollama, Open WebUI, LocalAI 및 OpenAI 호환 API를 제공하는 모든 서비스와 작동합니다.
- 이미지 / 비디오 분석 – 커스텀 프롬프트를 기반으로 단일 사진, 비디오 파일, 라이브 카메라 스트림 또는 Frigate 이벤트를 설명합니다.
- 기억 – 이벤트 전반에 걸쳐 식별된 사람, 반려동물 및 물체를 기억할 수 있습니다.
- 타임라인 – 분석된 각 이벤트를 Home Assistant UI의 Timeline Card에서 표시할 수 있는 연대기적 목록으로 저장합니다.
- 센서 업데이트 – 추출된 정보를 사용하여 엔티티(예:
sensor.living_room_last_seen)를 자동으로 생성/업更新합니다.
빠른 시작 (HACS)
- Home Assistant Community Store (HACS)를 통해 통합 기능을 추가합니다 – 기본 리포지토리에 있습니다.
- Home Assistant를 재시작합니다.
- Settings → Devices & Services에서 LLM Vision을 검색하여 추가합니다.
- 통합 기능을 Home Assistant의
/media폴더로 지정합니다(임시 스냅샷 저장용). Home Assistant를 컨테이너에서 실행하는 경우, 호스트 폴더를/media에 마운트하십시오. - 통합 기능 페이지를 열고, Add Entry를 클릭하여 LLM 제공업체를 구성합니다(API 키, 엔드포인트, 모델, 선택적 시스템 프롬프트).
- (선택 사항) 제공되는 Blueprint를 설치하여 AI 요약 카메라 이벤트 알림 및 바로 사용할 수 있는 Timeline Card를 받으십시오.
일반적인 워크플로우
- 동작 이벤트가 카메라 스냅샷을 트리거합니다(또는 Frigate가 클립을 기록합니다).
- LLM Vision은 미디어를 구성된 LLM으로 업로드하고, 프롬프트를 추가합니다(예: "설명해줘, 무슨 일이 일어나고 있는지 설명하고 사람이나 반려동물의 이름을 말해줘"), 그리고 텍스트 응답을 받습니다.
- 응답은 센서에 저장되며, 활성화된 경우 타임라인에 추가됩니다.
- Home Assistant의 음성 비서인 Assist를 통해 정보를 조회할 수 있습니다: "오후 3시에 현관 카메라가 무엇을 보았나요?"
리소스
- 웹사이트 & 문서 – https://llmvision.org 및 GitBook 가이드 https://llm-vision.gitbook.io/getting-started
- 예시 / 갤러리 – https://llmvision.org/gallery/
- 커뮤니티 – Home Assistant 포럼 스레드 및 Discord 서버(링크는 README에 있습니다)
- 지원 – 리포지토리에 star를 누르거나 BuyMeACoffee 배지를 통해 작성자에게 커피를 사주세요.
대상 사용자 – 코드를 작성하지 않고 시각적 AI 기능(보안 카메라, 반려동물 모니터링, 물체 검출)을 기능을 추가하고 싶고, 이미 LLM API 또는 로컬 모델에 접근할 수 있는 Home Assistant 사용자입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch