valentinfrlch/ha-llmvision

Visual intelligence for your home.

LLM Vision – 為 Home Assistant 提供視覺智能

是什麼 – 一個讓您的智能家居「看見」的 Home Assistant 集成。它將快照、影片片段或即時攝影機畫面發送至多模態大型語言模型(LLM)並返回自然語言描述、回答或摘要。結果會以感測器形式存儲,並可顯示在儀表板上或透過 Home Assistant 的 Assist 進行查詢。

核心能力

  • 多模態 LLM 支持 – 支持 OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Groq, Ollama, Open WebUI, LocalAI 以及任何提供 OpenAI 相容 API 的服務。
  • 圖像 / 影片分析 – 根據自定義提示詞(prompt)描述單張圖片、影片文件、即時攝影機串流或 Frigate 事件。
  • 記憶 – 可以在不同事件中記住已識別的人、寵物和物體。
  • 時間軸 – 將每次分析的事件存儲在按時間順序排列的列表中,並可透過 Home Assistant UI 的 Timeline Card 顯示。
  • 感測器更新 – 自動創建/更新實體(例如 sensor.living_room_last_seen)並包含提取的信息。

快速上手 (HACS)

  1. 透過 Home Assistant Community Store (HACS) 添加集成 – 它位於默認倉庫中。
  2. 重啟 Home Assistant。
  3. Settings → Devices & Services 中搜索 LLM Vision 並添加它。
  4. 將集成指向 Home Assistant 的 /media 文件夾(用於存儲臨時快照)。如果您在容器中運行 Home Assistant,請掛載主機文件夾到 /media
  5. 開啟集成頁面,點擊 Add Entry,並配置您的 LLM 提供者(API 金鑰、端點、模型、可選的系統提示詞)。
  6. (可選) 安裝提供的 Blueprint 以獲得 AI 摘要的攝影機事件通知和現成的 Timeline Card。

典型工作流程

  • 動態事件觸發攝影機快照(或 Frigate 記錄了片段)。
  • LLM Vision 上傳媒體文件到配置的 LLM,添加您的提示詞(例如,「描述正在發生什麼,並指出任何人物或寵物"), 接收文本回應。
  • 回應結果會存儲在感測器中,並在啟用時,追加到時間軸中。
  • 您可以透過 Home Assistant 的語音助手進行查詢:「前門攝影機在下午 3 點看到了什麼?」

資源

適用對象 – 希望在不寫代碼的情況下添加視覺 AI 能力(安全攝影機、寵物監控、物體檢測)的 Home Assistant 用戶,且已經擁有 LLM API 或本地模型訪問權限的用戶。"},

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch