valentinfrlch/ha-llmvision
Visual intelligence for your home.
LLM Vision – 為 Home Assistant 提供視覺智能
是什麼 – 一個讓您的智能家居「看見」的 Home Assistant 集成。它將快照、影片片段或即時攝影機畫面發送至多模態大型語言模型(LLM)並返回自然語言描述、回答或摘要。結果會以感測器形式存儲,並可顯示在儀表板上或透過 Home Assistant 的 Assist 進行查詢。
核心能力
- 多模態 LLM 支持 – 支持 OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Groq, Ollama, Open WebUI, LocalAI 以及任何提供 OpenAI 相容 API 的服務。
- 圖像 / 影片分析 – 根據自定義提示詞(prompt)描述單張圖片、影片文件、即時攝影機串流或 Frigate 事件。
- 記憶 – 可以在不同事件中記住已識別的人、寵物和物體。
- 時間軸 – 將每次分析的事件存儲在按時間順序排列的列表中,並可透過 Home Assistant UI 的 Timeline Card 顯示。
- 感測器更新 – 自動創建/更新實體(例如
sensor.living_room_last_seen)並包含提取的信息。
快速上手 (HACS)
- 透過 Home Assistant Community Store (HACS) 添加集成 – 它位於默認倉庫中。
- 重啟 Home Assistant。
- 在 Settings → Devices & Services 中搜索 LLM Vision 並添加它。
- 將集成指向 Home Assistant 的
/media文件夾(用於存儲臨時快照)。如果您在容器中運行 Home Assistant,請掛載主機文件夾到/media。 - 開啟集成頁面,點擊 Add Entry,並配置您的 LLM 提供者(API 金鑰、端點、模型、可選的系統提示詞)。
- (可選) 安裝提供的 Blueprint 以獲得 AI 摘要的攝影機事件通知和現成的 Timeline Card。
典型工作流程
- 動態事件觸發攝影機快照(或 Frigate 記錄了片段)。
- LLM Vision 上傳媒體文件到配置的 LLM,添加您的提示詞(例如,「描述正在發生什麼,並指出任何人物或寵物"), 接收文本回應。
- 回應結果會存儲在感測器中,並在啟用時,追加到時間軸中。
- 您可以透過 Home Assistant 的語音助手進行查詢:「前門攝影機在下午 3 點看到了什麼?」
資源
- 網站與文檔 – https://llmvision.org 和 GitBook 指南 https://llm-vision.gitbook.io/getting-started
- 範例 / 畫廊 – https://llmvision.org/gallery/
- 社群 – Home Assistant 論壇討論串和 Discord 服務器(鏈接在 README 中)
- 支持 – 為該倉庫點星 (star) 或透過 BuyMeACoffee 徽章支持作者。
適用對象 – 希望在不寫代碼的情況下添加視覺 AI 能力(安全攝影機、寵物監控、物體檢測)的 Home Assistant 用戶,且已經擁有 LLM API 或本地模型訪問權限的用戶。"},
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch