valentinfrlch/ha-llmvision

Visual intelligence for your home.

LLM Vision – 为 Home Assistant 提供视觉智能

是什么 – 一个让您的智能家居“看见”的。Home Assistant 集成,它将快照、视频片段或实时摄像头画面发送到多模态大语言模型(LLM)并返回自然语言描述、回答或摘要。结果将作为传感器存储,并可以在仪表板上显示或通过 Home Assistant 的 Assist 进行查询。

核心能力

  • 多模态 LLM 支持 – 支持 OpenAI, Anthropic, Google Gemini, AWS Bedrock, Azure, Groq, Ollama, Open WebUI, LocalAI 以及任何提供 OpenAI 兼容 API 的服务。
  • 图像 / 视频分析 – 根据自定义提示词(prompt)描述单张图片、视频文件、实时摄像头流,或 Frigate 事件。
  • 记忆 – 可以在不同事件中记住已识别的人、宠物和物体。
  • 时间轴 – 将每次分析的事件存储在按时间顺序排列的列表中,可以在 Home Assistant UI 的 Timeline Card 中显示。
  • 传感器更新 – 自动创建/更新实体(例如 sensor.living_room_last_seen)并包含提取的信息。

快速上手 (HACS)

  1. 通过 Home Assistant Community Store (HACS) 添加集成 – 它位于默认仓库中。
  2. 重启 Home Assistant。
  3. Settings → Devices & Services 中搜索 LLM Vision 并添加它。
  4. 将集成指向 Home Assistant 的 /media 文件夹(用于存储临时快照)。如果您在容器中运行 Home Assistant,请挂载主机文件夹到 /media
  5. 打开集成页面,点击 Add Entry,并配置您的 LLM 提供者(API 密钥、端点、模型、可选的系统提示词)。
  6. (可选) 安装提供的 Blueprint 以获得 AI 摘要的摄像头事件通知和现成的 Timeline Card。

典型工作流程

  • 运动事件触发摄像头快照(或 Frigate 记录了一段视频)。
  • LLM Vision 上传媒体文件到配置的 LLM,添加您的提示词(例如,“描述正在发生什么,并指出任何人物或宠物”),并接收文本响应。
  • 响应结果将保存到传感器中,并在启用时,追加到时间轴中。
  • 您可以通过 Home Assistant 的语音助手进行查询:“前门摄像头在下午 3 点看到了什么?”

资源

适用对象 – 希望在不编写代码的情况下添加视觉 AI 能力(安全摄像头、宠物监控、物体检测)的 Home Assistant 用户,且已经拥有 LLM API 或本地模型访问权限的用户。"},

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch