ssrajadh/sentrysearch
Semantic search over videos using Gemini Embedding 2 or Qwen3-VL.
解决的问题
SentrySearch 允许用户在大量视频资料中进行语义搜索。无需手动逐帧浏览数小时的录像,用户只需输入自然语言描述(例如“红色卡车闯红灯”)或提供参考图像,即可找到并自动剪裁相关视频片段。
工作原理
该工具将视频文件分割为重叠的片段。这些片段通过多模态模型(Google Gemini、Alibaba DashScope 或本地 Qwen3-VL 模型)转换为向量嵌入,并存储在本地 ChromaDB 数据库中。当用户搜索时,查询会被嵌入到相同的向量空间,并使用余弦相似度与存储的视频嵌入进行匹配。系统还可使用视觉语言模型(VLM)对前几项结果进行重新排序,以提高准确性。
适用人群
专为需要快速查找特定事件而无需手动审查的大量视频资料管理者设计,例如特斯拉车主(特别是特斯拉用户)或安防录像审核人员。
主要亮点
- 多模态搜索: 支持基于文本的自然语言查询和基于图像的搜索。
- 灵活的后端: 提供基于云的 API(Gemini、DashScope)或使用 Qwen3-VL 的完全本地、私有后端。
- 异常检测: “亮点”功能可识别与索引中其他片段显著不同的统计异常片段。
- 特斯拉集成: 可将特斯拉行车记录仪文件中的遥测数据(速度、位置、时间)直接烧录到剪裁后的片段中。
- 自动剪裁: 自动从原始视频文件中提取匹配的片段并生成新剪辑。
- 生态系统集成: 与兄弟工具 SentryMerge(多摄像头拼接)和 SentryBlur(信息模糊化)无缝协作。
相关
- 项目
- 项目
- 项目
- 项目
- 项目