ssrajadh/sentrysearch
Semantic search over videos using Gemini Embedding 2 or Qwen3-VL.
解決的問題
SentrySearch 允許使用者在大量影片資料中進行語意搜尋。無需手動逐幀瀏覽數小時的錄影,使用者只需輸入自然語言描述(例如「紅色卡車闖紅燈」)或提供參考影像,即可找到並自動剪裁相關的影片片段。
工作原理
該工具將影片檔案分割為重疊的片段。這些片段透過多模態模型(Google Gemini、Alibaba DashScope 或本地 Qwen3-VL 模型)轉換為向量嵌入,並儲存在本地 ChromaDB 資料庫中。當使用者搜尋時,查詢會被嵌入到相同的向量空間,並使用餘弦相似度與儲存的影片嵌入進行比對。系統還可使用視覺語言模型(VLM)對前幾項結果進行重新排序,以提升準確度。
適用對象
專為需要快速查找特定事件而無需手動審查的大量影片資料管理者設計,例如特斯拉車主(特別是特斯拉用戶)或監視錄影審核人員。
主要亮點
- 多模態搜尋: 支援基於文字的自然語言查詢和基於影像的搜尋。
- 彈性後端: 提供基於雲端的 API(Gemini、DashScope)或使用 Qwen3-VL 的完全本地、私有後端。
- 異常檢測: 「亮點」功能可識別與索引中其他片段顯著不同的統計異常片段。
- 特斯拉整合: 可將特斯拉行車記錄儀檔案中的遙測資料(速度、位置、時間)直接燒錄到剪裁後的片段中。
- 自動剪裁: 自動從原始影片檔案中提取匹配的片段並生成新剪輯。
- 生態系統整合: 與兄弟工具 SentryMerge(多攝影機拼接)和 SentryBlur(資訊模糊化)無縫協作。
相關
- 專案
- 專案
- 專案
- 專案
- 專案