jeremyipark/vision-demos

Fun real-world computer vision demos!

vision‑demos – 現實世界電腦視覺示範

簡介 – 一個小型的即插即用示範應用程式集合,展示了現代姿態估計和分割模型如何應用於日常活動。每個示範都位於其自己的子資料夾中,包含專門的 README、安裝步驟和簡短的影片風格插圖。

示範 功能 核心模型
dance_sync 取得同一編舞的兩個影片,疊加估計的身體姿態,並生成一個量化舞者同步程度的數值相似度分數。 vitpose-plus-large
chin_ups 分析某人做引體向上的影片片段,計算重複次數,並為每次重複的向上和向下階段添加時間戳記。 vitpose-plus-large
rock_climbing 將抱石牆分割成單獨的岩點,識別攀岩者使用了哪些岩點及其順序,並比較同一路線的多次嘗試。 sam3.1 (分割) + vitpose-plus-large (姿態)
running 測量跑步者的步頻,為每次觸地添加時間戳記,並計算接觸時的平均膝關節形狀輪廓。 vitpose-plus-large

運作原理

  • 姿態估計vitpose-plus-large 模型(基於 Vision-Transformer 的人體姿態檢測器)執行。該模型返回每一幀的 2D 關節座標,示範程式利用這些座標計算計時、相似度或生物力學指標。
  • 攀岩示範中的分割依賴於 Meta 的 sam3.1 (Segment Anything Model) 來隔離牆上的單個攀岩岩點。
  • 簡單的 Python 腳本將模型輸出拼接在一起,在原始影片上疊加視覺化效果,並生成縮圖面板中顯示的數值摘要。

快速開始

  1. 複製儲存庫。
  2. 遵循您感興趣的子目錄中的每個示範的 README(例如 dance_sync/README.md)。
  3. 安裝列出的 Python 相依項目(通常是 torchopencv-python 和 VLM 模型客戶端函式庫)。
  4. 透過提供的連結下載所需的模型權重(README 指向 VLM 模型中心)。
  5. 在您自己的影片檔案上執行示範腳本。

目標受眾

  • 希望獲得基於姿態的運動、舞蹈或運動科學分析快速具體範例的研究人員或愛好者。
  • 尋找圍繞相同模型建立自訂分析管線模板的開發者。

授權條款

Apache‑2.0 – 免費用於商業和非商業用途,需註明出處。

相關

  • 專案
  • 專案
  • 專案
  • 專案