jeremyipark/vision-demos
Fun real-world computer vision demos!
vision‑demos – 現實世界電腦視覺示範
簡介 – 一個小型的即插即用示範應用程式集合,展示了現代姿態估計和分割模型如何應用於日常活動。每個示範都位於其自己的子資料夾中,包含專門的 README、安裝步驟和簡短的影片風格插圖。
| 示範 | 功能 | 核心模型 |
|---|---|---|
| dance_sync | 取得同一編舞的兩個影片,疊加估計的身體姿態,並生成一個量化舞者同步程度的數值相似度分數。 | vitpose-plus-large |
| chin_ups | 分析某人做引體向上的影片片段,計算重複次數,並為每次重複的向上和向下階段添加時間戳記。 | vitpose-plus-large |
| rock_climbing | 將抱石牆分割成單獨的岩點,識別攀岩者使用了哪些岩點及其順序,並比較同一路線的多次嘗試。 | sam3.1 (分割) + vitpose-plus-large (姿態) |
| running | 測量跑步者的步頻,為每次觸地添加時間戳記,並計算接觸時的平均膝關節形狀輪廓。 | vitpose-plus-large |
運作原理
- 姿態估計由
vitpose-plus-large模型(基於 Vision-Transformer 的人體姿態檢測器)執行。該模型返回每一幀的 2D 關節座標,示範程式利用這些座標計算計時、相似度或生物力學指標。 - 攀岩示範中的分割依賴於 Meta 的
sam3.1(Segment Anything Model) 來隔離牆上的單個攀岩岩點。 - 簡單的 Python 腳本將模型輸出拼接在一起,在原始影片上疊加視覺化效果,並生成縮圖面板中顯示的數值摘要。
快速開始
- 複製儲存庫。
- 遵循您感興趣的子目錄中的每個示範的 README(例如
dance_sync/README.md)。 - 安裝列出的 Python 相依項目(通常是
torch、opencv-python和 VLM 模型客戶端函式庫)。 - 透過提供的連結下載所需的模型權重(README 指向 VLM 模型中心)。
- 在您自己的影片檔案上執行示範腳本。
目標受眾
- 希望獲得基於姿態的運動、舞蹈或運動科學分析快速具體範例的研究人員或愛好者。
- 尋找圍繞相同模型建立自訂分析管線模板的開發者。
授權條款
Apache‑2.0 – 免費用於商業和非商業用途,需註明出處。
相關
- 專案
- 專案
- 專案
- 專案