jeremyipark/vision-demos
Fun real-world computer vision demos!
vision‑demos – 现实世界计算机视觉演示
简介 – 一个小型的即插即用演示应用程序集合,展示了现代姿态估计和分割模型如何应用于日常活动。每个演示都位于其自己的子文件夹中,包含专门的 README、安装步骤和简短的视频风格插图。
| 演示 | 功能 | 核心模型 |
|---|---|---|
| dance_sync | 获取同一编舞的两个视频,叠加估计的身体姿态,并生成一个量化舞者同步程度的数值相似度分数。 | vitpose-plus-large |
| chin_ups | 分析某人做引体向上的视频片段,计算重复次数,并为每次重复的向上和向下阶段添加时间戳。 | vitpose-plus-large |
| rock_climbing | 将抱石墙分割成单独的岩点,识别攀岩者使用了哪些岩点及其顺序,并比较同一路线的多次尝试。 | sam3.1 (分割) + vitpose-plus-large (姿态) |
| running | 测量跑步者的步频,为每次触地添加时间戳,并计算接触时的平均膝关节形状轮廓。 | vitpose-plus-large |
工作原理
- 姿态估计由
vitpose-plus-large模型(基于 Vision-Transformer 的人体姿态检测器)执行。该模型返回每一帧的 2D 关节坐标,演示程序利用这些坐标计算计时、相似度或生物力学指标。 - 攀岩演示中的分割依赖于 Meta 的
sam3.1(Segment Anything Model) 来隔离墙上的单个攀岩岩点。 - 简单的 Python 脚本将模型输出拼接在一起,在原始视频上叠加可视化效果,并生成缩略图面板中显示的数值摘要。
快速开始
- 克隆仓库。
- 遵循您感兴趣的子目录中的每个演示的 README(例如
dance_sync/README.md)。 - 安装列出的 Python 依赖项(通常是
torch、opencv-python和 VLM 模型客户端库)。 - 通过提供的链接下载所需的模型权重(README 指向 VLM 模型中心)。
- 在您自己的视频文件上运行演示脚本。
目标受众
- 希望获得基于姿态的运动、舞蹈或运动科学分析快速具体示例的研究人员或爱好者。
- 寻找围绕相同模型构建自定义分析管道模板的开发者。
许可证
Apache‑2.0 – 免费用于商业和非商业用途,需注明出处。
相关
- 项目
- 项目
- 项目
- 项目